Выбор карты для моделей изображений и видео.
Модели для изображений нечего помнить из диалога, поэтому её размер определяется совершенно другим правилом, чем у языковой модели, — и самая дешёвая карта, на которую она помещается, почти никогда не та карта, которую стоит арендовать.
Коротко
- При полной точности
- SDXL 1.0 8.0 GB · Stable Diffusion 3.5 Large 18.4 GB · FLUX.1 dev 27.6 GB · Wan 2.1 video 14B 32.2 GB — с учётом рабочего запаса
- Неудобная строка
- Каждая карта на 24 GB в каталоге чуть-чуть не дотягивает до FLUX.1 dev в BF16. FP8 уменьшает требование вдвое и укладывается на всех них
- Самая дешёвая, на которую она помещается
- NVIDIA L4 за $125 в месяц, FLUX.1 dev в FP8
- Что даёт вторая карта
- Вдвое больше изображений в час — и ни секунды выигрыша на одном изображении
Что нужно каждой модели
Начнём с различия, которое определяет всё остальное. Языковая модель несёт KV-кэш, который растёт с каждым токеном контекста, поэтому одна и та же модель 70B может потребовать и 40 GB, и 140 GB — в зависимости от того, сколько диалога вы храните. У диффузионной модели кэша нет вовсе. Она читает промпт, шумоподавляет латент за фиксированное число шагов — и забывает. Поэтому веса составляют почти весь вопрос памяти, и ответ не меняется от того, что ваши промпты стали длиннее.
| Модель | Параметры | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) |
|---|---|---|---|---|
| SDXL 1.0 | 3.5 B | 8.0 GB | 4.0 GB | 2.0 GB |
| Stable Diffusion 3.5 Large | 8 B | 18.4 GB | 9.2 GB | 4.6 GB |
| FLUX.1 dev | 12 B | 27.6 GB | 13.8 GB | 6.9 GB |
| Wan 2.1 video 14B | 14 B | 32.2 GB | 16.1 GB | 8.0 GB |
Веса плюс запас в 15% на активации, контекст CUDA и фрагментацию аллокатора — тот же запас, что применяет конфигуратор, так что вы можете сверяться с ним. Столбца контекста здесь нет, потому что в него нечего было бы поместить.
На двух строках этой таблицы стоит задержаться — именно на них чаще всего ошибаются с покупкой.
FLUX.1 dev в BF16 требует 27.6 GB. Это выходит за пределы любой карты на 24 GB, которую мы сдаём в аренду, — и не настолько, чтобы это ощущалось честно. Это самый частый сюрприз в работе с изображениями: модель, которая «работает на 4090 у всех в интернете», на самом деле запущена в квантованном виде, просто никто об этом не говорит.
Wan 2.1 video 14B в BF16 требует 32.2 GB. Это чуть-чуть не укладывается в карту на 32 GB — не хватает доли гигабайта. Наш запас намеренно консервативен, и обычно этот зазор можно отыграть, вынеся текстовый энкодер с карты — но не стоит планировать покупку исходя из ошибки округления, поэтому честный ответ таков: для видео нужно 40 GB и больше.
Что вмещает каждая карта
Все однокарточные машины, которые мы сдаём в аренду, и лучшая точность, которую выдерживает каждая из них для двух самых требовательных моделей. Столбец пропускной способности относится к следующей главе — прочитайте его после того, как прочитаете эту.
| Узел | Память карты | Пропускная способность | FLUX.1 dev | Wan 2.1 video 14B | В месяц |
|---|---|---|---|---|---|
| NVIDIA L4 | 24 GB | 300 GB/s | FP8 | FP8 | $125/мес |
| NVIDIA RTX 4090 | 24 GB | 1,008 GB/s | FP8 | FP8 | $193/мес |
| NVIDIA RTX A6000 | 48 GB | 768 GB/s | BF16 / FP16 | BF16 / FP16 | $286/мес |
| NVIDIA RTX 5090 | 32 GB | 1,792 GB/s | BF16 / FP16 | FP8 | $335/мес |
| NVIDIA A100 PCIe | 40 GB | 1,555 GB/s | BF16 / FP16 | BF16 / FP16 | $392/мес |
| NVIDIA L40S | 48 GB | 864 GB/s | BF16 / FP16 | BF16 / FP16 | $714/мес |
| NVIDIA A100 PCIe | 80 GB | 1,935 GB/s | BF16 / FP16 | BF16 / FP16 | $1,091/мес |
| NVIDIA H100 PCIe | 80 GB | 2,000 GB/s | BF16 / FP16 | BF16 / FP16 | $1,469/мес |
Зелёный — это эталонные веса, жёлтый — квантованные. Квантование диффузионной модели — не бесплатный обед, каким оно бывает для языковой модели: один и тот же промпт и сид дают заметно другое изображение, обычно чуть более мягкое. В FP8 это хороший компромисс, а на 4 битах — уже вопрос личного решения.
Если читать снизу вверх по столбцу цены, картина получается прямолинейной. NVIDIA L4 за $125 в месяц — самая дешёвая машина, которую мы сдаём в аренду и на которую вообще помещается FLUX.1 dev — в FP8. Самая дешёвая, на которую она помещается в полном BF16, — это NVIDIA RTX A6000 за $286. Видео при полной точности начинается на той же карте.
Столбец, который все читают неправильно
Вот та часть, которая отличает работу с изображениями от всего остального на этом сайте, и именно поэтому самая дешёвая карта в этой таблице — ловушка.
Когда языковая модель генерирует токен, она один раз считывает из памяти каждый активный вес, выполняет с ним небольшой объём вычислений и записывает один токен. Затем то же самое повторяется для следующего токена, и для следующего. Карта проводит всю свою жизнь в ожидании шины памяти, поэтому наши оценки пропускной способности для языковых моделей — это, по сути, пропускная способность памяти, делённая на объём считываемых весов, и поэтому столбец пропускной способности — тот, что действительно важен в руководстве по инференсу.
Шаг диффузии выглядит иначе. Одни и те же веса применяются к латентному тензору от двадцати до пятидесяти раз, и на каждом проходе выполняется огромный объём вычислений на каждый считанный байт. Веса остаются в памяти постоянно; работа — это свёртки и внимание над небольшим тензором. Это меняет ограничение местами: модель для изображений упирается в пропускную способность тензорных вычислений, а не в шину памяти. Отсюда следуют три вещи, и ошибка в любой из них обходится в деньги.
«Помещается» — не значит «быстро»
Начальная карта в таблице выше вмещает FLUX.1 dev в FP8 за $125 в месяц — это маломощная карта, созданная для плотного обслуживания небольших моделей, а не для генерации пикселей. Память — это первый фильтр, но никогда не последний.
Вторая карта не сокращает ожидание вдвое
ComfyUI и пайплайны diffusers не разбивают один цикл шумоподавления между несколькими GPU так, как vLLM разбивает трансформер. Две карты — это два воркера: вдвое больше изображений в час при тех же секундах на одно изображение. Здесь NVLink не даёт ничего.
Карта для дата-центров — не готовый ответ по умолчанию
Для инференса языковых моделей карта с HBM выигрывает по показателю, который решает всё. Для работы с изображениями вы платите за пропускную способность тензорных вычислений и память, а карты, спроектированные для графики, дают больше и того, и другого на доллар, чем можно подумать по их месту в нашем прайс-листе.
Пропускная способность на доллар — приблизительный, но всё же показатель — для класса карты, который вы рассматриваете, и в нашем каталоге по этому показателю NVIDIA RTX 5090 и NVIDIA RTX 4090 с большим отрывом занимают первое и второе место. Это не совпадение и не выгодная сделка, в которую мы вас втягиваем: это карты, спроектированные именно для такой арифметики, и они находятся в нижней части нашего прайс-листа, потому что рынок оценивает их относительно игр, а не тренировочных кластеров.
Разрешение, батч и видео
Веса фиксированы. Меняется рабочий набор, и меняется он вместе с пикселями, а не с параметрами. Сам латент незначителен — карту заполняют активации, проходящие через сеть при этом разрешении.
latent_elements = (H / 8) * (W / 8) * C * batch
# C = 4 latent channels on SDXL, 16 on SD 3.5 and FLUX.
# 1024x1024, batch 1, SDXL:
128 * 128 * 4 * 1 = 65,536 elements = 128 KB in FP16
# 2048x2048, batch 4, SDXL:
256 * 256 * 4 * 4 = 1,048,576 = 2 MB in FP16
# The latent is never the problem. The activations that pass through the
# network at that resolution are, and they scale by the SAME factor:
# doubling the edge quadruples the pixel count, and roughly quadruples
# the working set. Batch multiplies it linearly on top.
Три практических следствия — в том порядке, в котором вы с ними столкнётесь:
- Пик обычно приходится на декодирование VAE, а не на цикл сэмплирования. Декодирование разворачивает латент обратно до полного разрешения за один проход, и именно этот момент вызывает ошибку нехватки памяти в самом конце задачи, которая до этого спокойно выполнялась целую минуту. Тайловое декодирование решает проблему и стоит немного времени.
- Батчинг — вот как использовать большую карту по-настоящему. Если модель оставляет свободными 20 GB, четыре изображения одновременно — куда более разумное использование этого запаса, чем одно изображение с запасом — веса считываются один раз на весь батч, и это единственный момент, где диффузионный пайплайн ведёт себя как задача, упирающаяся в пропускную способность.
- Видео добавляет измерение, а не проценты. Wan 2.1 video 14B генерирует блок кадров сразу, поэтому кадры умножают тот же рабочий набор, который уже умножают высота и ширина. Именно поэтому видеомодель с 14 миллиардами параметров требует намного более крупную карту, чем модель для изображений с 12 миллиардами параметров, и именно поэтому таблица весов выше занижает эту строку сильнее всех остальных.
Запуск ComfyUI
ComfyUI — один из образов, который мы можем записать на машину ещё до её выдачи, поэтому этот раздел необязателен. Если вы предпочитаете собрать всё сами, это контейнер и туннель.
$ ssh root@203.0.113.42
$ nvidia-smi --query-gpu=name,memory.total --format=csv
# Checkpoints, LoRAs, ControlNets and VAEs on the fast local NVMe.
# This directory is the reason you are renting by the month.
$ mkdir -p /scratch/comfy/models
$ df -h /scratch
$ docker run -d --name comfy --restart unless-stopped \
--gpus all --ipc=host \
-v /scratch/comfy:/data \
-p 127.0.0.1:8188:8188 \
your-comfyui-image --listen 0.0.0.0 --port 8188
# From YOUR machine, not the server: a tunnel, then a local browser tab.
$ ssh -N -L 8188:127.0.0.1:8188 root@203.0.113.42
# http://127.0.0.1:8188
127.0.0.1: перед портом.
У ComfyUI нет ни логина, ни пароля, ни самого понятия пользователя. Опубликованный на публичном адресе, он превращается в графический интерфейс к вашему GPU, вашей библиотеке моделей и файловой системе под ними — доступный любому, кто просканирует порт, — а порты сканируют в течение считаных минут. Привяжите его к loopback и обращайтесь к нему через SSH. Документация подробно описывает настройку файрвола и первый час работы.
Что даёт месяц аренды
Работа с изображениями подходит для помесячной машины не из-за цены GPU. Дело в библиотеке. Серьёзная установка ComfyUI — это несколько сотен гигабайт чекпоинтов, LoRA, ControlNet, апскейлеров и VAE, которые вы тщательно собрали и не хотите скачивать заново.
Именно этот столбец стоит сравнивать, и именно его платформы с почасовой оплатой не выносят в заголовок. Там диск — отдельная строка, оплачиваемая за гигабайт в месяц, и с него продолжает списываться плата, пока инстанс остановлен — либо вы его удаляете и в следующий раз, садясь за работу, заново скачиваете несколько сотен гигабайт.
Это та же ловушка, которую описывает почасовая точка окупаемости, только в том виде, который она принимает для работы с изображениями. Посекундная тарификация выглядит безопасной, потому что инстанс можно остановить, — но его никто не останавливает, потому что остановка означает потерю библиотеки. Честный вопрос не «сколько часов я буду генерировать», а «сколько часов этой машине нужно просто существовать» — и для всех, у кого есть тщательно собранная библиотека моделей, ответ — все часы. Оплата — это один перевод в криптовалюте, платы за подключение нет, и мы не спрашивали, кто вы: промпты, обученные вами LoRA и работа для клиентов, которую вы ещё не сдали, остаются на машине, где root есть только у вас.
Когда не стоит арендовать карту
Мы предпочитаем, чтобы вы не арендовали такую карту и потом не пожалели об этом, поэтому вот случаи, когда ответ — нет.
Вы генерируете несколько десятков изображений в неделю. Облачный эндпоинт обойдётся в несколько долларов в месяц и не отнимет ни одного часа. Возвращайтесь, когда очередь, ограничения разрешения или правила по контенту начнут диктовать вам, как работать.
Вы хотите новейшую закрытую модель. Самые известные сервисы генерации изображений не публикуют веса. Ни одна машина на этой странице их не запускает, и никакой объём памяти этого не изменит.
Вы хотите получать одно изображение быстрее и рассматриваете многокарточные узлы. Вместо этого купите более быструю одиночную карту. Дополнительные карты дают параллельных воркеров, а параллельные воркеры стоят немало — но не тому, кто смотрит на один-единственный прогресс-бар.
Вы ещё не определились с моделью. Арендуйте что-нибудь на почасовой основе, пока не поймёте, работаете ли вы с SDXL 1.0 на 1024 px или с Wan 2.1 video 14B на пятисекундных клипах. Эти два варианта отличаются на $161 в месяц, и гадать незачем.
Во всех остальных случаях — если у вас накоплена библиотека, вы постоянно меняете пайплайн, запускаете пакетные задачи на ночь или просто работа не должна покидать ваш собственный диск — выделенная карта помесячно оказывается дешевле и спокойнее. Конфигуратор покажет вам для каждого узла в каталоге, помещается ли задуманная модель на одну карту, ещё до какой-либо оплаты.
Проверьте, помещается ли ваша модель, прежде чем платить.
Конфигуратор показывает, сколько памяти нужно модели и помещается ли она на одну карту, для каждой машины в каталоге.
Другие руководства
- Расчёт · 10 мин
Выбор формата квантования
Во что обходятся AWQ, GPTQ, GGUF и FP8 по памяти, скорости и качеству — и почему формат с самыми лёгкими весами редко даёт самую маленькую модель.
Читать руководство - Расчёт · 10 мин
Запуск модели на основе смеси экспертов
Общее число параметров определяет машину, активные параметры — скорость. Сколько VRAM нужно DeepSeek V3 и Qwen 3 235B, и какой узел для них арендовать.
Читать руководство - Стоимость · 6 мин
Когда помесячная аренда выгоднее почасовой
Точка безубыточности на реальных цифрах, три статьи расходов, которые почасовая цена скрывает до счёта, и ловушка простоя, утраивающая оценку.
Читать руководство