Все 6 дата-центров работают

Оплата в криптовалюте · Без проверки личности · Root-доступ через менее 5 минут

Расчёт · руководство · 9 мин на чтение

Выбор карты для моделей изображений и видео.

Модели для изображений нечего помнить из диалога, поэтому её размер определяется совершенно другим правилом, чем у языковой модели, — и самая дешёвая карта, на которую она помещается, почти никогда не та карта, которую стоит арендовать.

Коротко

При полной точности
SDXL 1.0 8.0 GB · Stable Diffusion 3.5 Large 18.4 GB · FLUX.1 dev 27.6 GB · Wan 2.1 video 14B 32.2 GB — с учётом рабочего запаса
Неудобная строка
Каждая карта на 24 GB в каталоге чуть-чуть не дотягивает до FLUX.1 dev в BF16. FP8 уменьшает требование вдвое и укладывается на всех них
Самая дешёвая, на которую она помещается
NVIDIA L4 за $125 в месяц, FLUX.1 dev в FP8
Что даёт вторая карта
Вдвое больше изображений в час — и ни секунды выигрыша на одном изображении

Что нужно каждой модели

Начнём с различия, которое определяет всё остальное. Языковая модель несёт KV-кэш, который растёт с каждым токеном контекста, поэтому одна и та же модель 70B может потребовать и 40 GB, и 140 GB — в зависимости от того, сколько диалога вы храните. У диффузионной модели кэша нет вовсе. Она читает промпт, шумоподавляет латент за фиксированное число шагов — и забывает. Поэтому веса составляют почти весь вопрос памяти, и ответ не меняется от того, что ваши промпты стали длиннее.

Память, необходимая каждой модели изображений и видео, по точности
Модель Параметры BF16 / FP16 FP8 4-bit (AWQ, GPTQ)
SDXL 1.0Статичные изображения 3.5 B 8.0 GB 4.0 GB 2.0 GB
Stable Diffusion 3.5 LargeСтатичные изображения 8 B 18.4 GB 9.2 GB 4.6 GB
FLUX.1 devСтатичные изображения 12 B 27.6 GB 13.8 GB 6.9 GB
Wan 2.1 video 14BВидео, генерируемое блоком кадров 14 B 32.2 GB 16.1 GB 8.0 GB

Веса плюс запас в 15% на активации, контекст CUDA и фрагментацию аллокатора — тот же запас, что применяет конфигуратор, так что вы можете сверяться с ним. Столбца контекста здесь нет, потому что в него нечего было бы поместить.

На двух строках этой таблицы стоит задержаться — именно на них чаще всего ошибаются с покупкой.

FLUX.1 dev в BF16 требует 27.6 GB. Это выходит за пределы любой карты на 24 GB, которую мы сдаём в аренду, — и не настолько, чтобы это ощущалось честно. Это самый частый сюрприз в работе с изображениями: модель, которая «работает на 4090 у всех в интернете», на самом деле запущена в квантованном виде, просто никто об этом не говорит.

Wan 2.1 video 14B в BF16 требует 32.2 GB. Это чуть-чуть не укладывается в карту на 32 GB — не хватает доли гигабайта. Наш запас намеренно консервативен, и обычно этот зазор можно отыграть, вынеся текстовый энкодер с карты — но не стоит планировать покупку исходя из ошибки округления, поэтому честный ответ таков: для видео нужно 40 GB и больше.

Что вмещает каждая карта

Все однокарточные машины, которые мы сдаём в аренду, и лучшая точность, которую выдерживает каждая из них для двух самых требовательных моделей. Столбец пропускной способности относится к следующей главе — прочитайте его после того, как прочитаете эту.

Однокарточные узлы и точность, которую выдерживает каждый
Узел Память карты Пропускная способность FLUX.1 dev Wan 2.1 video 14B В месяц
NVIDIA L4Ada Lovelace · PCIe 5.0 24 GB 300 GB/s2.4 GB/s на $ FP8 FP8 $125/мес
NVIDIA RTX 4090Ada Lovelace · PCIe 5.0 24 GB 1,008 GB/s5.2 GB/s на $ FP8 FP8 $193/мес
NVIDIA RTX A6000Ampere · PCIe 5.0 48 GB 768 GB/s2.7 GB/s на $ BF16 / FP16 BF16 / FP16 $286/мес
NVIDIA RTX 5090Blackwell · PCIe 5.0 32 GB 1,792 GB/s5.3 GB/s на $ BF16 / FP16 FP8 $335/мес
NVIDIA A100 PCIeAmpere · PCIe 5.0 40 GB 1,555 GB/s4.0 GB/s на $ BF16 / FP16 BF16 / FP16 $392/мес
NVIDIA L40SAda Lovelace · PCIe 5.0 48 GB 864 GB/s1.2 GB/s на $ BF16 / FP16 BF16 / FP16 $714/мес
NVIDIA A100 PCIeAmpere · PCIe 5.0 80 GB 1,935 GB/s1.8 GB/s на $ BF16 / FP16 BF16 / FP16 $1,091/мес
NVIDIA H100 PCIeHopper · PCIe 5.0 80 GB 2,000 GB/s1.4 GB/s на $ BF16 / FP16 BF16 / FP16 $1,469/мес

Зелёный — это эталонные веса, жёлтый — квантованные. Квантование диффузионной модели — не бесплатный обед, каким оно бывает для языковой модели: один и тот же промпт и сид дают заметно другое изображение, обычно чуть более мягкое. В FP8 это хороший компромисс, а на 4 битах — уже вопрос личного решения.

Если читать снизу вверх по столбцу цены, картина получается прямолинейной. NVIDIA L4 за $125 в месяц — самая дешёвая машина, которую мы сдаём в аренду и на которую вообще помещается FLUX.1 dev — в FP8. Самая дешёвая, на которую она помещается в полном BF16, — это NVIDIA RTX A6000 за $286. Видео при полной точности начинается на той же карте.

Столбец, который все читают неправильно

Вот та часть, которая отличает работу с изображениями от всего остального на этом сайте, и именно поэтому самая дешёвая карта в этой таблице — ловушка.

Когда языковая модель генерирует токен, она один раз считывает из памяти каждый активный вес, выполняет с ним небольшой объём вычислений и записывает один токен. Затем то же самое повторяется для следующего токена, и для следующего. Карта проводит всю свою жизнь в ожидании шины памяти, поэтому наши оценки пропускной способности для языковых моделей — это, по сути, пропускная способность памяти, делённая на объём считываемых весов, и поэтому столбец пропускной способности — тот, что действительно важен в руководстве по инференсу.

Шаг диффузии выглядит иначе. Одни и те же веса применяются к латентному тензору от двадцати до пятидесяти раз, и на каждом проходе выполняется огромный объём вычислений на каждый считанный байт. Веса остаются в памяти постоянно; работа — это свёртки и внимание над небольшим тензором. Это меняет ограничение местами: модель для изображений упирается в пропускную способность тензорных вычислений, а не в шину памяти. Отсюда следуют три вещи, и ошибка в любой из них обходится в деньги.

«Помещается» — не значит «быстро»

Начальная карта в таблице выше вмещает FLUX.1 dev в FP8 за $125 в месяц — это маломощная карта, созданная для плотного обслуживания небольших моделей, а не для генерации пикселей. Память — это первый фильтр, но никогда не последний.

Вторая карта не сокращает ожидание вдвое

ComfyUI и пайплайны diffusers не разбивают один цикл шумоподавления между несколькими GPU так, как vLLM разбивает трансформер. Две карты — это два воркера: вдвое больше изображений в час при тех же секундах на одно изображение. Здесь NVLink не даёт ничего.

Карта для дата-центров — не готовый ответ по умолчанию

Для инференса языковых моделей карта с HBM выигрывает по показателю, который решает всё. Для работы с изображениями вы платите за пропускную способность тензорных вычислений и память, а карты, спроектированные для графики, дают больше и того, и другого на доллар, чем можно подумать по их месту в нашем прайс-листе.

Пропускная способность на доллар — приблизительный, но всё же показатель — для класса карты, который вы рассматриваете, и в нашем каталоге по этому показателю NVIDIA RTX 5090 и NVIDIA RTX 4090 с большим отрывом занимают первое и второе место. Это не совпадение и не выгодная сделка, в которую мы вас втягиваем: это карты, спроектированные именно для такой арифметики, и они находятся в нижней части нашего прайс-листа, потому что рынок оценивает их относительно игр, а не тренировочных кластеров.

Почему здесь нет столбца «изображений в минуту». Для языковых моделей мы публикуем оценку токенов в секунду, потому что формула за ней прозрачна и мы показываем её вам. Для диффузии эквивалента, за который мы могли бы поручиться, не существует: секунды на изображение меняются в пять раз в зависимости от сэмплера, числа шагов, разрешения и того, скомпилирована ли модель, — и это ещё до того, как в дело вступает карта. Цифра, которую мы бы придумали для этой таблицы, стала бы самой цитируемой вещью на странице и наименее правдивой. Арендуйте на месяц, измерьте свой собственный пайплайн — и этот ответ будет стоить больше любого бенчмарка.

Разрешение, батч и видео

Веса фиксированы. Меняется рабочий набор, и меняется он вместе с пикселями, а не с параметрами. Сам латент незначителен — карту заполняют активации, проходящие через сеть при этом разрешении.

Куда на самом деле уходит память
latent_elements = (H / 8) * (W / 8) * C * batch
# C = 4 latent channels on SDXL, 16 on SD 3.5 and FLUX.

# 1024x1024, batch 1, SDXL:
128 * 128 * 4 * 1     = 65,536 elements   = 128 KB in FP16

# 2048x2048, batch 4, SDXL:
256 * 256 * 4 * 4     = 1,048,576         = 2 MB in FP16

# The latent is never the problem. The activations that pass through the
# network at that resolution are, and they scale by the SAME factor:
# doubling the edge quadruples the pixel count, and roughly quadruples
# the working set. Batch multiplies it linearly on top.

Три практических следствия — в том порядке, в котором вы с ними столкнётесь:

  1. Пик обычно приходится на декодирование VAE, а не на цикл сэмплирования. Декодирование разворачивает латент обратно до полного разрешения за один проход, и именно этот момент вызывает ошибку нехватки памяти в самом конце задачи, которая до этого спокойно выполнялась целую минуту. Тайловое декодирование решает проблему и стоит немного времени.
  2. Батчинг — вот как использовать большую карту по-настоящему. Если модель оставляет свободными 20 GB, четыре изображения одновременно — куда более разумное использование этого запаса, чем одно изображение с запасом — веса считываются один раз на весь батч, и это единственный момент, где диффузионный пайплайн ведёт себя как задача, упирающаяся в пропускную способность.
  3. Видео добавляет измерение, а не проценты. Wan 2.1 video 14B генерирует блок кадров сразу, поэтому кадры умножают тот же рабочий набор, который уже умножают высота и ширина. Именно поэтому видеомодель с 14 миллиардами параметров требует намного более крупную карту, чем модель для изображений с 12 миллиардами параметров, и именно поэтому таблица весов выше занижает эту строку сильнее всех остальных.
Практическое правило. Возьмите значение из первой таблицы и оставьте сверху примерно треть карты свободной — на одно изображение в мегапиксель за раз. Если планируете батчинг, лучше перейти на карту с большим объёмом памяти, чем урезать батч — при помесячной оплате более объёмный уровень стоит фиксированную сумму, а батч размером в одно изображение обходится вам в потерянную пропускную способность каждый час каждого дня.

Запуск ComfyUI

ComfyUI — один из образов, который мы можем записать на машину ещё до её выдачи, поэтому этот раздел необязателен. Если вы предпочитаете собрать всё сами, это контейнер и туннель.

На только что выданной машине
$ ssh root@203.0.113.42
$ nvidia-smi --query-gpu=name,memory.total --format=csv

# Checkpoints, LoRAs, ControlNets and VAEs on the fast local NVMe.
# This directory is the reason you are renting by the month.
$ mkdir -p /scratch/comfy/models
$ df -h /scratch
Сервер, привязанный к loopback
$ docker run -d --name comfy --restart unless-stopped \
    --gpus all --ipc=host \
    -v /scratch/comfy:/data \
    -p 127.0.0.1:8188:8188 \
    your-comfyui-image --listen 0.0.0.0 --port 8188

# From YOUR machine, not the server: a tunnel, then a local browser tab.
$ ssh -N -L 8188:127.0.0.1:8188 root@203.0.113.42
# http://127.0.0.1:8188
Обратите внимание на 127.0.0.1: перед портом. У ComfyUI нет ни логина, ни пароля, ни самого понятия пользователя. Опубликованный на публичном адресе, он превращается в графический интерфейс к вашему GPU, вашей библиотеке моделей и файловой системе под ними — доступный любому, кто просканирует порт, — а порты сканируют в течение считаных минут. Привяжите его к loopback и обращайтесь к нему через SSH. Документация подробно описывает настройку файрвола и первый час работы.

Что даёт месяц аренды

Работа с изображениями подходит для помесячной машины не из-за цены GPU. Дело в библиотеке. Серьёзная установка ComfyUI — это несколько сотен гигабайт чекпоинтов, LoRA, ControlNet, апскейлеров и VAE, которые вы тщательно собрали и не хотите скачивать заново.

Диск включён в цену на каждой однокарточной машине. 2 × 2 TB NVMe и 1 Gbit/s, безлимитные в обоих направлениях — одинаково что на узле $125, что на узле $1,469. Здесь ничего не тарифицируется за гигабайт, ничего не продолжает списываться, пока карта простаивает, и ничего не выставляется заново в тот день, когда вы заново скачиваете библиотеку после переустановки.

Именно этот столбец стоит сравнивать, и именно его платформы с почасовой оплатой не выносят в заголовок. Там диск — отдельная строка, оплачиваемая за гигабайт в месяц, и с него продолжает списываться плата, пока инстанс остановлен — либо вы его удаляете и в следующий раз, садясь за работу, заново скачиваете несколько сотен гигабайт.

Это та же ловушка, которую описывает почасовая точка окупаемости, только в том виде, который она принимает для работы с изображениями. Посекундная тарификация выглядит безопасной, потому что инстанс можно остановить, — но его никто не останавливает, потому что остановка означает потерю библиотеки. Честный вопрос не «сколько часов я буду генерировать», а «сколько часов этой машине нужно просто существовать» — и для всех, у кого есть тщательно собранная библиотека моделей, ответ — все часы. Оплата — это один перевод в криптовалюте, платы за подключение нет, и мы не спрашивали, кто вы: промпты, обученные вами LoRA и работа для клиентов, которую вы ещё не сдали, остаются на машине, где root есть только у вас.

Когда не стоит арендовать карту

Мы предпочитаем, чтобы вы не арендовали такую карту и потом не пожалели об этом, поэтому вот случаи, когда ответ — нет.

Вы генерируете несколько десятков изображений в неделю. Облачный эндпоинт обойдётся в несколько долларов в месяц и не отнимет ни одного часа. Возвращайтесь, когда очередь, ограничения разрешения или правила по контенту начнут диктовать вам, как работать.

Вы хотите новейшую закрытую модель. Самые известные сервисы генерации изображений не публикуют веса. Ни одна машина на этой странице их не запускает, и никакой объём памяти этого не изменит.

Вы хотите получать одно изображение быстрее и рассматриваете многокарточные узлы. Вместо этого купите более быструю одиночную карту. Дополнительные карты дают параллельных воркеров, а параллельные воркеры стоят немало — но не тому, кто смотрит на один-единственный прогресс-бар.

Вы ещё не определились с моделью. Арендуйте что-нибудь на почасовой основе, пока не поймёте, работаете ли вы с SDXL 1.0 на 1024 px или с Wan 2.1 video 14B на пятисекундных клипах. Эти два варианта отличаются на $161 в месяц, и гадать незачем.

Во всех остальных случаях — если у вас накоплена библиотека, вы постоянно меняете пайплайн, запускаете пакетные задачи на ночь или просто работа не должна покидать ваш собственный диск — выделенная карта помесячно оказывается дешевле и спокойнее. Конфигуратор покажет вам для каждого узла в каталоге, помещается ли задуманная модель на одну карту, ещё до какой-либо оплаты.

Проверьте, помещается ли ваша модель, прежде чем платить.

Конфигуратор показывает, сколько памяти нужно модели и помещается ли она на одну карту, для каждой машины в каталоге.

Войти

Консоль, инвойсы и внеполосный доступ.

Ещё нет аккаунта?

Отдельной регистрации нет. Ваш аккаунт создаётся, когда вы оформляете первый заказ — email и пароль вы указываете на шаге оплаты, и консоль открыта уже к моменту готовности машины.

Настроить сервер

Language