Расчёт · руководство · 9 мин на чтение

# Выбор карты для моделей изображений и видео.

Модели для изображений нечего помнить из диалога, поэтому её размер определяется совершенно другим правилом, чем у языковой модели, — и самая дешёвая карта, на которую она помещается, почти никогда не та карта, которую стоит арендовать.

Коротко

- **При полной точности:** SDXL 1.0 **8.0 GB** · Stable Diffusion 3.5 Large **18.4 GB** · FLUX.1 dev **27.6 GB** · Wan 2.1 video 14B **32.2 GB** — с учётом рабочего запаса
- **Неудобная строка:** Каждая карта на 24 GB в каталоге чуть-чуть не дотягивает до FLUX.1 dev в BF16. FP8 уменьшает требование вдвое и укладывается на всех них
- **Самая дешёвая, на которую она помещается:** [NVIDIA L4](https://gpuserver.io/ru/gpu/nvidia-l4) за $125 в месяц, FLUX.1 dev в FP8
- **Что даёт вторая карта:** Вдвое больше изображений в час — и ни секунды выигрыша на одном изображении

## Что нужно каждой модели

Начнём с различия, которое определяет всё остальное. Языковая модель несёт [KV-кэш](https://gpuserver.io/ru/guides/vram-sizing), который растёт с каждым токеном контекста, поэтому одна и та же модель 70B может потребовать и 40 GB, и 140 GB — в зависимости от того, сколько диалога вы храните. У диффузионной модели кэша нет вовсе. Она читает промпт, шумоподавляет латент за фиксированное число шагов — и забывает. Поэтому веса составляют почти весь вопрос памяти, и ответ не меняется от того, что ваши промпты стали длиннее.

**Память, необходимая каждой модели изображений и видео, по точности**

| Модель | Параметры | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) |
|---|---|---|---|---|
| SDXL 1.0 Статичные изображения | 3.5 B | 8.0 GB | 4.0 GB | 2.0 GB |
| Stable Diffusion 3.5 Large Статичные изображения | 8 B | 18.4 GB | 9.2 GB | 4.6 GB |
| FLUX.1 dev Статичные изображения | 12 B | 27.6 GB | 13.8 GB | 6.9 GB |
| Wan 2.1 video 14B Видео, генерируемое блоком кадров | 14 B | 32.2 GB | 16.1 GB | 8.0 GB |

Веса плюс запас в 15% на активации, контекст CUDA и фрагментацию аллокатора — тот же запас, что применяет [конфигуратор](https://gpuserver.io/ru/configure), так что вы можете сверяться с ним. Столбца контекста здесь нет, потому что в него нечего было бы поместить.

На двух строках этой таблицы стоит задержаться — именно на них чаще всего ошибаются с покупкой.

**FLUX.1 dev в BF16 требует 27.6 GB.** Это выходит за пределы любой карты на 24 GB, которую мы сдаём в аренду, — и не настолько, чтобы это ощущалось честно. Это самый частый сюрприз в работе с изображениями: модель, которая «работает на 4090 у всех в интернете», на самом деле запущена в квантованном виде, просто никто об этом не говорит.

**Wan 2.1 video 14B в BF16 требует 32.2 GB.** Это чуть-чуть не укладывается в карту на 32 GB — не хватает доли гигабайта. Наш запас намеренно консервативен, и обычно этот зазор можно отыграть, вынеся текстовый энкодер с карты — но не стоит планировать покупку исходя из ошибки округления, поэтому честный ответ таков: для видео нужно 40 GB и больше.

## Что вмещает каждая карта

Все однокарточные машины, которые мы сдаём в аренду, и лучшая точность, которую выдерживает каждая из них для двух самых требовательных моделей. Столбец пропускной способности относится к следующей главе — прочитайте его после того, как прочитаете эту.

**Однокарточные узлы и точность, которую выдерживает каждый**

| Узел | Память карты | Пропускная способность | FLUX.1 dev | Wan 2.1 video 14B | В месяц |
|---|---|---|---|---|---|
| [NVIDIA L4](https://gpuserver.io/ru/gpu/nvidia-l4) Ada Lovelace · PCIe 5.0 | 24 GB | 300 GB/s2.4 GB/s на $ | FP8 | FP8 | $125/мес |
| [NVIDIA RTX 4090](https://gpuserver.io/ru/gpu/rtx-4090) Ada Lovelace · PCIe 5.0 | 24 GB | 1,008 GB/s5.2 GB/s на $ | FP8 | FP8 | $193/мес |
| [NVIDIA RTX A6000](https://gpuserver.io/ru/gpu/rtx-a6000) Ampere · PCIe 5.0 | 48 GB | 768 GB/s2.7 GB/s на $ | BF16 / FP16 | BF16 / FP16 | $286/мес |
| [NVIDIA RTX 5090](https://gpuserver.io/ru/gpu/rtx-5090) Blackwell · PCIe 5.0 | 32 GB | 1,792 GB/s5.3 GB/s на $ | BF16 / FP16 | FP8 | $335/мес |
| [NVIDIA A100 PCIe](https://gpuserver.io/ru/gpu/a100-40gb) Ampere · PCIe 5.0 | 40 GB | 1,555 GB/s4.0 GB/s на $ | BF16 / FP16 | BF16 / FP16 | $392/мес |
| [NVIDIA L40S](https://gpuserver.io/ru/gpu/l40s) Ada Lovelace · PCIe 5.0 | 48 GB | 864 GB/s1.2 GB/s на $ | BF16 / FP16 | BF16 / FP16 | $714/мес |
| [NVIDIA A100 PCIe](https://gpuserver.io/ru/gpu/a100-80gb) Ampere · PCIe 5.0 | 80 GB | 1,935 GB/s1.8 GB/s на $ | BF16 / FP16 | BF16 / FP16 | $1,091/мес |
| [NVIDIA H100 PCIe](https://gpuserver.io/ru/gpu/h100-pcie) Hopper · PCIe 5.0 | 80 GB | 2,000 GB/s1.4 GB/s на $ | BF16 / FP16 | BF16 / FP16 | $1,469/мес |

Зелёный — это эталонные веса, жёлтый — квантованные. Квантование диффузионной модели — не бесплатный обед, каким оно бывает для языковой модели: один и тот же промпт и сид дают заметно другое изображение, обычно чуть более мягкое. В FP8 это хороший компромисс, а на 4 битах — уже вопрос личного решения.

Если читать снизу вверх по столбцу цены, картина получается прямолинейной. [NVIDIA L4](https://gpuserver.io/ru/gpu/nvidia-l4) за $125 в месяц — самая дешёвая машина, которую мы сдаём в аренду и на которую вообще помещается FLUX.1 dev — в FP8. Самая дешёвая, на которую она помещается в полном BF16, — это [NVIDIA RTX A6000](https://gpuserver.io/ru/gpu/rtx-a6000) за $286. Видео при полной точности начинается на той же карте.

## Столбец, который все читают неправильно

Вот та часть, которая отличает работу с изображениями от всего остального на этом сайте, и именно поэтому самая дешёвая карта в этой таблице — ловушка.

Когда языковая модель генерирует токен, она один раз считывает из памяти каждый активный вес, выполняет с ним небольшой объём вычислений и записывает один токен. Затем то же самое повторяется для следующего токена, и для следующего. Карта проводит всю свою жизнь в ожидании шины памяти, поэтому наши оценки пропускной способности для языковых моделей — это, по сути, пропускная способность памяти, делённая на объём считываемых весов, и поэтому столбец пропускной способности — тот, что действительно важен в [руководстве по инференсу](https://gpuserver.io/ru/guides/serve-llama-70b).

Шаг диффузии выглядит иначе. Одни и те же веса применяются к латентному тензору от двадцати до пятидесяти раз, и на каждом проходе выполняется огромный объём вычислений на каждый считанный байт. Веса остаются в памяти постоянно; работа — это свёртки и внимание над небольшим тензором. Это меняет ограничение местами: модель для изображений упирается в пропускную способность тензорных вычислений, а не в шину памяти. Отсюда следуют три вещи, и ошибка в любой из них обходится в деньги.

### «Помещается» — не значит «быстро»

Начальная карта в таблице выше вмещает FLUX.1 dev в FP8 за $125 в месяц — это маломощная карта, созданная для плотного обслуживания небольших моделей, а не для генерации пикселей. Память — это первый фильтр, но никогда не последний.

### Вторая карта не сокращает ожидание вдвое

ComfyUI и пайплайны diffusers не разбивают один цикл шумоподавления между несколькими GPU так, как vLLM разбивает трансформер. Две карты — это два воркера: вдвое больше изображений в час при тех же секундах на одно изображение. [Здесь NVLink не даёт ничего](https://gpuserver.io/ru/guides/nvlink-vs-pcie).

### Карта для дата-центров — не готовый ответ по умолчанию

Для инференса языковых моделей карта с HBM выигрывает по показателю, который решает всё. Для работы с изображениями вы платите за пропускную способность тензорных вычислений и память, а карты, спроектированные для графики, дают больше и того, и другого на доллар, чем можно подумать по их месту в нашем прайс-листе.

Пропускная способность на доллар — приблизительный, но всё же показатель — для класса карты, который вы рассматриваете, и в нашем каталоге по этому показателю [NVIDIA RTX 5090](https://gpuserver.io/ru/gpu/rtx-5090) и [NVIDIA RTX 4090](https://gpuserver.io/ru/gpu/rtx-4090) с большим отрывом занимают первое и второе место. Это не совпадение и не выгодная сделка, в которую мы вас втягиваем: это карты, спроектированные именно для такой арифметики, и они находятся в нижней части нашего прайс-листа, потому что рынок оценивает их относительно игр, а не тренировочных кластеров.

**Почему здесь нет столбца «изображений в минуту».** Для языковых моделей мы публикуем оценку токенов в секунду, потому что формула за ней прозрачна и мы показываем её вам. Для диффузии эквивалента, за который мы могли бы поручиться, не существует: секунды на изображение меняются в пять раз в зависимости от сэмплера, числа шагов, разрешения и того, скомпилирована ли модель, — и это ещё до того, как в дело вступает карта. Цифра, которую мы бы придумали для этой таблицы, стала бы самой цитируемой вещью на странице и наименее правдивой. Арендуйте на месяц, измерьте свой собственный пайплайн — и этот ответ будет стоить больше любого бенчмарка.

## Разрешение, батч и видео

Веса фиксированы. Меняется рабочий набор, и меняется он вместе с пикселями, а не с параметрами. Сам латент незначителен — карту заполняют активации, проходящие через сеть при этом разрешении.

Куда на самом деле уходит память

```
latent_elements = (H / 8) * (W / 8) * C * batch
# C = 4 latent channels on SDXL, 16 on SD 3.5 and FLUX.

# 1024x1024, batch 1, SDXL:
128 * 128 * 4 * 1     = 65,536 elements   = 128 KB in FP16

# 2048x2048, batch 4, SDXL:
256 * 256 * 4 * 4     = 1,048,576         = 2 MB in FP16

# The latent is never the problem. The activations that pass through the
# network at that resolution are, and they scale by the SAME factor:
# doubling the edge quadruples the pixel count, and roughly quadruples
# the working set. Batch multiplies it linearly on top.
```

Три практических следствия — в том порядке, в котором вы с ними столкнётесь:

1. **Пик обычно приходится на декодирование VAE, а не на цикл сэмплирования.** Декодирование разворачивает латент обратно до полного разрешения за один проход, и именно этот момент вызывает ошибку нехватки памяти в самом конце задачи, которая до этого спокойно выполнялась целую минуту. Тайловое декодирование решает проблему и стоит немного времени.
2. **Батчинг — вот как использовать большую карту по-настоящему.** Если модель оставляет свободными 20 GB, четыре изображения одновременно — куда более разумное использование этого запаса, чем одно изображение с запасом — веса считываются один раз на весь батч, и это единственный момент, где диффузионный пайплайн ведёт себя как задача, упирающаяся в пропускную способность.
3. **Видео добавляет измерение, а не проценты.** Wan 2.1 video 14B генерирует блок кадров сразу, поэтому кадры умножают тот же рабочий набор, который уже умножают высота и ширина. Именно поэтому видеомодель с 14 миллиардами параметров требует намного более крупную карту, чем модель для изображений с 12 миллиардами параметров, и именно поэтому таблица весов выше занижает эту строку сильнее всех остальных.

**Практическое правило.** Возьмите значение из первой таблицы и оставьте сверху примерно треть карты свободной — на одно изображение в мегапиксель за раз. Если планируете батчинг, лучше перейти на карту с большим объёмом памяти, чем урезать батч — при помесячной оплате более объёмный уровень стоит фиксированную сумму, а батч размером в одно изображение обходится вам в потерянную пропускную способность каждый час каждого дня.

## Запуск ComfyUI

ComfyUI — один из образов, который мы можем записать на машину ещё до её выдачи, поэтому этот раздел необязателен. Если вы предпочитаете собрать всё сами, это контейнер и туннель.

На только что выданной машине

```
$ ssh root@203.0.113.42
$ nvidia-smi --query-gpu=name,memory.total --format=csv

# Checkpoints, LoRAs, ControlNets and VAEs on the fast local NVMe.
# This directory is the reason you are renting by the month.
$ mkdir -p /scratch/comfy/models
$ df -h /scratch
```

Сервер, привязанный к loopback

```
$ docker run -d --name comfy --restart unless-stopped \
    --gpus all --ipc=host \
    -v /scratch/comfy:/data \
    -p 127.0.0.1:8188:8188 \
    your-comfyui-image --listen 0.0.0.0 --port 8188

# From YOUR machine, not the server: a tunnel, then a local browser tab.
$ ssh -N -L 8188:127.0.0.1:8188 root@203.0.113.42
# http://127.0.0.1:8188
```

**Обратите внимание на `127.0.0.1:` перед портом.** У ComfyUI нет ни логина, ни пароля, ни самого понятия пользователя. Опубликованный на публичном адресе, он превращается в графический интерфейс к вашему GPU, вашей библиотеке моделей и файловой системе под ними — доступный любому, кто просканирует порт, — а порты сканируют в течение считаных минут. Привяжите его к loopback и обращайтесь к нему через SSH. [Документация](https://gpuserver.io/ru/docs) подробно описывает настройку файрвола и первый час работы.

## Что даёт месяц аренды

Работа с изображениями подходит для помесячной машины не из-за цены GPU. Дело в библиотеке. Серьёзная установка ComfyUI — это несколько сотен гигабайт чекпоинтов, LoRA, ControlNet, апскейлеров и VAE, которые вы тщательно собрали и не хотите скачивать заново.

**Диск включён в цену на каждой однокарточной машине.** 2 × 2 TB NVMe и 1 Gbit/s, безлимитные в обоих направлениях — одинаково что на узле $125, что на узле $1,469. Здесь ничего не тарифицируется за гигабайт, ничего не продолжает списываться, пока карта простаивает, и ничего не выставляется заново в тот день, когда вы заново скачиваете библиотеку после переустановки.

Именно этот столбец стоит сравнивать, и именно его платформы с почасовой оплатой не выносят в заголовок. Там диск — отдельная строка, оплачиваемая за гигабайт в месяц, и с него продолжает списываться плата, пока инстанс остановлен — либо вы его удаляете и в следующий раз, садясь за работу, заново скачиваете несколько сотен гигабайт.

Это та же ловушка, которую описывает [почасовая точка окупаемости](https://gpuserver.io/ru/guides/monthly-vs-hourly), только в том виде, который она принимает для работы с изображениями. Посекундная тарификация выглядит безопасной, потому что инстанс можно остановить, — но его никто не останавливает, потому что остановка означает потерю библиотеки. Честный вопрос не «сколько часов я буду генерировать», а «сколько часов этой машине нужно просто существовать» — и для всех, у кого есть тщательно собранная библиотека моделей, ответ — все часы. Оплата — это [один перевод в криптовалюте](https://gpuserver.io/ru/guides/pay-in-crypto), платы за подключение нет, и [мы не спрашивали, кто вы](https://gpuserver.io/ru/no-kyc-gpu-server): промпты, обученные вами LoRA и работа для клиентов, которую вы ещё не сдали, остаются на машине, где root есть только у вас.

## Когда не стоит арендовать карту

Мы предпочитаем, чтобы вы не арендовали такую карту и потом не пожалели об этом, поэтому вот случаи, когда ответ — нет.

**Вы генерируете несколько десятков изображений в неделю.** Облачный эндпоинт обойдётся в несколько долларов в месяц и не отнимет ни одного часа. Возвращайтесь, когда очередь, ограничения разрешения или правила по контенту начнут диктовать вам, как работать.

**Вы хотите новейшую закрытую модель.** Самые известные сервисы генерации изображений не публикуют веса. Ни одна машина на этой странице их не запускает, и никакой объём памяти этого не изменит.

**Вы хотите получать одно изображение быстрее и рассматриваете многокарточные узлы.** Вместо этого купите более быструю одиночную карту. Дополнительные карты дают параллельных воркеров, а параллельные воркеры стоят немало — но не тому, кто смотрит на один-единственный прогресс-бар.

**Вы ещё не определились с моделью.** Арендуйте что-нибудь на почасовой основе, пока не поймёте, работаете ли вы с SDXL 1.0 на 1024 px или с Wan 2.1 video 14B на пятисекундных клипах. Эти два варианта отличаются на $161 в месяц, и гадать незачем.

Во всех остальных случаях — если у вас накоплена библиотека, вы постоянно меняете пайплайн, запускаете пакетные задачи на ночь или просто работа не должна покидать ваш собственный диск — выделенная карта помесячно оказывается дешевле и спокойнее. [Конфигуратор](https://gpuserver.io/ru/configure) покажет вам для каждого узла в [каталоге](https://gpuserver.io/ru/#catalog), помещается ли задуманная модель на одну карту, ещё до какой-либо оплаты.

## Проверьте, помещается ли ваша модель, прежде чем платить.

Конфигуратор показывает, сколько памяти нужно модели и помещается ли она на одну карту, для каждой машины в каталоге.

[Открыть конфигуратор](https://gpuserver.io/ru/configure) [Читать руководства](https://gpuserver.io/ru/guides)

## Другие руководства

- [Расчёт · 10 мин Выбор формата квантования Во что обходятся AWQ, GPTQ, GGUF и FP8 по памяти, скорости и качеству — и почему формат с самыми лёгкими весами редко даёт самую маленькую модель. Читать руководство](https://gpuserver.io/ru/guides/awq-vs-gptq-vs-fp8)
- [Расчёт · 10 мин Запуск модели на основе смеси экспертов Общее число параметров определяет машину, активные параметры — скорость. Сколько VRAM нужно DeepSeek V3 и Qwen 3 235B, и какой узел для них арендовать. Читать руководство](https://gpuserver.io/ru/guides/mixture-of-experts)
- [Стоимость · 6 мин Когда помесячная аренда выгоднее почасовой Точка безубыточности на реальных цифрах, три статьи расходов, которые почасовая цена скрывает до счёта, и ловушка простоя, утраивающая оценку. Читать руководство](https://gpuserver.io/ru/guides/monthly-vs-hourly)

---

Источник: https://gpuserver.io/ru/guides/gpu-for-flux-sdxl/. Этот файл формируется на основе тех же данных, что и сайт; если цифра здесь отличается от страницы сайта, приоритет у страницы, а этот файл устарел — канонический источник: https://gpuserver.io/.
