Dimensionnement guide · 9 min de lecture

# Choisir une carte pour les modèles d’image et de vidéo.

Un modèle d’image n’a aucune conversation à mémoriser, il est donc dimensionné selon une règle entièrement différente de celle d’un modèle de langage — et la carte la moins chère qui le tient n’est presque jamais celle que vous voulez louer.

En bref

- **À pleine précision:** SDXL 1.0 **8.0 GB** · Stable Diffusion 3.5 Large **18.4 GB** · FLUX.1 dev **27.6 GB** · Wan 2.1 video 14B **32.2 GB** — marge d’exécution incluse
- **La ligne gênante:** Chaque carte de 24 GB du catalogue est juste en dessous de FLUX.1 dev en BF16. Le FP8 divise cela par deux et passe la barre sur toutes les cartes
- **La moins chère qui tient:** [NVIDIA L4](https://gpuserver.io/fr/gpu/nvidia-l4) à $125 par mois, FLUX.1 dev en FP8
- **Ce qu’achète une seconde carte:** Deux fois plus d’images par heure, et pas une seconde de moins sur une seule image

## Ce dont chaque modèle a besoin

Commencez par la différence qui détermine tout le reste. Un modèle de langage porte un [cache clef/valeur](https://gpuserver.io/fr/guides/vram-sizing) qui grossit à chaque jeton de contexte, ce qui explique pourquoi le même modèle 70B peut demander 40 GB ou 140 GB selon la quantité de conversation que vous conservez. Un modèle de diffusion n’a aucun cache. Il lit un prompt, débruite un latent pendant un nombre fixe d’étapes, puis oublie. Les poids sont donc presque toute la question de mémoire, et la réponse ne bouge pas quand vos prompts s’allongent.

**Mémoire nécessaire pour chaque modèle d’image et de vidéo, par précision**

| Modèle | Paramètres | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) |
|---|---|---|---|---|
| SDXL 1.0 Images fixes | 3.5 B | 8.0 GB | 4.0 GB | 2.0 GB |
| Stable Diffusion 3.5 Large Images fixes | 8 B | 18.4 GB | 9.2 GB | 4.6 GB |
| FLUX.1 dev Images fixes | 12 B | 27.6 GB | 13.8 GB | 6.9 GB |
| Wan 2.1 video 14B Vidéo, générée comme un bloc d’images | 14 B | 32.2 GB | 16.1 GB | 8.0 GB |

Les poids, plus une marge d’exécution de 15 % pour les activations, le contexte CUDA et la fragmentation de l’allocateur — la même marge que celle qu’applique le [configurateur](https://gpuserver.io/fr/configure), de sorte que vous puissiez vérifier ces chiffres par rapport à lui. Il n’y a pas de colonne contexte, car il n’y a rien à y mettre.

Deux lignes de ce tableau méritent qu’on s’y arrête, car c’est précisément là qu’un achat tourne mal.

**FLUX.1 dev en BF16 demande 27.6 GB.** C’est au-delà de chaque carte de 24 GB que nous louons, et pas assez pour paraître juste. C’est la surprise la plus fréquente dans le travail sur l’image : le modèle qui « tourne sur une 4090 partout sur Internet » tourne en réalité quantifié, et personne ne le dit.

**Wan 2.1 video 14B en BF16 demande 32.2 GB.** Cela manque une carte de 32 GB pour une fraction de gigaoctet. Notre marge est délibérément prudente et vous pouvez généralement récupérer cet écart en gardant l’encodeur de texte hors de la carte — mais vous ne devriez pas avoir à planifier un achat autour d’une erreur d’arrondi, donc la réponse honnête est que la vidéo demande 40 GB ou plus.

## Ce que tient chaque carte

Chaque machine à carte unique que nous louons, et la meilleure précision que chacune tient pour les deux modèles exigeants. La colonne bande passante est là pour le chapitre suivant ; lisez-la après avoir lu celui-ci.

**Nœuds à une seule carte, et la précision que chacun tient**

| Nœud | Mémoire de la carte | Bande passante | FLUX.1 dev | Wan 2.1 video 14B | Par mois |
|---|---|---|---|---|---|
| [NVIDIA L4](https://gpuserver.io/fr/gpu/nvidia-l4) Ada Lovelace · PCIe 5.0 | 24 GB | 300 GB/s2.4 GB/s par $ | FP8 | FP8 | $125/mois |
| [NVIDIA RTX 4090](https://gpuserver.io/fr/gpu/rtx-4090) Ada Lovelace · PCIe 5.0 | 24 GB | 1,008 GB/s5.2 GB/s par $ | FP8 | FP8 | $193/mois |
| [NVIDIA RTX A6000](https://gpuserver.io/fr/gpu/rtx-a6000) Ampere · PCIe 5.0 | 48 GB | 768 GB/s2.7 GB/s par $ | BF16 / FP16 | BF16 / FP16 | $286/mois |
| [NVIDIA RTX 5090](https://gpuserver.io/fr/gpu/rtx-5090) Blackwell · PCIe 5.0 | 32 GB | 1,792 GB/s5.3 GB/s par $ | BF16 / FP16 | FP8 | $335/mois |
| [NVIDIA A100 PCIe](https://gpuserver.io/fr/gpu/a100-40gb) Ampere · PCIe 5.0 | 40 GB | 1,555 GB/s4.0 GB/s par $ | BF16 / FP16 | BF16 / FP16 | $392/mois |
| [NVIDIA L40S](https://gpuserver.io/fr/gpu/l40s) Ada Lovelace · PCIe 5.0 | 48 GB | 864 GB/s1.2 GB/s par $ | BF16 / FP16 | BF16 / FP16 | $714/mois |
| [NVIDIA A100 PCIe](https://gpuserver.io/fr/gpu/a100-80gb) Ampere · PCIe 5.0 | 80 GB | 1,935 GB/s1.8 GB/s par $ | BF16 / FP16 | BF16 / FP16 | $1,091/mois |
| [NVIDIA H100 PCIe](https://gpuserver.io/fr/gpu/h100-pcie) Hopper · PCIe 5.0 | 80 GB | 2,000 GB/s1.4 GB/s par $ | BF16 / FP16 | BF16 / FP16 | $1,469/mois |

Le vert correspond aux poids de référence, l’ambre aux poids quantifiés. Quantifier un modèle de diffusion n’est pas le gain gratuit que c’est pour un modèle de langage : avec le même prompt et la même graine, l’image obtenue est visiblement différente, généralement un peu plus douce. C’est un bon compromis en FP8, une question de jugement à 4 bits.

Lisez la colonne des prix en partant du bas, et le constat est sans détour. [NVIDIA L4](https://gpuserver.io/fr/gpu/nvidia-l4), à $125 par mois, est la machine la moins chère que nous louons qui tient FLUX.1 dev, et ce en FP8. La moins chère qui le tient en BF16 complet est [NVIDIA RTX A6000](https://gpuserver.io/fr/gpu/rtx-a6000), à $286. Vidéo en pleine précision à partir de cette même carte.

## La colonne que tout le monde lit mal

Voici ce qui distingue le travail d’image de tout le reste sur ce site, et c’est la raison pour laquelle la carte la moins chère de ce tableau est un piège.

Quand un modèle de langage génère un jeton, il lit une fois chaque poids actif en mémoire, effectue un petit calcul avec chacun d’eux, puis écrit un seul jeton. Il recommence pour le jeton suivant, puis le suivant. La carte passe sa vie à attendre le bus mémoire, ce qui explique pourquoi nos estimations de débit pour les modèles de langage correspondent essentiellement à la bande passante divisée par les poids lus, et pourquoi la colonne bande passante est celle qui compte sur [un guide de service](https://gpuserver.io/fr/guides/serve-llama-70b).

Une étape de diffusion ne ressemble pas à cela. Les mêmes poids sont appliqués à un tenseur latent vingt à cinquante fois de suite, et chaque passe effectue une grande quantité de calcul par octet récupéré. Les poids restent résidents ; le travail, ce sont des convolutions et de l’attention sur un petit tenseur. Cela inverse la contrainte : un modèle d’image est limité par le débit de calcul tensoriel, pas par le bus mémoire. Trois choses en découlent, et toutes trois coûtent de l’argent si vous vous trompez.

### « Il tient » n’est pas « c’est rapide »

La carte d’entrée de gamme du tableau ci-dessus tient FLUX.1 dev en FP8 pour $125 par mois ; c’est un composant basse consommation conçu pour servir densément de petits modèles, pas pour pousser des pixels. La mémoire est le premier filtre, jamais le dernier.

### Une deuxième carte ne divise pas l’attente par deux

ComfyUI et les pipelines diffusers ne répartissent pas une boucle de débruitage entre plusieurs GPU comme vLLM répartit un transformer. Deux cartes font tourner deux workers : deux fois plus d’images par heure, le même nombre de secondes par image. [NVLink ne vous apporte rien ici](https://gpuserver.io/fr/guides/nvlink-vs-pcie).

### La carte de centre de données n’est pas automatiquement la bonne réponse

Pour le service de modèles de langage, une carte HBM l’emporte sur le chiffre qui décide de la tâche. Pour le travail d’image, vous achetez du débit tensoriel et de la mémoire, et les cartes conçues pour le graphisme vous en donnent davantage des deux par dollar que ne le laisse penser leur position dans notre liste de prix.

La bande passante par dollar est un indicateur indirect — approximatif — de la classe de carte que vous regardez, et dans notre catalogue elle classe [NVIDIA RTX 5090](https://gpuserver.io/fr/gpu/rtx-5090) et [NVIDIA RTX 4090](https://gpuserver.io/fr/gpu/rtx-4090) en première et deuxième position, avec une large marge. Ce n’est pas une coïncidence et nous n’essayons pas de vous convaincre d’une bonne affaire : ce sont des composants conçus exactement pour ce type de calcul, et ils se situent près du bas de notre liste de prix parce que le marché les tarife par rapport au jeu vidéo, pas par rapport aux clusters d’entraînement.

**Pourquoi il n’y a pas de colonne images par minute.** Nous publions une estimation en jetons par seconde pour les modèles de langage, parce que la formule qui la produit est défendable et que nous vous la montrons. Pour la diffusion, il n’existe pas d’équivalent que nous assumerions : le temps par image varie d’un facteur cinq selon le sampler, le nombre d’étapes, la résolution et le fait d’avoir compilé le modèle ou non, avant même que la carte n’entre en jeu. Un chiffre que nous aurions inventé pour ce tableau serait la donnée la plus citée de la page, et la moins vraie. Louez pour un mois, mesurez votre propre pipeline, et la réponse vaudra plus que n’importe quel benchmark.

## Résolution, traitement par lots et vidéo

Les poids sont fixes. Ce qui varie, c’est l’ensemble de travail, et il varie avec les pixels plutôt qu’avec les paramètres. Le latent en lui-même est négligeable — ce sont les activations qui traversent le réseau à cette résolution qui remplissent la carte.

Où va réellement la mémoire

```
latent_elements = (H / 8) * (W / 8) * C * batch
# C = 4 latent channels on SDXL, 16 on SD 3.5 and FLUX.

# 1024x1024, batch 1, SDXL:
128 * 128 * 4 * 1     = 65,536 elements   = 128 KB in FP16

# 2048x2048, batch 4, SDXL:
256 * 256 * 4 * 4     = 1,048,576         = 2 MB in FP16

# The latent is never the problem. The activations that pass through the
# network at that resolution are, and they scale by the SAME factor:
# doubling the edge quadruples the pixel count, and roughly quadruples
# the working set. Batch multiplies it linearly on top.
```

Trois conséquences pratiques, dans l’ordre où vous les rencontrerez :

1. **Le pic se situe généralement au décodage VAE, pas dans la boucle d’échantillonnage.** Le décodage ramène le latent à sa pleine résolution en une seule passe, et c’est ce moment précis qui déclenche l’erreur de dépassement de mémoire tout à la fin d’une tâche qui tournait bien depuis une minute. Le décodage en tuiles corrige cela et coûte un peu de temps.
2. **Le traitement par lots, c’est ainsi qu’on exploite une grosse carte.** Si le modèle vous laisse 20 GB de libre, quatre images à la fois en font un bien meilleur usage qu’une seule image avec de la marge — les poids sont lus une fois pour tout le lot, ce qui est le seul cas où un pipeline de diffusion se comporte comme une tâche limitée par la bande passante.
3. **La vidéo ajoute une dimension, pas un pourcentage.** Wan 2.1 video 14B génère un bloc d’images ensemble, si bien que les images multiplient le même ensemble de travail que la hauteur et la largeur multiplient déjà. C’est pourquoi un modèle vidéo à 14 milliards de paramètres demande une carte bien plus grande qu’un modèle image à 12 milliards de paramètres, et pourquoi le tableau des poids ci-dessus le sous-estime plus que toute autre ligne.

**Une règle pratique.** Reprenez le chiffre du premier tableau, puis laissez environ un tiers de la carte libre en plus, pour une image d’un mégapixel à la fois. Si vous comptez traiter par lots, montez de palier mémoire plutôt que de réduire la taille du lot — sur un engagement mensuel, le palier vous coûte un nombre fixe de dollars, tandis qu’un lot d’une seule image vous coûte du débit chaque heure de chaque jour.

## Démarrer ComfyUI

ComfyUI fait partie des images que nous pouvons préinstaller sur la machine avant sa livraison, ce qui rend cette section facultative. Si vous préférez le construire vous-même, il s’agit d’un conteneur et d’un tunnel.

Sur une machine tout juste livrée

```
$ ssh root@203.0.113.42
$ nvidia-smi --query-gpu=name,memory.total --format=csv

# Checkpoints, LoRAs, ControlNets and VAEs on the fast local NVMe.
# This directory is the reason you are renting by the month.
$ mkdir -p /scratch/comfy/models
$ df -h /scratch
```

Le serveur, lié à la boucle locale

```
$ docker run -d --name comfy --restart unless-stopped \
    --gpus all --ipc=host \
    -v /scratch/comfy:/data \
    -p 127.0.0.1:8188:8188 \
    your-comfyui-image --listen 0.0.0.0 --port 8188

# From YOUR machine, not the server: a tunnel, then a local browser tab.
$ ssh -N -L 8188:127.0.0.1:8188 root@203.0.113.42
# http://127.0.0.1:8188
```

**Notez le `127.0.0.1:` devant le port.** ComfyUI n’a ni identifiant, ni mot de passe, ni notion d’utilisateur. Publié sur une adresse publique, c’est une interface graphique vers votre GPU, votre bibliothèque de modèles et le système de fichiers sous-jacent, offerte à quiconque scanne le port — et il est scanné en quelques minutes. Liez-le à loopback et accédez-y par SSH. La [documentation](https://gpuserver.io/fr/docs) couvre le pare-feu et la première heure plus en détail.

## Ce qu’achète un mois

Si le travail d’image convient à une machine mensuelle, ce n’est pas à cause du prix du GPU. C’est à cause de la bibliothèque. Une installation ComfyUI sérieuse représente quelques centaines de gigaoctets de checkpoints, de LoRAs, de ControlNets, d’upscalers et de VAEs que vous avez constitués et ne voulez pas retélécharger.

**Le disque est inclus dans le prix, sur chaque machine à une seule carte.** 2 × 2 TB NVMe et 1 Gbit/s, sans compteur dans les deux sens — identique sur le nœud $125 et sur le $1,469. Rien n’est facturé au gigaoctet, rien ne continue d’être facturé quand la carte est inactive, et rien n’est facturé à nouveau le jour où vous retéléchargez la bibliothèque après une réinstallation.

C’est la colonne à comparer, celle que les plateformes facturées à l’heure omettent du prix affiché. Chez elles, le disque est un poste séparé, facturé au gigaoctet par mois, et il continue d’être facturé pendant que l’instance est arrêtée — ou bien vous le supprimez, et vous retéléchargez plusieurs centaines de gigaoctets la prochaine fois que vous vous y remettez.

C’est le même piège que décrit [le seuil de rentabilité horaire](https://gpuserver.io/fr/guides/monthly-vs-hourly), sous la forme qu’il prend pour le travail d’image. La facturation à la seconde paraît sûre parce que vous pouvez arrêter l’instance, et personne ne l’arrête, parce que l’arrêter, c’est perdre la bibliothèque. La vraie question n’est pas « combien d’heures vais-je générer », mais « combien d’heures cette machine doit-elle exister » — et pour quiconque possède un répertoire de modèles constitué avec soin, la réponse est : toutes. Le paiement se fait en [un seul transfert en crypto](https://gpuserver.io/fr/guides/pay-in-crypto), il n’y a pas de frais d’installation, et [nous ne vous avons pas demandé qui vous êtes](https://gpuserver.io/fr/no-kyc-gpu-server) : les prompts, les LoRAs que vous avez entraînés et le travail client que vous n’avez pas encore livré restent sur une machine dont vous seul détenez l’accès root.

## Quand ne pas louer de carte

Nous préférons que vous ne louiez pas l’une de ces machines pour le regretter ensuite : voici donc les cas où la réponse est non.

**Vous générez quelques dizaines d’images par semaine.** Un point d’accès hébergé vous coûtera quelques dollars par mois et aucun après-midi. Revenez quand la file d’attente, les limites de résolution ou les règles de contenu commenceront à décider de votre travail à votre place.

**Vous voulez le tout dernier modèle fermé.** Les services d’images les plus connus ne publient pas les poids. Aucune machine sur cette page ne les fait tourner, et aucune quantité de mémoire n’y changera rien.

**Vous voulez une image plus vite et vous envisagez des nœuds multi-GPU.** Achetez plutôt une carte unique plus rapide. Les cartes supplémentaires vous donnent des workers parallèles, et des workers parallèles valent beaucoup — mais pas pour la personne qui regarde une seule barre de progression.

**Vous n’avez pas encore arrêté votre choix de modèle.** Louez à l’heure ailleurs jusqu’à savoir si vous faites tourner SDXL 1.0 à 1024 px ou Wan 2.1 video 14B à cinq secondes le clip. Ces deux réponses sont séparées de $161 par mois, et il n’y a aucune raison de deviner.

Partout ailleurs — une bibliothèque que vous avez constituée, un pipeline que vous modifiez sans cesse, des tâches par lots qui tournent toute la nuit, ou un travail qui ne doit tout simplement pas quitter votre propre disque — une carte dédiée louée au mois est l’arrangement le moins cher et le plus tranquille. Le [configurateur](https://gpuserver.io/fr/configure) vous indique, pour chaque nœud du [catalogue](https://gpuserver.io/fr/#catalog), si le modèle que vous avez en tête tient sur une carte, avant que vous ne payiez quoi que ce soit.

## Vérifiez que votre modèle tient avant de payer.

Le configurateur indique la mémoire dont un modèle a besoin, et s’il tient sur une seule carte, pour chaque machine du catalogue.

[Ouvrir le configurateur](https://gpuserver.io/fr/configure) [Lire les guides](https://gpuserver.io/fr/guides)

## Autres guides

- [Dimensionnement · 10 min Choisir un format de quantification Ce que coûtent AWQ, GPTQ, GGUF et FP8 en mémoire, vitesse et qualité — et pourquoi le format aux poids les plus légers donne rarement le modèle le plus petit. Lire le guide](https://gpuserver.io/fr/guides/awq-vs-gptq-vs-fp8)
- [Dimensionnement · 10 min Faire tourner un modèle à mélange d’experts Le nombre total de paramètres décide de la machine, les actifs de la vitesse. Ce qu’il faut en VRAM pour DeepSeek V3 et Qwen 3 235B, et quel nœud louer. Lire le guide](https://gpuserver.io/fr/guides/mixture-of-experts)
- [Coût · 6 min Quand la location mensuelle l’emporte sur l’horaire Le seuil de rentabilité sur des chiffres réels, les trois coûts qu’un prix horaire cache jusqu’à la facture, et le piège du temps mort qui triple une estimation. Lire le guide](https://gpuserver.io/fr/guides/monthly-vs-hourly)

---

Source : https://gpuserver.io/fr/guides/gpu-for-flux-sdxl/. Ce fichier est généré à partir des mêmes données que le site ; si un chiffre ici diffère d’une page, la page fait foi et ce fichier est obsolète — la source canonique est https://gpuserver.io/.
