Scegliere una scheda per i modelli di immagini e video.
Un modello immagine non ha una conversazione da ricordare, quindi viene dimensionato secondo una regola completamente diversa rispetto a un modello linguistico — e la scheda più economica che lo contiene non è quasi mai quella che conviene noleggiare.
La risposta breve
- A piena precisione
- SDXL 1.0 8.0 GB · Stable Diffusion 3.5 Large 18.4 GB · FLUX.1 dev 27.6 GB · Wan 2.1 video 14B 32.2 GB — margine di runtime incluso
- La riga scomoda
- Ogni scheda da 24 GB nel catalogo è appena sotto FLUX.1 dev in BF16. Il FP8 lo dimezza, e a quel punto ci stanno tutte quante
- La più economica che lo contiene
- NVIDIA L4 a $125 al mese, FLUX.1 dev in FP8
- Cosa offre una seconda scheda
- Il doppio delle immagini all’ora, e nemmeno un secondo in meno su una singola immagine
Cosa serve a ciascun modello
Si parta dalla differenza che decide tutto il resto. Un modello linguistico porta con sé una cache key/value che cresce a ogni token di contesto, motivo per cui lo stesso modello 70B può richiedere 40 GB o 140 GB a seconda di quanta conversazione si conserva. Un modello di diffusione non ha alcuna cache. Legge un prompt, esegue il denoising di un latente per un numero fisso di passi, e dimentica. I pesi sono quindi quasi tutta la questione della memoria, e la risposta non cambia quando i suoi prompt si allungano.
| Modello | Parametri | BF16 / FP16 | FP8 | 4-bit (AWQ, GPTQ) |
|---|---|---|---|---|
| SDXL 1.0 | 3.5 B | 8.0 GB | 4.0 GB | 2.0 GB |
| Stable Diffusion 3.5 Large | 8 B | 18.4 GB | 9.2 GB | 4.6 GB |
| FLUX.1 dev | 12 B | 27.6 GB | 13.8 GB | 6.9 GB |
| Wan 2.1 video 14B | 14 B | 32.2 GB | 16.1 GB | 8.0 GB |
Pesi più un margine di runtime del 15% per attivazioni, contesto CUDA e frammentazione dell’allocatore — lo stesso margine applicato dal configuratore, così può verificare questi dati rispetto ad esso. Non c’è una colonna del contesto perché non c’è nulla da mettervi.
Due righe di quella tabella meritano di essere osservate con attenzione, perché sono esattamente dove un acquisto va storto.
FLUX.1 dev in BF16 richiede 27.6 GB. Supera ogni scheda da 24 GB che noleggiamo, e non di uno scarto che sembri equo. È la sorpresa più comune in assoluto nel lavoro sulle immagini: il modello che «gira su una 4090 dappertutto su internet» in realtà gira quantizzato, e nessuno lo dice.
Wan 2.1 video 14B in BF16 richiede 32.2 GB. Manca una scheda da 32 GB per una frazione di gigabyte. Il nostro margine è volutamente prudente e di solito può recuperarlo tenendo il text encoder fuori dalla scheda — ma non dovrebbe dover pianificare un acquisto attorno a un errore di arrotondamento, quindi la risposta onesta è che il video richiede 40 GB o più.
Cosa contiene ciascuna scheda
Ogni macchina a scheda singola che noleggiamo, con la precisione migliore che ciascuna sostiene per i due modelli più impegnativi. La colonna della banda passante serve per il capitolo successivo; la legga dopo aver letto quello.
| Nodo | Memoria della scheda | Larghezza di banda | FLUX.1 dev | Wan 2.1 video 14B | Al mese |
|---|---|---|---|---|---|
| NVIDIA L4 | 24 GB | 300 GB/s | FP8 | FP8 | $125/mese |
| NVIDIA RTX 4090 | 24 GB | 1,008 GB/s | FP8 | FP8 | $193/mese |
| NVIDIA RTX A6000 | 48 GB | 768 GB/s | BF16 / FP16 | BF16 / FP16 | $286/mese |
| NVIDIA RTX 5090 | 32 GB | 1,792 GB/s | BF16 / FP16 | FP8 | $335/mese |
| NVIDIA A100 PCIe | 40 GB | 1,555 GB/s | BF16 / FP16 | BF16 / FP16 | $392/mese |
| NVIDIA L40S | 48 GB | 864 GB/s | BF16 / FP16 | BF16 / FP16 | $714/mese |
| NVIDIA A100 PCIe | 80 GB | 1,935 GB/s | BF16 / FP16 | BF16 / FP16 | $1,091/mese |
| NVIDIA H100 PCIe | 80 GB | 2,000 GB/s | BF16 / FP16 | BF16 / FP16 | $1,469/mese |
Il verde rappresenta i pesi di riferimento, l’ambra quelli quantizzati. Quantizzare un modello di diffusione non è il pasto gratis che è per un modello linguistico: lo stesso prompt e lo stesso seed danno un’immagine visibilmente diversa, di solito leggermente più morbida. È un buon compromesso a FP8 e una valutazione caso per caso a 4 bit.
Legga la colonna dei prezzi dal basso e il quadro è netto. NVIDIA L4, a $125 al mese, è la macchina più economica che noleggiamo in grado di contenere FLUX.1 dev in assoluto — in FP8. La più economica che lo contiene in pieno BF16 è NVIDIA RTX A6000, a $286. Video a piena precisione parte sulla stessa scheda.
La colonna che tutti leggono male
Ecco la parte che distingue il lavoro sulle immagini da tutto il resto di questo sito, ed è il motivo per cui la scheda più economica di quella tabella è una trappola.
Quando un modello linguistico genera un token, legge una volta dalla memoria ogni peso attivo, esegue una piccola quantità di calcoli con ciascuno e scrive un singolo token. Lo rifà per il token successivo, e per quello dopo ancora. La scheda passa la vita ad aspettare il bus di memoria, motivo per cui le nostre stime di throughput per i modelli linguistici sono essenzialmente banda passante divisa per i pesi letti, e motivo per cui la colonna della banda passante è quella che conta su una guida al serving.
Un passo di diffusione non funziona così. Gli stessi pesi vengono applicati a un tensore latente da venti a cinquanta volte, e ogni passaggio compie una grande quantità di calcoli per ogni byte prelevato. I pesi restano residenti in memoria; il lavoro consiste in convoluzioni e attenzione su un tensore piccolo. Questo ribalta il vincolo: un modello immagine è limitato dal throughput dei tensori, non dal bus di memoria. Ne conseguono tre cose, e tutte e tre costano denaro se le si sbaglia.
«Ci sta» non vuol dire «è veloce»
La scheda entry-level nella tabella sopra contiene FLUX.1 dev in FP8 per $125 al mese, ed è un componente a basso consumo pensato per servire molti modelli piccoli, non per spingere pixel. La memoria è il primo filtro, mai l’ultimo.
Una seconda scheda non dimezza l’attesa
ComfyUI e le pipeline diffusers non suddividono un singolo ciclo di denoising tra più GPU nel modo in cui vLLM suddivide un transformer. Due schede eseguono due worker: il doppio delle immagini all’ora, gli stessi secondi per immagine. Qui NVLink non serve a nulla.
La scheda da data center non è automaticamente la risposta
Per il serving linguistico, una scheda HBM vince sul dato che decide il lavoro. Per il lavoro sulle immagini si acquistano throughput dei tensori e memoria, e le schede progettate per la grafica offrono di più su entrambi i fronti per ogni dollaro speso, più di quanto la loro posizione nel nostro listino lasci intendere.
La banda passante per dollaro è un indicatore — approssimativo — della classe di scheda che sta considerando, e nel nostro catalogo colloca NVIDIA RTX 5090 e NVIDIA RTX 4090 al primo e al secondo posto con ampio margine. Non è una coincidenza, né un affare a cui la stiamo convincendo: sono i componenti progettati esattamente per questo tipo di calcolo, e si trovano vicino al fondo del nostro listino prezzi perché il mercato li valuta in base al gaming, non ai cluster di addestramento.
Risoluzione, batch e video
I pesi sono fissi. Ciò che cambia è il working set, e cambia con i pixel, non con i parametri. Il latente in sé è trascurabile — sono le attivazioni che attraversano la rete a quella risoluzione a riempire la scheda.
latent_elements = (H / 8) * (W / 8) * C * batch
# C = 4 latent channels on SDXL, 16 on SD 3.5 and FLUX.
# 1024x1024, batch 1, SDXL:
128 * 128 * 4 * 1 = 65,536 elements = 128 KB in FP16
# 2048x2048, batch 4, SDXL:
256 * 256 * 4 * 4 = 1,048,576 = 2 MB in FP16
# The latent is never the problem. The activations that pass through the
# network at that resolution are, and they scale by the SAME factor:
# doubling the edge quadruples the pixel count, and roughly quadruples
# the working set. Batch multiplies it linearly on top.
Tre conseguenze pratiche, nell’ordine in cui le incontrerà:
- Il picco è di solito il decode del VAE, non il ciclo di campionamento. Il decoding espande il latente fino alla risoluzione piena in un solo passaggio, e proprio quel momento è ciò che scatena l’errore di memoria esaurita alla fine di un job che fino a un minuto prima girava senza problemi. Il tiled decoding lo risolve e costa un po’ di tempo.
- Il batching è il modo per sfruttare una scheda grande. Se il modello lascia 20 GB liberi, generare quattro immagini insieme è un uso molto migliore di quello spazio rispetto a una sola immagine con margine — i pesi vengono letti una sola volta per l’intero batch, l’unico punto in cui una pipeline di diffusione si comporta davvero come un job vincolato dalla banda.
- Il video aggiunge una dimensione, non una percentuale. Wan 2.1 video 14B genera insieme un blocco di fotogrammi, quindi i fotogrammi moltiplicano lo stesso working set che altezza e larghezza già moltiplicano. È per questo che un modello video da 14 miliardi di parametri richiede una scheda molto più grande di un modello immagine da 12 miliardi di parametri, ed è per questo che la tabella dei pesi qui sopra lo sottostima più di qualsiasi altra riga.
Avviare ComfyUI
ComfyUI è una delle immagini che possiamo scrivere sulla macchina prima della consegna, il che rende questa sezione facoltativa. Se preferisce crearla da sé, è un container e un tunnel.
$ ssh root@203.0.113.42
$ nvidia-smi --query-gpu=name,memory.total --format=csv
# Checkpoints, LoRAs, ControlNets and VAEs on the fast local NVMe.
# This directory is the reason you are renting by the month.
$ mkdir -p /scratch/comfy/models
$ df -h /scratch
$ docker run -d --name comfy --restart unless-stopped \
--gpus all --ipc=host \
-v /scratch/comfy:/data \
-p 127.0.0.1:8188:8188 \
your-comfyui-image --listen 0.0.0.0 --port 8188
# From YOUR machine, not the server: a tunnel, then a local browser tab.
$ ssh -N -L 8188:127.0.0.1:8188 root@203.0.113.42
# http://127.0.0.1:8188
127.0.0.1: davanti alla porta.
ComfyUI non ha login, password né alcun concetto di utente. Pubblicato su un indirizzo pubblico, è un’interfaccia grafica alla sua GPU, alla sua libreria di modelli e al filesystem sottostante, offerta a chiunque scansioni la porta — e le porte vengono scansionate nel giro di pochi minuti. Lo colleghi al loopback e vi acceda via SSH. La documentazione tratta il firewall e la prima ora in maggior dettaglio.
Cosa offre un mese
Il motivo per cui il lavoro sulle immagini si adatta bene a una macchina mensile non è il prezzo della GPU. È la libreria. Un’installazione seria di ComfyUI corrisponde a centinaia di gigabyte di checkpoint, LoRA, ControlNet, upscaler e VAE che ha curato personalmente e non vuole scaricare di nuovo.
Questa è la colonna da confrontare, ed è quella che le piattaforme a consumo orario omettono dal prezzo in evidenza. Lì il disco è una voce separata, con un prezzo per gigabyte al mese, e continua a fatturare anche quando l’istanza è ferma — oppure lo si elimina, per poi riscaricare centinaia di gigabyte la volta successiva che ci si rimette al lavoro.
È la stessa trappola descritta dal punto di pareggio orario, nella forma che assume per il lavoro sulle immagini. La fatturazione al secondo sembra sicura perché si può fermare l’istanza, e nessuno la ferma, perché fermarla significa perdere la libreria. La domanda onesta non è «quante ore genererò» ma «per quante ore questa macchina dovrà esistere» — e per chiunque abbia una raccolta di modelli curata la risposta è: tutte. Il pagamento è un unico bonifico in cripto, non c’è alcun costo di attivazione, e non le abbiamo chiesto chi fosse: i prompt, le LoRA che ha addestrato e il lavoro per i clienti non ancora consegnato restano su una macchina su cui solo lei ha accesso root.
Quando non conviene noleggiare una scheda
Preferiamo che lei non noleggi una di queste macchine e se ne penta, quindi ecco i casi in cui la risposta è no.
Genera qualche decina di immagini a settimana. Un endpoint gestito le costerà pochi dollari al mese, e nessun pomeriggio. Torni quando la coda, i limiti di risoluzione o le regole sui contenuti iniziano a decidere il lavoro al posto suo.
Vuole il modello chiuso più recente. I servizi di immagini più noti non rilasciano i pesi. Nessuna macchina in questa pagina li esegue, e nessuna quantità di memoria lo cambia.
Vuole un’immagine più veloce e sta valutando nodi multi-GPU. Compri invece una singola scheda più veloce. Le schede aggiuntive offrono worker paralleli, e i worker paralleli valgono moltissimo — ma non per chi osserva una singola barra di avanzamento.
Non ha ancora scelto un modello. Noleggi a ore da qualche parte finché non sa se sta eseguendo SDXL 1.0 a 1024 px o Wan 2.1 video 14B a cinque secondi a clip. Queste due risposte distano $161 al mese, e non c’è motivo di indovinare.
In ogni altro caso — una libreria che ha costruito, una pipeline che continua a modificare, job batch che girano tutta la notte, o lavoro che semplicemente non deve lasciare il suo disco — una scheda dedicata al mese è la soluzione più economica e più tranquilla. Il configuratore le dirà, per ogni nodo del catalogo, se il modello che ha in mente ci sta su una scheda prima che paghi qualcosa.
Verifichi che il suo modello ci stia prima di pagare.
Il configuratore indica la memoria necessaria a un modello e se rientra in una singola scheda, per ogni macchina del catalogo.
Altre guide
- Dimensionamento · 10 min
Scegliere un formato di quantizzazione
Quanto costano AWQ, GPTQ, GGUF e FP8 in memoria, velocità e qualità — e perché il formato con i pesi più piccoli raramente dà il modello più piccolo.
Leggi la guida - Dimensionamento · 10 min
Eseguire un modello mixture-of-experts
I parametri totali decidono la macchina, i parametri attivi decidono la velocità. Quanta VRAM serve a DeepSeek V3 e Qwen 3 235B, e quale nodo noleggiare per loro.
Leggi la guida - Costo · 6 min
Quando il noleggio mensile batte quello orario
Il break-even calcolato su numeri reali, i tre costi che un prezzo orario nasconde fino alla ricevuta, e la trappola dei tempi morti che triplica una stima.
Leggi la guida