ComfyUI: Creare Pipeline Visuali per la Generazione AI
ComfyUI è lo standard per la generazione AI locale: node-based, open source, supporta immagini video e 3D. Guida completa con workflow pronti all'uso.
Alessandro Saiani
Human in the Loop

Qualche giorno fa parlavamo di far girare LLM sul tuo PC. Oggi parliamo dell'altro lato dell'AI locale: la generazione di immagini, video e 3D. E lo strumento che ha vinto questa corsa si chiama ComfyUI.
ComfyUI è un'interfaccia node-based, open source, per costruire pipeline di generazione AI visivamente — collegando blocchi come faresti in un diagramma di flusso. È il Figma della generazione AI: potente, flessibile, e con una learning curve che ripaga l'investimento.
Nel 2026 è diventato lo standard de facto per i creator AI seri. NVIDIA lo sponsorizza, i modelli nuovi (FLUX, Hunyuan, Wan 2.2) escono prima su ComfyUI, e la community ha creato migliaia di workflow riutilizzabili.
Ma perché dovrebbe interessare a uno sviluppatore? Perché ComfyUI non è solo un "generatore di immagini". È un framework di orchestrazione per modelli AI — e capire come funziona ti dà un vantaggio su come funzionano le pipeline di generazione sotto il cofano.
Cos'è ComfyUI (in 60 Secondi)
Immagina di costruire una pipeline dati, ma visivamente. Ogni blocco (nodo) fa una cosa:
[Carica Modello] → [Codifica Prompt] → [Sampler] → [Decodifica] → [Salva Immagine]
Colleghi i nodi con cavi colorati. Premi "Queue". L'immagine esce dall'altro lato.
La differenza rispetto a un'interfaccia "tipo ChatGPT per immagini" (come Midjourney) è che vedi e controlli ogni step del processo. Vuoi cambiare il sampler? Stacca un cavo e ne attacchi un altro. Vuoi aggiungere ControlNet? Inserisci un nodo nel mezzo. Vuoi fare img2img invece di txt2img? Sposta un collegamento.
È programmazione visuale applicata alla generazione AI.
Perché ComfyUI Ha Vinto
Nel 2024 c'erano tre contendenti: AUTOMATIC1111 (A1111), Stable Diffusion WebUI Forge, e ComfyUI. Oggi la gara è finita.
I numeri
- Performance: ComfyUI completa batch 2x più veloci di A1111
- Supporto modelli: FLUX, Hunyuan Image 3.0, Wan 2.2, Hunyuan Video, Kling — tutti supportati su ComfyUI prima che altrove. A1111 a volte ci mette settimane. A volte non ci arriva mai
- 3D: Hunyuan3D 2.0 (il modello 3D di Tencent) ha supporto nativo in ComfyUI
- Community: migliaia di custom node, workflow condivisibili come file JSON
Il trade-off
A1111/Forge hanno un'interfaccia classica con menu, slider, bottoni. Impari in 10 minuti. ComfyUI ha nodi e cavi. Servono 10-15 ore per essere operativi, 20-30 ore per la confidenza.
Ma una volta che capisci i nodi, non torni indietro. È la differenza tra usare Excel e scrivere codice: Excel è più facile, ma il codice ti dà il controllo totale.
Quando usare cosa
| Scenario | Tool consigliato |
|---|---|
| Primo approccio alla generazione AI | A1111 o Forge |
| Generazione immagini rapida, niente personalizzazione | A1111 o Forge |
| Workflow complessi, multi-modello | ComfyUI |
| Generazione video | ComfyUI (unico con supporto completo) |
| Generazione 3D | ComfyUI |
| Automazione e batch processing | ComfyUI |
| GPU con poca VRAM (4-6GB) | Forge (ottimizzazioni VRAM migliori) |
L'Architettura: Come Funziona Davvero
Per uno sviluppatore, capire l'architettura di ComfyUI è capire come funziona la generazione AI.
I 5 Nodi Fondamentali
Ogni workflow di generazione immagini usa almeno questi 5 nodi:
1. Load Checkpoint
Carica il modello AI (un file .safetensors o .ckpt). Ogni modello è addestrato per un tipo di generazione diverso — fotorealismo, anime, illustration.
Il nodo ha 3 output:
- MODEL — i pesi della rete neurale (il "cervello")
- CLIP — il text encoder (traduce il testo in vettori che il modello capisce)
- VAE — il decoder visuale (trasforma i dati interni in pixel visibili)
Sono le tre componenti di ogni modello di diffusione. Quando Qwen 3.5 fa early fusion di testo e immagini, fa qualcosa di concettualmente simile.
2. CLIP Text Encode (×2)
Due nodi identici — uno per il prompt positivo (cosa vuoi) e uno per il prompt negativo (cosa non vuoi).
Il CLIP prende il tuo testo e lo trasforma in un embedding — un vettore nello spazio latente che rappresenta il significato del testo. Se hai letto il nostro articolo su come funzionano gli embeddings, è esattamente lo stesso concetto applicato alla generazione immagini.
3. Empty Latent Image
Crea il "canvas" su cui il modello lavorerà — ma non in pixel. È un tensore di rumore nello spazio latente: una rappresentazione compressa (tipicamente 8x più piccola dell'immagine finale).
Qui imposti la dimensione dell'immagine. 1024×1024 nello spazio pixel diventa 128×128 nello spazio latente. Questo è il motivo per cui la generazione è veloce: il modello lavora in uno spazio 64 volte più piccolo.
4. KSampler
Il cuore del processo. Prende il rumore e, guidato dal prompt, lo trasforma gradualmente nell'immagine — step dopo step.
Parametri chiave:
- Steps: quante iterazioni di denoising (15-30 tipicamente). Più step = più dettaglio, più tempo
- CFG Scale: quanto il modello "ascolta" il prompt (7-12 tipicamente). Troppo alto = artefatti. Troppo basso = ignora il prompt
- Sampler: l'algoritmo di denoising.
euler_ancestralper velocità,dpmpp_2mcon schedulerkarrasper qualità - Seed: il numero casuale di partenza. Stesso seed = stessa immagine (riproducibilità!)
5. VAE Decode
Prende il risultato dal KSampler (ancora nello spazio latente) e lo decodifica in un'immagine pixel reale. Il VAE influenza i dettagli fini: tono colore, contrasto, nitidezza.
Il Flusso Completo
[Load Checkpoint] ──MODEL──→ [KSampler]
│ ↑
├──CLIP──→ [Positive Prompt] ──CONDITIONING──→ [KSampler]
│
├──CLIP──→ [Negative Prompt] ──CONDITIONING──→ [KSampler]
│
└──VAE──→ [VAE Decode] ←──LATENT──── [KSampler]
│
[Empty Latent] ──LATENT──→ [KSampler]
│
[Save Image] ←──IMAGE──── [VAE Decode]
Questo è il workflow text-to-image base. Ogni variante (img2img, inpainting, ControlNet, IP-Adapter) aggiunge nodi a questo schema.
I Colori dei Cavi
ComfyUI usa colori per i tipi di dato:
| Colore | Tipo | Descrizione |
|---|---|---|
| Viola | MODEL | I pesi del modello |
| Giallo | CLIP | Text encoder |
| Rosso | VAE | Image encoder/decoder |
| Rosa | LATENT | Dati nello spazio latente |
| Arancione | CONDITIONING | Prompt codificati |
| Blu | IMAGE | Immagini pixel (RGB) |
Se un cavo non si collega, è perché i tipi non corrispondono. Esattamente come un type system in TypeScript — ma visuale.
Installazione: 3 Modi
1. ComfyUI Desktop (il più semplice)
Da fine 2024, ComfyUI ha un installer desktop standalone:
- Scarica da comfy.org
- Installa (Windows/macOS/Linux)
- Al primo avvio, scarica un modello base
- Fatto
Include Python, PyTorch, e tutti i dependency. Zero configurazione.
2. Da sorgente (per sviluppatori)
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI
pip install -r requirements.txt
# Scarica un modello in models/checkpoints/
# (es. SDXL, FLUX, o Stable Diffusion 3.5)
python main.py
Apri http://localhost:8188 nel browser.
3. Cloud (zero hardware)
Se non hai una GPU, piattaforme come RunComfy, ThinkDiffusion e Comfy Cloud offrono ComfyUI hosted con GPU a noleggio.
Requisiti hardware
| Setup | VRAM | Cosa puoi generare |
|---|---|---|
| Minimo | 4 GB | SD 1.5 a 512×512 |
| Consigliato | 8 GB | SDXL a 1024×1024 |
| Ottimo | 12-16 GB | FLUX, video brevi |
| Ideale | 24 GB+ | Tutto, incluso video HD |
Apple Silicon (M1/M2/M3/M4): supportato nativamente via MPS. Un M3 Pro con 18GB genera immagini SDXL in ~15 secondi.
4 Workflow Pronti all'Uso
ComfyUI diventa potente quando vai oltre il text-to-image base. Ecco 4 workflow che uno sviluppatore potrebbe trovare utili.
1. Generare Immagini per il Blog/Progetto
Il workflow per creare immagini consistenti per un progetto:
- Checkpoint: FLUX.1 Dev (il migliore per prompt complessi)
- Positive prompt: descrizione dettagliata con stile consistente
- Negative prompt: "text, watermark, low quality, blurry"
- Seed fisso: per riproducibilità. Cambi il prompt, mantieni lo stile
Aggiungi un nodo IP-Adapter con un'immagine di riferimento per mantenere lo stile consistente tra diverse generazioni. È come avere un "brand kit" per le immagini AI.
2. Rimuovere lo Sfondo da Screenshot
Un workflow pratico per documentazione e demo:
- Load Image: carica lo screenshot
- RMBG Node (custom node): rimuove lo sfondo automaticamente
- Composite: metti su sfondo trasparente o personalizzato
- Save: esporta in PNG con alpha
Nessun tool esterno, nessun servizio cloud. Tutto locale.
3. Upscale di Immagini
Hai un'immagine a bassa risoluzione e la vuoi 4x più grande:
- Load Image: l'immagine originale
- Upscale Model: usa un modello come RealESRGAN o 4x-UltraSharp
- Tile ControlNet: per mantenere i dettagli ad alta risoluzione senza artefatti
- KSampler con denoise basso (0.3-0.5): aggiunge dettagli senza alterare l'immagine
Risultato: da 512×512 a 2048×2048 con dettagli generati dall'AI.
4. Img2Video (il futuro)
Il workflow più avanzato — trasforma un'immagine statica in un breve video:
- Load Image: l'immagine di partenza
- Wan 2.2 / Hunyuan Video: il modello video
- Motion prompt: "slow camera pan, gentle wind blowing"
- Frame interpolation: per smoothness
Richiede GPU seria (16GB+ VRAM) e pazienza (minuti per pochi secondi di video). Ma il risultato è impressionante e migliora ogni mese.
Custom Nodes: L'Ecosistema
La vera forza di ComfyUI è l'ecosistema di custom node — estensioni create dalla community che aggiungono funzionalità.
I più utili per sviluppatori
| Node Pack | Funzione | Perché ti interessa |
|---|---|---|
| ComfyUI Manager | Installa e aggiorna custom nodes | Il "package manager" di ComfyUI |
| Impact Pack | Detector, segmenter, batch processing | Automazione e pipeline |
| ControlNet | Guida la generazione con pose, bordi, profondità | Risultati precisi e controllabili |
| IP-Adapter | Trasferimento stile da immagine di riferimento | Consistenza visiva |
| WAS Node Suite | 100+ nodi utility (resize, crop, text overlay) | Swiss army knife |
| Reactor | Face swap | Demo e prototyping |
Installazione custom nodes
Con ComfyUI Manager (il modo consigliato):
- Installa ComfyUI Manager (clona il repo in
custom_nodes/) - Riavvia ComfyUI
- Nel menu, clicca "Manager" → "Install Custom Nodes"
- Cerca e installa con un click
È l'equivalente di npm install per ComfyUI.
ComfyUI come API
Ecco dove diventa interessante per chi sviluppa. ComfyUI espone un'API WebSocket che accetta workflow in formato JSON.
import json
import urllib.request
# Il workflow esportato da ComfyUI (JSON)
workflow = json.load(open("workflow.json"))
# Modifica il prompt programmaticamente
workflow["6"]["inputs"]["text"] = "A futuristic city at sunset, cyberpunk style"
# Invia al server ComfyUI
data = json.dumps({"prompt": workflow}).encode("utf-8")
req = urllib.request.Request("http://localhost:8188/prompt", data=data)
urllib.request.urlopen(req)
Questo significa che puoi:
- Automatizzare la generazione da script Python
- Integrare ComfyUI nel tuo backend come servizio di generazione immagini
- Creare batch da CSV/database
- Costruire una UI custom che usa ComfyUI come engine
L'API è la stessa che l'interfaccia web usa — non è un add-on, è il core.
Comfy Cloud: Scaling in Produzione
Per chi vuole usare ComfyUI in produzione senza gestire GPU, Comfy Cloud (il servizio ufficiale) offre:
- Deploy di workflow come API endpoint
- GPU on-demand (A100, H100)
- Pay-per-generation
- Zero infrastruttura da gestire
È il modello "Vercel per la generazione AI" — push il workflow, ottieni un endpoint.
I Limiti
ComfyUI non è perfetto:
Learning curve ripida
10-15 ore prima di essere produttivi. Per chi viene da A1111 o da Midjourney, i nodi e i cavi sono uno shock iniziale. Ma è un investimento una tantum.
Debugging difficile
Quando qualcosa non funziona (e succede), il messaggio di errore è spesso un traceback Python criptico. Non c'è un debugger visuale. Devi leggere i log e capire quale nodo ha fallito.
Custom nodes instabili
L'ecosistema di custom nodes è vasto ma non sempre affidabile. Aggiornamenti di ComfyUI possono rompere custom nodes. Non c'è un sistema di versioning robusto. È l'equivalente dell'ecosistema npm nei primi anni — potente ma fragile.
VRAM hungry
I workflow complessi (ControlNet + IP-Adapter + Upscaler) possono richiedere 12-16GB+ di VRAM. Su GPU da 8GB devi fare compromessi.
Il Quadro Completo
ComfyUI è per la generazione visuale quello che llama.cpp è per i LLM: il tool open source che ha democratizzato l'accesso.
Con ComfyUI puoi:
- Generare immagini per il tuo blog o prodotto senza pagare servizi cloud
- Costruire pipeline di generazione automatizzate via API
- Sperimentare con i modelli più recenti il giorno stesso del rilascio
- Capire come funziona la generazione AI sotto il cofano — checkpoint, CLIP, VAE, sampler
Non è un tool per tutti. Ha una learning curve reale e richiede una GPU decente. Ma per chi sviluppa e vuole capire (e usare) la generazione AI visuale, è lo strumento più potente disponibile oggi.
E a differenza di Midjourney o DALL-E, tutto gira sul tuo hardware. Nessun abbonamento, nessun limite di generazioni, nessun dato mandato ai server di nessuno.
Fonti:
- ComfyUI — Sito ufficiale
- ComfyUI — Documentazione
- NVIDIA — Tutorial ComfyUI su RTX
- Stable Diffusion Art — Beginner's Guide to ComfyUI
- RunComfy — Mastering Checkpoint, CLIP, KSampler
- ComfyUI Wiki — Detailed Node Explanation
- Apatero — ComfyUI vs AUTOMATIC1111 Comparison
- Spheron — Stable Diffusion Showdown: ComfyUI vs A1111 vs Forge
- ComfyUI Examples — FLUX Workflows
- GitHub — ComfyUI Repository