🛠️ Tool Review14 minuti di lettura

ComfyUI: Creare Pipeline Visuali per la Generazione AI

ComfyUI è lo standard per la generazione AI locale: node-based, open source, supporta immagini video e 3D. Guida completa con workflow pronti all'uso.

AS

Alessandro Saiani

Human in the Loop

ComfyUI: Creare Pipeline Visuali per la Generazione AI

Qualche giorno fa parlavamo di far girare LLM sul tuo PC. Oggi parliamo dell'altro lato dell'AI locale: la generazione di immagini, video e 3D. E lo strumento che ha vinto questa corsa si chiama ComfyUI.

ComfyUI è un'interfaccia node-based, open source, per costruire pipeline di generazione AI visivamente — collegando blocchi come faresti in un diagramma di flusso. È il Figma della generazione AI: potente, flessibile, e con una learning curve che ripaga l'investimento.

Nel 2026 è diventato lo standard de facto per i creator AI seri. NVIDIA lo sponsorizza, i modelli nuovi (FLUX, Hunyuan, Wan 2.2) escono prima su ComfyUI, e la community ha creato migliaia di workflow riutilizzabili.

Ma perché dovrebbe interessare a uno sviluppatore? Perché ComfyUI non è solo un "generatore di immagini". È un framework di orchestrazione per modelli AI — e capire come funziona ti dà un vantaggio su come funzionano le pipeline di generazione sotto il cofano.


Cos'è ComfyUI (in 60 Secondi)

Immagina di costruire una pipeline dati, ma visivamente. Ogni blocco (nodo) fa una cosa:

[Carica Modello] → [Codifica Prompt] → [Sampler] → [Decodifica] → [Salva Immagine]

Colleghi i nodi con cavi colorati. Premi "Queue". L'immagine esce dall'altro lato.

La differenza rispetto a un'interfaccia "tipo ChatGPT per immagini" (come Midjourney) è che vedi e controlli ogni step del processo. Vuoi cambiare il sampler? Stacca un cavo e ne attacchi un altro. Vuoi aggiungere ControlNet? Inserisci un nodo nel mezzo. Vuoi fare img2img invece di txt2img? Sposta un collegamento.

È programmazione visuale applicata alla generazione AI.


Perché ComfyUI Ha Vinto

Nel 2024 c'erano tre contendenti: AUTOMATIC1111 (A1111), Stable Diffusion WebUI Forge, e ComfyUI. Oggi la gara è finita.

I numeri

  • Performance: ComfyUI completa batch 2x più veloci di A1111
  • Supporto modelli: FLUX, Hunyuan Image 3.0, Wan 2.2, Hunyuan Video, Kling — tutti supportati su ComfyUI prima che altrove. A1111 a volte ci mette settimane. A volte non ci arriva mai
  • 3D: Hunyuan3D 2.0 (il modello 3D di Tencent) ha supporto nativo in ComfyUI
  • Community: migliaia di custom node, workflow condivisibili come file JSON

Il trade-off

A1111/Forge hanno un'interfaccia classica con menu, slider, bottoni. Impari in 10 minuti. ComfyUI ha nodi e cavi. Servono 10-15 ore per essere operativi, 20-30 ore per la confidenza.

Ma una volta che capisci i nodi, non torni indietro. È la differenza tra usare Excel e scrivere codice: Excel è più facile, ma il codice ti dà il controllo totale.

Quando usare cosa

ScenarioTool consigliato
Primo approccio alla generazione AIA1111 o Forge
Generazione immagini rapida, niente personalizzazioneA1111 o Forge
Workflow complessi, multi-modelloComfyUI
Generazione videoComfyUI (unico con supporto completo)
Generazione 3DComfyUI
Automazione e batch processingComfyUI
GPU con poca VRAM (4-6GB)Forge (ottimizzazioni VRAM migliori)

L'Architettura: Come Funziona Davvero

Per uno sviluppatore, capire l'architettura di ComfyUI è capire come funziona la generazione AI.

I 5 Nodi Fondamentali

Ogni workflow di generazione immagini usa almeno questi 5 nodi:

1. Load Checkpoint

Carica il modello AI (un file .safetensors o .ckpt). Ogni modello è addestrato per un tipo di generazione diverso — fotorealismo, anime, illustration.

Il nodo ha 3 output:

  • MODEL — i pesi della rete neurale (il "cervello")
  • CLIP — il text encoder (traduce il testo in vettori che il modello capisce)
  • VAE — il decoder visuale (trasforma i dati interni in pixel visibili)

Sono le tre componenti di ogni modello di diffusione. Quando Qwen 3.5 fa early fusion di testo e immagini, fa qualcosa di concettualmente simile.

2. CLIP Text Encode (×2)

Due nodi identici — uno per il prompt positivo (cosa vuoi) e uno per il prompt negativo (cosa non vuoi).

Il CLIP prende il tuo testo e lo trasforma in un embedding — un vettore nello spazio latente che rappresenta il significato del testo. Se hai letto il nostro articolo su come funzionano gli embeddings, è esattamente lo stesso concetto applicato alla generazione immagini.

3. Empty Latent Image

Crea il "canvas" su cui il modello lavorerà — ma non in pixel. È un tensore di rumore nello spazio latente: una rappresentazione compressa (tipicamente 8x più piccola dell'immagine finale).

Qui imposti la dimensione dell'immagine. 1024×1024 nello spazio pixel diventa 128×128 nello spazio latente. Questo è il motivo per cui la generazione è veloce: il modello lavora in uno spazio 64 volte più piccolo.

4. KSampler

Il cuore del processo. Prende il rumore e, guidato dal prompt, lo trasforma gradualmente nell'immagine — step dopo step.

Parametri chiave:

  • Steps: quante iterazioni di denoising (15-30 tipicamente). Più step = più dettaglio, più tempo
  • CFG Scale: quanto il modello "ascolta" il prompt (7-12 tipicamente). Troppo alto = artefatti. Troppo basso = ignora il prompt
  • Sampler: l'algoritmo di denoising. euler_ancestral per velocità, dpmpp_2m con scheduler karras per qualità
  • Seed: il numero casuale di partenza. Stesso seed = stessa immagine (riproducibilità!)

5. VAE Decode

Prende il risultato dal KSampler (ancora nello spazio latente) e lo decodifica in un'immagine pixel reale. Il VAE influenza i dettagli fini: tono colore, contrasto, nitidezza.

Il Flusso Completo

[Load Checkpoint] ──MODEL──→ [KSampler]
        │                        ↑
        ├──CLIP──→ [Positive Prompt] ──CONDITIONING──→ [KSampler]
        │
        ├──CLIP──→ [Negative Prompt] ──CONDITIONING──→ [KSampler]
        │
        └──VAE──→ [VAE Decode] ←──LATENT──── [KSampler]
                      │
               [Empty Latent] ──LATENT──→ [KSampler]
                      │
               [Save Image] ←──IMAGE──── [VAE Decode]

Questo è il workflow text-to-image base. Ogni variante (img2img, inpainting, ControlNet, IP-Adapter) aggiunge nodi a questo schema.

I Colori dei Cavi

ComfyUI usa colori per i tipi di dato:

ColoreTipoDescrizione
ViolaMODELI pesi del modello
GialloCLIPText encoder
RossoVAEImage encoder/decoder
RosaLATENTDati nello spazio latente
ArancioneCONDITIONINGPrompt codificati
BluIMAGEImmagini pixel (RGB)

Se un cavo non si collega, è perché i tipi non corrispondono. Esattamente come un type system in TypeScript — ma visuale.


Installazione: 3 Modi

1. ComfyUI Desktop (il più semplice)

Da fine 2024, ComfyUI ha un installer desktop standalone:

  1. Scarica da comfy.org
  2. Installa (Windows/macOS/Linux)
  3. Al primo avvio, scarica un modello base
  4. Fatto

Include Python, PyTorch, e tutti i dependency. Zero configurazione.

2. Da sorgente (per sviluppatori)

git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI
pip install -r requirements.txt

# Scarica un modello in models/checkpoints/
# (es. SDXL, FLUX, o Stable Diffusion 3.5)

python main.py

Apri http://localhost:8188 nel browser.

3. Cloud (zero hardware)

Se non hai una GPU, piattaforme come RunComfy, ThinkDiffusion e Comfy Cloud offrono ComfyUI hosted con GPU a noleggio.

Requisiti hardware

SetupVRAMCosa puoi generare
Minimo4 GBSD 1.5 a 512×512
Consigliato8 GBSDXL a 1024×1024
Ottimo12-16 GBFLUX, video brevi
Ideale24 GB+Tutto, incluso video HD

Apple Silicon (M1/M2/M3/M4): supportato nativamente via MPS. Un M3 Pro con 18GB genera immagini SDXL in ~15 secondi.


4 Workflow Pronti all'Uso

ComfyUI diventa potente quando vai oltre il text-to-image base. Ecco 4 workflow che uno sviluppatore potrebbe trovare utili.

1. Generare Immagini per il Blog/Progetto

Il workflow per creare immagini consistenti per un progetto:

  • Checkpoint: FLUX.1 Dev (il migliore per prompt complessi)
  • Positive prompt: descrizione dettagliata con stile consistente
  • Negative prompt: "text, watermark, low quality, blurry"
  • Seed fisso: per riproducibilità. Cambi il prompt, mantieni lo stile

Aggiungi un nodo IP-Adapter con un'immagine di riferimento per mantenere lo stile consistente tra diverse generazioni. È come avere un "brand kit" per le immagini AI.

2. Rimuovere lo Sfondo da Screenshot

Un workflow pratico per documentazione e demo:

  • Load Image: carica lo screenshot
  • RMBG Node (custom node): rimuove lo sfondo automaticamente
  • Composite: metti su sfondo trasparente o personalizzato
  • Save: esporta in PNG con alpha

Nessun tool esterno, nessun servizio cloud. Tutto locale.

3. Upscale di Immagini

Hai un'immagine a bassa risoluzione e la vuoi 4x più grande:

  • Load Image: l'immagine originale
  • Upscale Model: usa un modello come RealESRGAN o 4x-UltraSharp
  • Tile ControlNet: per mantenere i dettagli ad alta risoluzione senza artefatti
  • KSampler con denoise basso (0.3-0.5): aggiunge dettagli senza alterare l'immagine

Risultato: da 512×512 a 2048×2048 con dettagli generati dall'AI.

4. Img2Video (il futuro)

Il workflow più avanzato — trasforma un'immagine statica in un breve video:

  • Load Image: l'immagine di partenza
  • Wan 2.2 / Hunyuan Video: il modello video
  • Motion prompt: "slow camera pan, gentle wind blowing"
  • Frame interpolation: per smoothness

Richiede GPU seria (16GB+ VRAM) e pazienza (minuti per pochi secondi di video). Ma il risultato è impressionante e migliora ogni mese.


Custom Nodes: L'Ecosistema

La vera forza di ComfyUI è l'ecosistema di custom node — estensioni create dalla community che aggiungono funzionalità.

I più utili per sviluppatori

Node PackFunzionePerché ti interessa
ComfyUI ManagerInstalla e aggiorna custom nodesIl "package manager" di ComfyUI
Impact PackDetector, segmenter, batch processingAutomazione e pipeline
ControlNetGuida la generazione con pose, bordi, profonditàRisultati precisi e controllabili
IP-AdapterTrasferimento stile da immagine di riferimentoConsistenza visiva
WAS Node Suite100+ nodi utility (resize, crop, text overlay)Swiss army knife
ReactorFace swapDemo e prototyping

Installazione custom nodes

Con ComfyUI Manager (il modo consigliato):

  1. Installa ComfyUI Manager (clona il repo in custom_nodes/)
  2. Riavvia ComfyUI
  3. Nel menu, clicca "Manager" → "Install Custom Nodes"
  4. Cerca e installa con un click

È l'equivalente di npm install per ComfyUI.


ComfyUI come API

Ecco dove diventa interessante per chi sviluppa. ComfyUI espone un'API WebSocket che accetta workflow in formato JSON.

import json
import urllib.request

# Il workflow esportato da ComfyUI (JSON)
workflow = json.load(open("workflow.json"))

# Modifica il prompt programmaticamente
workflow["6"]["inputs"]["text"] = "A futuristic city at sunset, cyberpunk style"

# Invia al server ComfyUI
data = json.dumps({"prompt": workflow}).encode("utf-8")
req = urllib.request.Request("http://localhost:8188/prompt", data=data)
urllib.request.urlopen(req)

Questo significa che puoi:

  • Automatizzare la generazione da script Python
  • Integrare ComfyUI nel tuo backend come servizio di generazione immagini
  • Creare batch da CSV/database
  • Costruire una UI custom che usa ComfyUI come engine

L'API è la stessa che l'interfaccia web usa — non è un add-on, è il core.

Comfy Cloud: Scaling in Produzione

Per chi vuole usare ComfyUI in produzione senza gestire GPU, Comfy Cloud (il servizio ufficiale) offre:

  • Deploy di workflow come API endpoint
  • GPU on-demand (A100, H100)
  • Pay-per-generation
  • Zero infrastruttura da gestire

È il modello "Vercel per la generazione AI" — push il workflow, ottieni un endpoint.


I Limiti

ComfyUI non è perfetto:

Learning curve ripida

10-15 ore prima di essere produttivi. Per chi viene da A1111 o da Midjourney, i nodi e i cavi sono uno shock iniziale. Ma è un investimento una tantum.

Debugging difficile

Quando qualcosa non funziona (e succede), il messaggio di errore è spesso un traceback Python criptico. Non c'è un debugger visuale. Devi leggere i log e capire quale nodo ha fallito.

Custom nodes instabili

L'ecosistema di custom nodes è vasto ma non sempre affidabile. Aggiornamenti di ComfyUI possono rompere custom nodes. Non c'è un sistema di versioning robusto. È l'equivalente dell'ecosistema npm nei primi anni — potente ma fragile.

VRAM hungry

I workflow complessi (ControlNet + IP-Adapter + Upscaler) possono richiedere 12-16GB+ di VRAM. Su GPU da 8GB devi fare compromessi.


Il Quadro Completo

ComfyUI è per la generazione visuale quello che llama.cpp è per i LLM: il tool open source che ha democratizzato l'accesso.

Con ComfyUI puoi:

  • Generare immagini per il tuo blog o prodotto senza pagare servizi cloud
  • Costruire pipeline di generazione automatizzate via API
  • Sperimentare con i modelli più recenti il giorno stesso del rilascio
  • Capire come funziona la generazione AI sotto il cofano — checkpoint, CLIP, VAE, sampler

Non è un tool per tutti. Ha una learning curve reale e richiede una GPU decente. Ma per chi sviluppa e vuole capire (e usare) la generazione AI visuale, è lo strumento più potente disponibile oggi.

E a differenza di Midjourney o DALL-E, tutto gira sul tuo hardware. Nessun abbonamento, nessun limite di generazioni, nessun dato mandato ai server di nessuno.


Fonti: