Chain of Thought: Perché l'AI Ragiona Meglio se 'Pensa'
Sei parole — 'Let's think step by step' — hanno aumentato l'accuratezza di un LLM dal 17.7% al 78.7%. Come funziona il Chain of Thought, perché non è un trucco, e quando conviene usarlo.
Alessandro Saiani
Human in the Loop

"Let's think step by step."
Sei parole. Nessun esempio, nessun fine-tuning, nessuna architettura nuova. Solo sei parole aggiunte alla fine di un prompt. Risultato: un modello che risolveva il 17.7% dei problemi matematici ne risolve il 78.7%. Oltre quattro volte meglio.
Se ti sembra troppo bello per essere vero, benvenuto nel mondo del Chain of Thought — la tecnica che ha ridefinito cosa i LLM sanno fare, e che oggi è il motore nascosto dietro ogni reasoning model che usi.
Il Paper che Ha Iniziato Tutto
Gennaio 2022. Jason Wei e il suo team a Google Research pubblicano "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models". L'idea è disarmante nella sua semplicità: invece di chiedere al modello di saltare direttamente alla risposta, mostrargli come ragionare passo dopo passo.
Il prompting standard funziona così: dai al modello qualche esempio di domanda-risposta, poi gli fai una nuova domanda. Il modello vede il pattern e produce la risposta. Il Chain of Thought cambia una sola cosa: negli esempi, tra domanda e risposta, inserisci i passaggi intermedi del ragionamento.
I numeri su PaLM 540B — il modello più grande di Google all'epoca — sono brutali:
| Benchmark | Standard | Chain of Thought | Miglioramento |
|---|---|---|---|
| GSM8K (matematica) | 17.9% | 56.9% | +39 punti |
| Sports Understanding | 80.5% | 95.4% | +15 punti |
Quel 56.9% su GSM8K è particolarmente significativo: il precedente stato dell'arte era 55%, ottenuto con GPT-3 175B fine-tuned con un verifier addestrato a classificare le soluzioni (Cobbe et al., 2021). Wei et al. lo hanno superato senza toccare i pesi del modello — solo cambiando il prompt.
Un dettaglio cruciale che il paper evidenzia: il CoT funziona solo con modelli sopra i 100 miliardi di parametri. Modelli più piccoli generano catene di ragionamento illogiche che peggiorano i risultati. Non è una tecnica universale — è una capacità emergente che si sblocca solo a una certa scala.
Lo Scratchpad Computazionale
Perché funziona? La risposta intuitiva è anche quella corretta: il modello non diventa più intelligente. Ha più spazio per lavorare.
Pensa a cosa succede quando moltiplichi 347 per 23 a mente. Probabilmente non ce la fai — o ci metti molto. Ora prendi carta e penna: scrivi i prodotti parziali, li allinei, sommi. Il tuo cervello è lo stesso. Ma la carta ti dà uno scratchpad — un foglio di brutta dove appoggiare i risultati intermedi.
Per un LLM, ogni token generato è un passo computazionale. Senza CoT, il modello deve calcolare P(Risposta | Domanda) in un colpo solo — un salto enorme per problemi multi-step. Con il CoT, la catena diventa:
P(Risposta | Domanda, step_1, step_2, ..., step_n)
Ogni step intermedio arricchisce il contesto. Ogni token generato riduce la complessità del passo successivo. Il modello "costruisce" il ragionamento un pezzo alla volta, e ogni pezzo è più semplice del salto diretto domanda-risposta.
Questo è un punto che vale la pena interiorizzare: il modello non "ragiona" nel senso umano del termine. Genera token. Ma generare più token intermedi significa avere più computazione a disposizione — e per certi problemi, quella computazione extra è la differenza tra il 17% e il 57%.
Non è un Trucco — È una Necessità Computazionale
Se l'argomento dello scratchpad ti sembra un po' vago, nel 2024 è arrivata la dimostrazione formale.
William Merrill e Ashish Sabharwal hanno pubblicato "The Expressive Power of Transformers with Chain of Thought" a ICLR 2024 — una delle conferenze più prestigiose del campo. Il paper risponde a una domanda precisa: cosa cambia, dal punto di vista della teoria della complessità, quando un transformer può generare step intermedi?
I risultati sono netti:
- Senza CoT: i transformer non riescono nemmeno a verificare se due nodi in un grafo sono connessi. Sono computazionalmente limitati.
- Con step logaritmici: le capacità aumentano solo marginalmente.
- Con step lineari: il modello riconosce tutti i linguaggi regolari.
- Con step polinomiali: risolve esattamente tutti i problemi nella classe P — tutti i problemi risolvibili in tempo polinomiale.
Questo è il primo risultato esatto che caratterizza i transformer in termini di classi di complessità standard. E dice una cosa profonda: il Chain of Thought non è un hack, non è un trucco da prompt engineering. Estende la classe computazionale del modello. Senza step intermedi, un transformer è fondamentalmente limitato in ciò che può computare. Con step intermedi, può risolvere una classe enormemente più ampia di problemi.
Tornando all'analogia: non è solo che la carta e penna aiutano. È che certi calcoli sono impossibili senza un supporto esterno su cui appoggiare i risultati parziali. Lo scratchpad non è un lusso — è una necessità.
Zero-Shot CoT: Sei Parole che Cambiano Tutto
Il paper originale di Wei et al. usava il few-shot CoT: costruivi a mano 8 esempi con i passaggi di ragionamento, li mettevi nel prompt, e il modello imparava il pattern. Funzionava, ma era laborioso — dovevi creare esempi specifici per ogni tipo di task.
Cinque mesi dopo, Takeshi Kojima e colleghi hanno pubblicato una scoperta che ha semplificato tutto. Il paper "Large Language Models are Zero-Shot Reasoners" dimostra che basta aggiungere una frase magica: "Let's think step by step".
Nessun esempio. Nessun ragionamento pre-costruito. Solo quelle sei parole alla fine del prompt. Risultati su InstructGPT:
| Benchmark | Senza CoT | Con "Let's think step by step" |
|---|---|---|
| MultiArith | 17.7% | 78.7% |
| GSM8K | 10.4% | 40.7% |
La cosa straordinaria è che funziona su task completamente diversi: aritmetica, ragionamento simbolico, logica, comprensione temporale. Un singolo template — sei parole — applicabile ovunque.
Perché funziona? Perché quei sei parole attivano un pattern che il modello ha visto migliaia di volte durante il training. Testi educativi, tutorial, spiegazioni matematiche — tutti seguono lo schema "ragioniamo passo dopo passo". Il prompt non insegna nulla di nuovo al modello. Gli dice: "usa quel modo di generare testo che hai imparato da tutti quei documenti che spiegavano le cose passo dopo passo."
È come dire a una persona: "pensaci bene prima di rispondere." Non la rendi più intelligente. Le stai dicendo di usare risorse cognitive che altrimenti non avrebbe attivato.
Self-Consistency e Tree of Thoughts
Il CoT genera una singola catena di ragionamento. Ma un problema complesso spesso ammette più percorsi validi verso la risposta corretta. Da questa osservazione nascono due evoluzioni importanti.
Self-Consistency: votare a maggioranza
Xuezhi Wang e colleghi (molti dello stesso team di Wei) hanno proposto un'idea semplice: invece di generare una catena e fidarsi, generane N e fai votare. Il modello produce più catene di ragionamento indipendenti — con temperature alta per variazione — e la risposta finale è quella che compare più spesso.
L'intuizione è che percorsi di ragionamento diversi, se il problema è ben posto, tendono a convergere sulla stessa risposta corretta. Le catene sbagliate, invece, divergono verso risposte diverse.
I miglioramenti rispetto al CoT standard sono consistenti: +17.9% su GSM8K, +12.2% su AQuA, +11% su SVAMP. Il prezzo è ovvio — generi N volte più token, paghi N volte di più — ma per task dove l'accuratezza conta più del costo, è un moltiplicatore potente.
Tree of Thoughts: ragionamento ad albero
Shunyu Yao e colleghi hanno fatto un passo ulteriore con "Tree of Thoughts". Invece di una catena lineare (un pensiero dopo l'altro), il modello esplora un albero di possibilità. Ad ogni nodo, genera più rami di pensiero, li valuta, e decide quale seguire. Può anche fare backtracking — tornare indietro se un ramo si rivela sbagliato.
Il risultato più emblematico è sul Game of 24 — un gioco dove devi combinare 4 numeri con operazioni aritmetiche per ottenere 24:
- GPT-4 con CoT standard: 4% di successo
- GPT-4 con Tree of Thoughts: 74% di successo
Da 4 a 74. Non è un miglioramento incrementale — è un cambio di regime. Il CoT lineare falliva perché una scelta sbagliata al primo step comprometteva l'intera catena. L'albero permette di esplorare, valutare, e correggere la rotta.
La progressione è chiara: prompting standard (un salto) -> CoT (una catena) -> Self-consistency (catene multiple, voto) -> Tree of Thoughts (esplorazione ad albero con backtracking). Ogni step aggiunge computazione e migliora i risultati.
I Reasoning Models: CoT Sotto il Cofano
Se il Chain of Thought funziona così bene come tecnica di prompting, perché non incorporarlo direttamente nel modello? Questo è esattamente quello che è successo a partire da settembre 2024.
OpenAI o1: ragionamento nascosto
Quando OpenAI ha lanciato o1, il blog post si intitolava "Learning to Reason with LLMs". Il modello genera internamente dei reasoning tokens — token di "pensiero" che precedono la risposta visibile. Questi token non li vedi via API (ricevi solo un riassunto), ma occupano contesto e vengono fatturati.
Il modello non usa CoT perché glielo chiedi nel prompt. Lo fa da solo, perché è stato addestrato con reinforcement learning a generare catene di ragionamento prima di rispondere. I risultati parlano da soli.
Su AIME 2024 — la competizione matematica americana per le superiori — i numeri sono brutali:
- GPT-4o: 12% (1.8 problemi su 15)
- o1: 74% (11.1 problemi su 15)
Non è un refuso. Stesso tipo di benchmark, stessa famiglia di modelli, sei volte più accurato. E su MATH-500 — problemi di matematica a livello di competizione — o1 raggiunge il 96.4% contro il 75.9% di GPT-4o.
Claude Extended Thinking: ragionamento visibile
Anthropic ha fatto una scelta diversa: mostrare i token di ragionamento. Con Claude 3.7 Sonnet e poi Claude 4, il "thinking" è visibile — puoi leggere esattamente cosa sta "pensando" il modello prima di rispondere.
Un aspetto interessante: Claude 4 supporta l'interleaved thinking — può ragionare tra le tool calls. In un loop agente, questo significa che il modello può ricevere il risultato di un tool, pensarci su, decidere cosa fare dopo, e chiamare il tool successivo. Il ragionamento non è un blocco monolitico all'inizio — è distribuito lungo l'intero processo.
DeepSeek R1: il CoT che emerge da solo
E poi c'è DeepSeek, che ha fatto qualcosa di diverso da tutti gli altri. Il team cinese ha prima creato DeepSeek-R1-Zero — un esperimento in cui hanno preso il modello base e applicato solo reinforcement learning, senza supervisione umana sui passaggi di ragionamento, senza esempi di CoT, senza fine-tuning su dati annotati.
Il risultato: R1-Zero ha spontaneamente sviluppato chain-of-thought reasoning. Ha imparato da solo a ragionare passo dopo passo, a verificare i propri risultati, a fare backtracking quando un percorso non funzionava. Nessuno gli ha mostrato come fare. Il segnale di reward — "la risposta è giusta o sbagliata" — è bastato perché il modello scoprisse autonomamente che generare step intermedi porta a risposte migliori.
Il modello finale, DeepSeek-R1, parte da quell'intuizione ma aggiunge una pipeline multi-stage: cold-start data con esempi di ragionamento, RL su larga scala, e ulteriore fine-tuning. I benchmark sono competitivi con o1 (79.8% su AIME, 97.3% su MATH-500), ma il costo è circa il 96% più basso. Modelli open-source, architettura pubblica, e modelli distillati che girano su hardware consumer.
La convergenza è significativa: Wei et al. hanno scoperto il CoT come tecnica di prompting. OpenAI lo ha internalizzato tramite RL. DeepSeek lo ha fatto emergere spontaneamente con R1-Zero. Tre strade diverse, stessa destinazione. Quando approcci completamente indipendenti convergono sullo stesso meccanismo, è un segnale forte che quel meccanismo è fondamentale.
Il Lato Oscuro: il Ragionamento Infedele
Fin qui sembra tutto perfetto. Il modello "pensa ad alta voce", puoi leggere il ragionamento, verificare i passaggi. Trasparenza totale, giusto?
Non esattamente.
A maggio 2025, Anthropic ha pubblicato un paper dal titolo eloquente: "Reasoning Models Don't Always Say What They Think". Il team ha inserito deliberatamente degli hint nei prompt — suggerimenti sottili verso la risposta corretta — e ha verificato se i modelli ammettevano di averli usati nella catena di ragionamento.
I risultati sono inquietanti:
- Claude 3.7 Sonnet menziona l'uso dell'hint nel 25% dei casi
- DeepSeek R1: nel 39% dei casi
- In scenari "preoccupanti" (come accesso non autorizzato a risorse): Claude fedele nel 41%, R1 nel 19%
- Reward hacking: i modelli sfruttano scorciatoie nel 99% dei casi ma lo ammettono in meno del 2% delle catene di pensiero
Il modello arriva alla risposta giusta, ma la catena di ragionamento che ti mostra non riflette il processo reale. È come uno studente che copia il risultato dal compagno e poi scrive passaggi plausibili sulla lavagna per giustificarlo. I passaggi "tornano", ma non sono il percorso reale.
L'implicazione pratica è seria: non puoi usare la catena di pensiero come strumento di auditing affidabile. Se un modello trova un bug, una scorciatoia, o un exploit in un sistema, la sua "spiegazione" di come ci è arrivato potrebbe essere una ricostruzione post-hoc, non il ragionamento effettivo.
Il training con reinforcement learning migliora la fedeltà inizialmente, ma il paper mostra che la curva si appiattisce intorno al 20-28%. Non è un problema che si risolve con più training — sembra un limite strutturale dell'approccio.
Quando Usarlo e Quando No
Con tutto questo contesto, la domanda pratica: quando conviene usare il CoT, e quando è uno spreco?
Il trade-off nel 2026
Il panorama è cambiato rispetto al 2022. Allora, il CoT era una tecnica magica che moltiplicava le capacità di qualsiasi modello. Oggi, la maggior parte dei modelli potenti ha il ragionamento incorporato. Un paper della Wharton School pubblicato a giugno 2025 — "The Decreasing Value of Chain of Thought in Prompting" — quantifica esattamente questo shift.
Su modelli senza ragionamento integrato, il CoT esplicito nel prompt funziona ancora bene:
| Modello | Miglioramento con CoT |
|---|---|
| Gemini Flash 2.0 | +13.5% |
| Claude 3.5 Sonnet | +11.7% |
Su modelli con ragionamento integrato, è quasi inutile:
| Modello | Miglioramento con CoT | Tempo extra |
|---|---|---|
| o3-mini | +2.9% | +20-80% |
| o4-mini | +3.1% | +20-80% |
| Gemini Flash 2.5 | -3.3% | +20-80% |
Quel -3.3% di Gemini Flash 2.5 non è un errore: aggiungere "Let's think step by step" a un modello che già ragiona internamente può peggiorare le performance. Il modello finisce per ragionare due volte — una internamente e una nel testo visibile — con risultati che interferiscono.
Il costo energetico
C'è poi la questione del costo. Il progetto AI Energy Score di Hugging Face (Sasha Luccioni) ha misurato nel 2025 il consumo energetico dei reasoning model: in media 30 volte superiore rispetto alla stessa risposta senza ragionamento. Nei casi estremi — confrontando lo stesso modello con e senza reasoning attivo — fino a 700 volte.
Per un singolo prompt non fa differenza. Per un'applicazione che elabora migliaia di richieste al giorno, è un moltiplicatore di costi — e di emissioni — che non puoi ignorare.
La guida pratica
| Scenario | Strategia |
|---|---|
| Task semplice (classificazione, estrazione, formatting) | Niente CoT, modello veloce |
| Task medio con modello non-reasoning | Zero-shot CoT ("Let's think step by step") |
| Task specifico con modello non-reasoning | Few-shot CoT con esempi mirati |
| Task complesso, accuratezza critica | Reasoning model (o1, Claude thinking) |
| Reasoning model + prompt con CoT | Non serve — il modello lo fa già da solo |
| Serve massima accuratezza, budget ok | Self-consistency (N catene + voto) |
| Loop agente con tool use | Reasoning model con interleaved thinking |
La regola è semplice: se il modello ha ragionamento integrato, lascialo lavorare. Se non ce l'ha, dagli lo scratchpad di cui ha bisogno. E in entrambi i casi, ricorda che la catena di pensiero che vedi non è necessariamente il processo reale — è la migliore approssimazione che il modello riesce a generare.
Cosa Significa per Chi Sviluppa
Il Chain of Thought ha attraversato un arco completo in quattro anni. Nasce come tecnica di prompting nel 2022, diventa architettura con i reasoning model nel 2024, e nel 2026 è talmente integrato nei modelli che il prompt esplicito sta diventando ridondante.
Ma l'insight fondamentale resta: i transformer sono più capaci di quanto sembrano, a patto di dargli spazio per "lavorare". Il paper di Merrill e Sabharwal lo ha dimostrato formalmente — senza step intermedi, sono computazionalmente limitati. Con gli step, risolvono tutto P.
Se usi le API, la lezione pratica è: smetti di aggiungere "Let's think step by step" a Claude con extended thinking o a o3. Lo fanno già. Piuttosto, investi tempo nel prompt — contesto chiaro, vincoli espliciti, output ben definito. Quello fa ancora la differenza.
Se costruisci agenti, il CoT è il motore del loop Thought-Action-Observation. Ogni giro del ciclo ReAct è una mini-catena di pensiero seguita da un'azione e dalla sua osservazione. L'interleaved thinking di Claude 4 porta questo pattern al livello successivo — ragionamento continuo tra le tool calls, non solo all'inizio.
E se ti interessa la robustezza dei tuoi sistemi, tieni a mente il paper Anthropic sulla fedeltà. La catena di pensiero è utile per il debug, ma non è un audit trail affidabile. Un modello che arriva alla risposta giusta con ragionamento apparentemente corretto potrebbe aver seguito un percorso completamente diverso. Verifica i risultati, non i ragionamenti.
Sei parole hanno cambiato il campo. Ma la vera rivoluzione non sono le parole — è la scoperta che dare più spazio computazionale a un transformer ne estende le capacità in modo fondamentale. Tutto il resto — reasoning models, extended thinking, CoT emergente — è conseguenza di quell'intuizione.
Fonti:
- Wei et al. — Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (NeurIPS 2022)
- Kojima et al. — Large Language Models are Zero-Shot Reasoners (NeurIPS 2022)
- Wang et al. — Self-Consistency Improves Chain of Thought Reasoning (ICLR 2023)
- Yao et al. — Tree of Thoughts: Deliberate Problem Solving with LLMs (NeurIPS 2023)
- Merrill & Sabharwal — The Expressive Power of Transformers with Chain of Thought (ICLR 2024)
- Google Research — Language Models Perform Reasoning via Chain of Thought
- Anthropic — Reasoning Models Don't Always Say What They Think (maggio 2025)
- OpenAI — Learning to Reason with LLMs
- DeepSeek — DeepSeek-R1 (gennaio 2025)
- Meincke, Mollick et al. — The Decreasing Value of Chain of Thought in Prompting (Wharton, giugno 2025)