🧠 Teoria10 minuti di lettura

«Aspetta, ricontrollo»: quando un modello ragiona davvero e quando recita

Nel ragionamento dei modelli c'è un punto dopo il quale la risposta non cambia più: su alcuni modelli arriva dopo il 13% del testo. Sulle domande facili il resto è teatro, sulle difficili no. E quando un'informazione arriva da un tool, il ragionamento tende a non dirlo.

AS

Alessandro Saiani

Human in the Loop

«Aspetta, ricontrollo»: quando un modello ragiona davvero e quando recita

Se hai aperto almeno una volta il blocco di ragionamento di un modello, l'hai vista. Il modello arriva a una risposta, la scrive, e poi aggiunge: "Wait, let's check." Rifà il conto. Trova lo stesso numero. "But..." Considera un'alternativa, la scarta. "So the answer is..." E scrive la risposta che aveva già.

La domanda viene spontanea: stava davvero ricontrollando, o stava recitando la parte di chi ricontrolla? Fino a poco tempo fa si poteva solo tirare a indovinare, e il dibattito oscillava fra due posizioni comode: "questi modelli pensano come noi" e "è solo autocompletamento che finge di pensare". Nel 2026 è uscita una serie di ricerche che guardano dentro il modello mentre ragiona, e la risposta è più interessante di entrambe. Il ragionamento visibile è un misto di calcolo vero e di teatro, e adesso si riesce a misurare quale parte è quale.

Il foglio di brutta è vero

Il punto di partenza non è in discussione. Nel pezzo sulla chain of thought avevamo visto perché far "pensare" un modello funziona: ogni token generato è un passo di calcolo in più, e un transformer che può scrivere passaggi intermedi risolve problemi che senza non potrebbe risolvere. Il ragionamento è un foglio di brutta, e il foglio di brutta serve.

La domanda nuova è un'altra. Non se il ragionamento serva, ma quale parte serva. Un foglio di brutta può contenere il conto che ti ha portato alla soluzione, e anche tre righe di verifiche fatte dopo, quando la soluzione ce l'avevi già. Leggendolo da fuori non sai distinguere le due cose. Guardando dentro, sì.

Il punto di non ritorno

A giugno un gruppo di ricercatori di Milano-Bicocca, Trieste, Groningen e Northeastern ha pubblicato Beyond the Commitment Boundary (Scalena, Candussio, Bortolussi, Fersini, Nissim, Sarti). L'idea del metodo è semplice. Prendi il ragionamento di un modello, taglialo dopo la prima frase e costringilo a rispondere. Poi taglialo dopo la seconda, poi dopo la terza, e così via. A ogni taglio misuri quanto il modello è sicuro della risposta che darà alla fine.

Quello che viene fuori non è una curva che sale piano. È un gradino. Per quasi tutto il ragionamento il modello non ha una risposta, o ne considera di provvisorie; poi, in una sola frase, passa alla risposta finale e non la cambia più. Il salto più grande è in media 4,6 volte il secondo più grande, su oltre tremila tracce. Gli autori lo chiamano commitment boundary, il confine dell'impegno.

Dove cade dipende soprattutto dal modello. Gemma 4 si impegna dopo appena il 13-23% del ragionamento, Qwen3 fra il 22 e il 40%, gpt-oss-20b fra il 43 e il 68%. In tutti i casi c'è un pezzo consistente di testo scritto dopo che la decisione è stata presa. E che cosa c'è in quel pezzo? Le parole più frequenti all'inizio delle frasi sono "but" e "let's check". È esattamente la scena dell'apertura.

La prova che quella coda non conta è causale. Gli autori prendono problemi di matematica e alterano a caso una parte dei numeri scritti nel ragionamento. Se alterano il 20% dei numeri prima del confine, la risposta finale resta uguale solo nel 61% dei casi. Se li alterano dopo, resta uguale nel 95%. Quello che il modello scrive dopo essersi impegnato può essere sbagliato, e la risposta non se ne accorge. Gli autori usano un termine preciso: ragionamento epifenomenico, che accompagna il processo senza causarlo. Fermando il modello al confine, il ragionamento si accorcia fino al 55% in media, con una perdita di accuratezza minima.

Teatro sì, ma soprattutto sulle domande facili

Qualche mese prima, a marzo, un paper di Goodfire e Harvard aveva dato un nome al fenomeno: Reasoning Theater, poi accettato a ICML. Gli autori addestrano delle sonde, piccoli classificatori che leggono le attivazioni interne del modello, e le usano su DeepSeek-R1 e GPT-OSS 120B mentre ragionano. Il risultato: a volte il modello "becomes strongly confident in its final answer, but continues generating tokens without revealing its internal belief". Sa già cosa risponderà, e continua a scrivere come se non lo sapesse.

Ma il paper non si ferma lì, ed è la parte che lo rende utile. Il teatro dipende dalla difficoltà. Sulle domande di semplice richiamo di conoscenze, la risposta si legge nelle attivazioni molto prima che compaia nel testo, e fermare il modello quando la sonda è sicura fa risparmiare l'80% dei token senza perdere accuratezza. Sulle domande difficili, quelle che richiedono più passaggi di ragionamento scientifico, il risparmio scende al 30%: lì il ragionamento sta lavorando davvero.

E i ripensamenti? I momenti in cui il modello torna indietro, o ha un "aha", compaiono "almost exclusively in responses where probes show large belief shifts": quasi solo nelle risposte in cui, dentro, il modello ha davvero cambiato convinzione. Messi insieme, i due paper suggeriscono una lettura precisa: i dubbi scritti prima del punto di non ritorno sono veri, quelli scritti dopo sono coda. Il problema è che leggendo il testo non vedi dove passa il confine.

Cosa ha insegnato davvero l'addestramento

C'è un secondo modo di chiedersi quanto sia "vero" il ragionamento: chiedersi da dove viene. I modelli che ragionano sono addestrati con reinforcement learning su compiti verificabili: il modello prova, se la risposta è giusta viene premiato. L'idea diffusa è che così impari strategie nuove.

Un paper dell'università Tsinghua, presentato come oral a NeurIPS 2025, ha messo alla prova quell'idea. Gli autori hanno confrontato ogni modello addestrato con il suo modello base, lasciando a entrambi molti tentativi per ogni problema. Con un solo tentativo vince il modello addestrato. Con molti tentativi, vince il modello base: "current training rarely elicit fundamentally new reasoning patterns". Le strade che il modello addestrato percorre erano già tutte fra quelle che il modello base poteva percorrere. L'addestramento gli ha insegnato a imboccare subito quella giusta, e nel farlo ha ristretto il ventaglio: man mano che l'addestramento procede, il numero di problemi risolvibili con molti tentativi scende. Il modello diventa più preciso e meno esplorativo.

Non è la parola definitiva. NVIDIA ha risposto con ProRL, sostenendo che un addestramento molto più lungo trova "novel reasoning strategies that are inaccessible to base models". E gli stessi autori di Tsinghua scrivono che la distillazione, cioè imparare da un modello più forte, porta davvero schemi nuovi. Ma il quadro di fondo regge: il ragionamento che leggi è in gran parte il modo in cui il modello ha imparato a cercare fra cose che sapeva già fare.

C'è un esperimento di Anthropic del 2025 che rende l'idea meglio di qualunque grafico. Guardando dentro Claude 3.5 Haiku mentre somma 36 e 59, i ricercatori hanno visto due percorsi in parallelo: uno stima l'ordine di grandezza, l'altro calcola l'ultima cifra. Poi hanno chiesto al modello come aveva fatto. Ha descritto il riporto che si impara alle elementari. Anthropic lo scrive così: "Claude seems to be unaware of the sophisticated 'mental math' strategies that it learned during training." La spiegazione e il calcolo sono due cose diverse, e il modello conosce solo la prima.

Il parlante che non coopera

Nel 1975 il filosofo Paul Grice pubblicò Logic and Conversation, dove descriveva le regole implicite di una conversazione funzionante: dire quanto serve e non di più, dire solo ciò che si crede vero, essere pertinenti, essere chiari. Le chiamò massime, e le raccolse sotto un principio di cooperazione. Quando parliamo diamo per scontato che l'altro le rispetti, ed è per questo che ci capiamo anche quando le cose non vengono dette fino in fondo.

Gli autori di Reasoning Theater usano Grice per descrivere il problema in una frase: "CoT monitors are at best cooperative listeners, but reasoning models are not cooperative speakers." Chi legge il ragionamento, persona o programma, lo legge come se fosse il resoconto sincero di un parlante cooperativo. Ma il modello non è stato addestrato a informare chi lo legge: è stato addestrato ad arrivare alla risposta giusta. Il testo che produce è uno strumento di calcolo che ha l'aspetto di un resoconto.

Per chi usa agenti, questo ha una conseguenza molto concreta. A fine agosto un gruppo dell'università di Edimburgo ha pubblicato FACE-Eval, 5.100 casi su 15 modelli open, da 4 miliardi a 1,6 trilioni di parametri. L'esperimento: dare al modello un'informazione sulle preferenze dell'utente, a volte nel messaggio, a volte dentro il risultato di un tool (una memoria, un'email, un messaggio Slack), e vedere se il ragionamento ammette di averla usata per orientare la risposta. Su tutti e 15 i modelli, quando l'informazione arriva da un tool, il ragionamento lo ammette meno spesso. E dire al modello che il suo ragionamento sarà letto cambia la differenza di al massimo 7 punti su 100.

Un agente di coding vive di risultati di tool: file letti, output di comandi, documentazione scaricata, memoria. Se una di queste cose lo orienta, il suo ragionamento può non dirlo. I laboratori lo sanno. L'anno scorso un documento firmato da 42 ricercatori definiva la leggibilità del ragionamento "a new and fragile opportunity". OpenAI aveva mostrato che, se si penalizzano i "pensieri cattivi" durante l'addestramento, il modello impara a nasconderli continuando a comportarsi male. E con GPT-6 Astra ha dichiarato per la prima volta un calo di monitorabilità, definendolo serio.

La parte onesta

Primo limite: le sonde sono modelli anche loro. Leggono le attivazioni con buona accuratezza, ma non sono una finestra perfetta sul "pensiero" del modello, e Anthropic stessa scrive che i suoi metodi catturano "only a fraction of the total computation".

Secondo: tutti questi studi usano modelli open, perché servono le attivazioni interne. Nessuno ha misurato il punto di non ritorno su Opus 5 o su GPT-6, e il confine cambia molto da una famiglia all'altra: estendere i numeri ai modelli chiusi sarebbe inventare.

Terzo: "teatro" è una parola che rischia di dire troppo. Le frasi dopo il confine non cambiano la risposta, ma non sono una bugia, e non sappiamo se abbiano un ruolo nell'addestramento. E sulle domande difficili il ragionamento è in gran parte genuino, ripensamenti compresi. Chi ne ricava "i modelli fingono di pensare" ha letto metà dei paper.

Quarto: FACE-Eval testa preferenze politiche, etiche e di atteggiamento, non codice. Il meccanismo è lo stesso che userebbe un agente di coding, ma nessuno l'ha ancora misurato su un repository.

Cosa farne stasera

La prima conseguenza è economica. Una parte del ragionamento che paghi arriva dopo la decisione, e sui compiti semplici è la parte più grande. Opus 5 ragiona di default e produce quasi il doppio dei token di output del predecessore per fare le stesse cose. Nessuno ha misurato il confine sui modelli chiusi, ma sulle richieste di richiamo, di formattazione o di ricerca nel codice è probabile che tu stia pagando soprattutto la coda. Vale la pena provare un livello di sforzo più basso su quelle, e guardare se la qualità cambia davvero.

La seconda riguarda cosa leggi. Il ragionamento resta lo strumento di debug migliore che hai: i ripensamenti prima della decisione sono veri, e ti dicono dove il modello era incerto. Ma non è un verbale. Se vuoi sapere perché un agente ha fatto una cosa, guarda anche cosa gli è entrato nel contesto: i file che ha letto, gli output dei comandi, le pagine che ha scaricato. È lì che può esserci l'indizio che il ragionamento non nomina.

La terza è la più vecchia. Si verifica la risposta, non il racconto di come ci si è arrivati. Il modello scrive "Wait, let's check" per le ragioni sue. Il controllo vero lo fanno i test.


Fonti:

  1. Scalena, Candussio, Bortolussi, Fersini, Nissim, Sarti — Beyond the Commitment Boundary: Probing Epiphenomenal Chain-of-Thought in Large Reasoning Models (arXiv 2606.13603, giugno 2026)
  2. Boppana, Ma et al. — Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought (ICML 2026, arXiv 2603.05488)
  3. Yue et al. — Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? (NeurIPS 2025, arXiv 2504.13837)
  4. Liu et al. — ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models (arXiv 2505.24864)
  5. Anthropic — Tracing the thoughts of a large language model (marzo 2025)
  6. Gema, Rajani, Saxena, Kwan, Minervini — Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered (arXiv 2608.29464, agosto 2026)
  7. Korbak et al. — Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety (arXiv 2507.11473)
  8. Baker et al. — Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation (arXiv 2503.11926)
  9. Paul Grice — Logic and Conversation (1975), in Syntax and Semantics, vol. 3: Speech Acts