Siamo in un esponenziale?
Tre curve esponenziali reali. Tre che non lo sono. La differenza tra fare il dev oggi con realismo o con hype.
Alessandro Saiani
Human in the Loop

Nel paper Time Horizon 1.1 di METR c'è una frase che chi cita la curva non legge mai. È al paragrafo sui limiti metodologici, scritta dagli autori stessi: solo 5 dei 31 task lunghi (8 ore o più) nel benchmark hanno una baseline umana misurata davvero. Per gli altri 26 il "tempo umano" è una stima.
Cinque su trentuno. Il denominatore della curva più citata del 2026 — quella che dice "il time horizon degli agenti raddoppia ogni 3 mesi" — su task lunghi è stimato per l'84% dei casi. Lo dichiarano loro, in chiaro. Non c'è nulla di scandaloso: è onestà intellettuale. Lo scandalo è che la divulgazione che usa quel grafico per dire "siamo nell'esponenziale" la riga sui caveat la salta sistematicamente.
Da lì parte questo pezzo. Non per smontare METR — il loro lavoro è il migliore che abbiamo. Per smontare la domanda "siamo in un esponenziale?" così come viene posta nei thread, nei keynote, nei post di LinkedIn.
La domanda mal posta
"Esponenziale" è un aggettivo che descrive una funzione matematica su una variabile specifica. Senza la variabile, la frase è retorica. "Siamo in un esponenziale" non vuol dire niente se non si specifica esponenziale di cosa.
L'AI nel 2026 ha curve che corrono in direzioni diverse a velocità diverse. Alcune sono effettivamente esponenziali e ben documentate. Altre sembrano esponenziali ma stanno saturando, stanno cambiando asse, o non sono mai state esponenziali — solo, lo erano nel grafico sbagliato.
Provo a separare le due categorie con i numeri primari sotto mano.
Tre curve che esponenziali lo sono davvero
1. Il time horizon degli agenti (METR)
La metrica è semplice: a quale durata di task umano un agente raggiunge il 50% di success rate? METR ha calibrato 170+ task con baseline umane reali sui task brevi, stimate sui lunghi, e ha tracciato la curva nel tempo. Dal paper originale di marzo 2025 e dall'aggiornamento di gennaio 2026:
- Doubling time post-2023: 130,8 giorni (~4,3 mesi)
- Doubling time post-2024: 88,6 giorni (~3 mesi)
- Claude Opus 4.5: 320 minuti di time horizon al 50%, con intervallo di confidenza 170-729 minuti
- GPT-5: 214 minuti
- Claude Opus 4: 101 minuti
L'accelerazione è reale, non è stata smentita, e nella versione 1.1 METR ha esteso il metodo a 9 benchmark non-coding (scientific reasoning, math, robotics, computer use, self-driving) trovando "generally similar rates of improvement". Non è solo coding.
I caveat — i loro, non miei — pesano:
- 5/31 task lunghi con baseline umana reale
- Confidence interval su Opus 4.5 da 170 a 729 minuti (un fattore 4)
- Cambio infrastruttura Vivaria → Inspect sposta i risultati di modelli vecchi
- "La nuova suite è tratta da una distribuzione leggermente diversa"
La curva è solida. Il punto sull'asse Y di un singolo modello è molto meno solido di quanto suggerisca il grafico.
2. Compute di training (Epoch AI)
Qui i numeri non sono percepiti, sono fisici. Epoch AI traccia il compute di training dei modelli frontier dal 2010:
- 4,1× all'anno dal 2010 sui notable models, 5,3× all'anno sui frontier (90% CI 4,9-5,7)
- 5× all'anno dal 2020 per i language models frontier
- Budget di pre-training oltre $500M nel 2025, traiettoria verso $1-3B per modello entro il 2027
A questo si aggiunge il vincolo energetico, che Epoch analizza in un secondo studio: la power demand dei training run frontier cresce di oltre 2× l'anno, con proiezione 4-16 GW per singolo training run nel 2030. Il bottleneck è il cluster power, non i GPU.
Questa è la curva più robusta delle tre. È fatta di silicio, watt e dollari. Non di percezione.
3. Cost per token (l'esponenziale più chiaro)
Il declino del costo di inference a parità di capability è la curva che il dev sente in bolletta:
- GPT-4 a marzo 2023: $30/$60 per milione di token
- Gemini 2.5 Flash nel 2026: $0,15/$0,60 — ~200× di riduzione sull'input
- Decline di ~10× all'anno sul costo di inference a parità di capability
- Datapoint locale: il passaggio Opus 4.7 → 4.8 fast mode, 3× più economico in 41 giorni — l'ho analizzato in Opus 4.8 fast mode: cosa significa 3×
Tre anni fa un dialogo da 1M di token costava una pizza. Oggi un caffè. Questo è esponenziale di libro di testo.
Tre cose che esponenziali non lo sono (anche se vengono presentate così)
1. Capability per dollaro di pre-training
Qui il quadro si rompe. La citazione che gira è da MindStudio: "In 2021, doubling compute reliably doubled measurable capability; in 2025, doubling pre-training compute might buy only 10-20% improvement on the hardest reasoning tasks".
Il paper di dicembre 2025 su arXiv (2512.20264) — "The AI Scaling Wall of Diminishing Returns" — argomenta diminishing returns strutturali sul pre-training puro. È coerente con le scaling laws originali, in realtà: quando ti avvicini al soffitto di una loss, ogni raddoppio compra meno della metà.
Il dato che ha fatto rumore al launch di GPT-5 nell'agosto 2025 è user-perception (Transformer News): "the gap between GPT-4 and GPT-5 felt smaller to users than the gap between GPT-3.5 and GPT-4". User perception, non benchmark. Va trattata come segnale debole, non come dimostrazione.
Attenzione però a non trasformarlo in "plateau totale". Non lo è. È spostamento di asse: il test-time compute (reasoning, scratchpad esteso), i Mixture of Experts e i dataset sintetici aprono curve nuove con costi marginali diversi. La frase corretta non è "scaling è morto". È: l'esponenziale di "capability per dollaro speso in pre-training" non sta più correndo come prima — l'industria ha cambiato dove spendere il dollaro.
2. Benchmark saturati
SWE-Bench Verified è il caso da manuale. CodeAnt ha tracciato i risultati ad aprile 2026:
| Modello | SWE-Bench Verified |
|---|---|
| Claude Mythos Preview | 93,9% |
| GPT-5.3 Codex | 85% |
| Claude Opus 4.5 | 80,9% |
La frontiera ora corre sopra il 90%, ma la coda dei modelli "premium" è ammassata in una banda stretta — la media sui 83 modelli valutati è 63,4%, e i tre lab principali si sovrappongono nelle posizioni alte. L'originale SWE-Bench (2.294 task) "is rarely cited now because it's too easy for frontier models" — l'osservazione è di CodeAnt, ed è metodologia, non polemica.
A questo si aggiunge il problema della contaminazione: un audit di OpenAI ha trovato che "every major frontier model could reproduce verbatim gold patches" per alcuni task di SWE-Bench Verified, e OpenAI ha smesso di riportare il dato a inizio 2026. Quando si passa a SWE-Bench Pro, lo stesso Opus 4.5 crolla da 80,9% a 45,9% — un calo di 35 punti.
Il righello finisce, non la curva. Ma se quello che vedi è "il righello al massimo", confondi le due cose.
3. Reliability in produzione (Lusser's law)
Questa è la più importante per chi sviluppa, e quella su cui giro il pezzo verso la chiusura.
METR misura il 50% success rate. Non il 95%. Non il 99%. È una scelta metodologica sensata — sotto al 50% la curva diventa rumore — ma il salto dal 50% al 95% in produzione non è lineare.
Il paper "The Long-Horizon Task Mirage" su arXiv (2604.11978) lo misura empiricamente sugli agenti LLM:
"Even a small per-step error rate compounds across dependent steps, driving agents from reliable short-task performance to near-systematic failure at longer horizons."
È esattamente la dinamica di Lusser's law, formalizzata nel 1942 da Robert Lusser sui missili V-2 per affidabilità in serie (il paper non la cita esplicitamente, ma la matematica è la stessa). Se ogni step ha probabilità di successo p, una catena di n step indipendenti ha p^n. Con p = 0,99 e n = 100, il success rate complessivo crolla al 36,6%. Con p = 0,95 e n = 100, al 0,6%.
Ho già toccato questo punto in Long-running agents: l'autonomia fragile. Qui basta dire: la curva del 50% può raddoppiare ogni 3 mesi senza che la curva del 95% si muova quasi. Sono due esponenziali diverse, anche se la divulgazione le tratta come una sola.
La smentita di Chollet (che tutti citano male)
C'è una frase di François Chollet che gira come prova del "plateau dello scaling". Quasi sempre attribuita male. Su X, ad agosto 2025, Chollet scrive verbatim:
"I have never said this that scaling has hit a wall. I was saying the opposite (that scaling DL would deliver)... You might be thinking of Gary Marcus."
La sua posizione, come spiega in un'intervista a The Decoder, è più sottile: scaling funziona, ma non porta ad AGI; serve un altro paradigma (ARC-3, in arrivo nel 2026). Chi cita Chollet per dire "scaling è morto" lo confonde con Marcus, che quella tesi la sostiene da anni.
Distinzione editoriale che vale la pena fare, perché è esattamente il tipo di cortocircuito che genera il senso di "siamo nell'esponenziale che si schianta" — costruito su una citazione apocrifa.
Sutskever, intanto, a dicembre 2024 ha dichiarato che "pre-training as we know it will end", pivot esplicito verso il test-time compute. Anche questa, letta bene, non è "scaling è morto" — è cambio di asse.
Moore's Law non è una curva, è una sovrapposizione
Il parallelo storico più utile non è "Moore's Law continua / Moore's Law è finita". È: Moore's Law non è mai stata una curva. È la sovrapposizione di S-curve successive.
Transistor per chip è cresciuto esponenzialmente fino a circa il 2005. Poi è rallentato. Ma "performance per dollaro" ha continuato a salire perché è arrivato il multicore. Poi le GPU. Poi gli ASIC. Poi gli acceleratori specializzati. Ognuna è una S-curve: cresce esponenzialmente, satura, e il testimone passa a un'altra variabile.
Carlota Perez, nel suo Technological Revolutions and Financial Capital (2002), descrive lo stesso pattern per le bolle tecnologiche: la crescita esponenziale percepita nella "installation phase" entra in una "deployment phase" più lenta, dove il valore si redistribuisce ma la curva originale non c'è più. Non è "fine dell'esponenziale". È fine dello stesso esponenziale.
L'AI nel 2026 è probabilmente in transizione. Il pre-training puro sta saturando. Il test-time compute è ancora ripido. Il time horizon al 50% accelera. Il time horizon al 95% si muove poco. Compute e cost decline corrono. Benchmark vecchi muoiono, benchmark nuovi nascono.
Chiedere "siamo in un esponenziale?" è come chiedere nel 2005: "Moore's Law è finita?". La risposta giusta è: dipende quale curva guardi.
Per chi sviluppa con agenti AI oggi
Per il dev che usa Claude Code o Copilot ogni giorno — io, te, chi legge questo blog — la curva che conta non è il time horizon al 50%.
È il time horizon al 95% reliability. Quella che permette di lasciare un agente da solo su un task da 4 ore di sera e trovare la PR pronta la mattina senza che abbia fatto disastri.
Quella curva si muove molto più lentamente di quanto suggeriscano i grafici. Lusser's law spiega perché: il guadagno per-step da 95% a 99% richiede miglioramenti strutturali (verifica, rollback, harness, sub-agenti specializzati) molto più costosi del guadagno da 70% a 80%. Non è solo "modello più bravo". È architettura del sistema attorno al modello.
In pratica, per decidere quanto fidarti di un agente su un task lungo oggi:
- Non guardare il time horizon al 50% (METR). È un proxy interessante della frontiera, non un proxy del tuo workflow.
- Guarda il tuo tasso di rework reale negli ultimi 30 giorni di PR generate da agenti. Misuralo. È il tuo p^n personalizzato.
- Decomponi i task lunghi in step verificabili. Ogni checkpoint ti riporta p verso 1, e rompi la catena di Lusser.
- Tratta la curva del cost decline come reale: i tuoi pattern di uso del 2025 sono economicamente diversi nel 2026. Vale la pena ricalibrare quanto contesto carichi, quanti tentativi lasci, quanto parallelo lanci.
La domanda "siamo in un esponenziale?" è un test di sobrietà più che di previsione. Se la risposta è "sì" senza specificare di cosa, è hype. Se la risposta è "no" senza specificare di cosa, è cinismo. Tre curve corrono. Tre no. Sapere quali fai correre tu, in produzione, è il lavoro.
Il resto sono grafici fatti per Twitter.
Fonti
- METR — Time Horizon 1.1 (gennaio 2026)
- METR — Measuring AI Ability to Complete Long Tasks (marzo 2025)
- Epoch AI — Training compute of frontier AI models grows by 4-5x per year
- Epoch AI — Power demands of frontier AI training
- François Chollet su X — chiarimento posizione scaling
- The Decoder — Chollet on the end of scaling, ARC-3 and his path to AGI
- Long-Horizon Task Mirage (arXiv 2604.11978)
- The AI Scaling Wall of Diminishing Returns (arXiv 2512.20264)
- CodeAnt — SWE-Bench saturation 2026
- Transformer News — GPT-5 is no slowdown
- MindStudio — AI Scaling Laws Are Breaking Down