Scaling Laws: Più Grande = Più Intelligente?
Le scaling laws dicono che scalare funziona. Ma dicono anche che i rendimenti decrescenti erano previsti. Ecco perché un modello da 14B batte GPT-4o.
Alessandro Saiani
Human in the Loop

Phi-4 ha 14 miliardi di parametri. GPT-4o ne ha ordini di grandezza di più. Phi-4 batte GPT-4o su MATH e GPQA — benchmark di matematica e scienze a livello dottorale.
Non è un errore di misura. Non è un cherry-pick su un benchmark marginale. È la conseguenza diretta di leggi matematiche che l'industria ha letto al contrario per quattro anni.
Le scaling laws — le equazioni che descrivono come le performance di un modello scalano con dimensione, dati e compute — sono reali. Funzionano. Sono state confermate su sette ordini di grandezza. Ma quelle stesse leggi dicono una cosa che i pitch deck dei round da miliardi preferiscono omettere: i rendimenti decrescenti non sono un bug. Sono una feature. Sono scritti nella formula.
Capire le scaling laws non è un esercizio accademico. Per chi sviluppa, è la differenza tra scegliere il modello giusto per il proprio use case e buttare soldi in inferenza su un 70B quando un 14B fa lo stesso lavoro.
Le Leggi di Potenza, Senza le Formule
Nel 2020 un team di OpenAI guidato da Jared Kaplan pubblica un paper che cambia tutto. La scoperta: la loss di un language model — quanto sbaglia nelle predizioni — scala come una legge di potenza rispetto a tre variabili: numero di parametri, quantità di dati di training, e compute totale.
In pratica: raddoppi i parametri, la loss scende di una percentuale fissa. Raddoppi i dati, scende di un'altra percentuale fissa. La relazione è prevedibile su ordini di grandezza enormi.
Il punto chiave è negli esponenti. L'esponente per i dati (0.095) è più grande di quello per i parametri (0.076). Tradotto: aumentare i dati migliora il modello più che aumentare i parametri, a parità di tutto il resto.
Ma nel 2020 nessuno legge quella parte. Tutti leggono l'altra conclusione di Kaplan: per allocare il compute in modo efficiente, conviene costruire modelli molto grandi e addestrarli su relativamente pochi dati. Rapporto suggerito: 73% del budget in parametri, 27% in dati.
GPT-3 — 175 miliardi di parametri — nasce in parallelo a quella ricerca. La corsa alla scala è ufficialmente iniziata.
Chinchilla Ribalta Tutto
Due anni dopo, DeepMind pubblica il paper che avrebbe dovuto far ripensare l'intera industria. Il nome in codice è Chinchilla. Il titolo ufficiale: "Training Compute-Optimal Large Language Models."
Il team di Jordan Hoffmann addestra oltre 400 modelli, da 70 milioni a 16 miliardi di parametri, su quantità di dati variabili da 5 a 500 miliardi di token. Il risultato è devastante per chi aveva puntato tutto sulla dimensione.
Chinchilla — 70 miliardi di parametri, addestrato su 1.4 trilioni di token — batte uniformemente Gopher (280B), GPT-3 (175B), Jurassic-1 (178B) e Megatron-Turing NLG (530B). Un modello 4 volte più piccolo di Gopher, con lo stesso budget di compute ma 4 volte più dati.
La lezione è limpida: i modelli esistenti erano tutti sotto-addestrati. Avevano troppi parametri e troppo pochi dati. Il rapporto ottimale non era 73/27 a favore dei parametri — era circa 1:1. Per ogni raddoppio dei parametri, serve raddoppiare i token di training. Il rapporto di Chinchilla è circa 20 token per parametro.
In retrospettiva, Kaplan aveva già i numeri giusti. L'esponente dei dati era più grande di quello dei parametri. Ma la conclusione pratica che ne aveva tratto — modelli grandi con pochi dati — dipendeva da un'assunzione specifica: che il costo marginale dei dati fosse alto rispetto a quello dei parametri. Chinchilla dimostra che quell'assunzione era sbagliata.
Il Conto dei Giganti
Se le scaling laws fossero solo un dibattito accademico sugli esponenti, non varrebbe la pena scriverne. Ma i numeri dei costi raccontano un'altra storia.
| Modello | Anno | Costo stimato di training |
|---|---|---|
| GPT-3 | 2020 | ~$4.6M |
| GPT-4 | 2023 | $78-100M |
| Grok-2 | 2024 | ~$107M |
| Llama 3.1 405B | 2024 | ~$170M |
| Gemini 1.0 Ultra | 2023 | ~$191M |
| DeepSeek-V3 | 2025 | $5.6M* |
*Solo costo GPU del training finale di DeepSeek-V3 (su cui R1 e' costruito). Esclusi R&D, ablation studies e costo hardware.
Secondo lo Stanford AI Index 2025, ogni azienda spende in media 28 volte di più del modello precedente per il successivo flagship. Se il trend continua, Epoch AI stima che i training run più grandi costeranno oltre un miliardo di dollari entro il 2027.
Non è solo denaro. Le emissioni di CO2 sono passate da 588 tonnellate per GPT-3 a 8.930 per Llama 3.1 405B. Epoch AI proietta che entro il 2030 i training run più grandi richiederanno 4-16 GW di potenza — l'equivalente energetico di una piccola nazione.
La domanda non è se scalare funziona. La domanda è se il rapporto costo/beneficio ha ancora senso. E le scaling laws stesse rispondono: no, non sempre.
Rendimenti Decrescenti: Non una Sorpresa, una Previsione
Qui sta il paradosso che quasi nessuno coglie. I rendimenti decrescenti dello scaling non sono una sorpresa. Sono esattamente ciò che una power law prevede.
Con un esponente di 0.076 sui parametri, scalare 100 volte — da 1 miliardo a 100 miliardi — produce circa il 30% di riduzione della loss. Cento volte le risorse per il 30% di miglioramento. L'esponente dei dati (0.095) è più generoso: 100x dati producono circa il 35% di riduzione. Ma il punto resta: raddoppiare la scala non raddoppia il risultato. Mai.
Marc Andreessen — non certo un critico dell'AI — lo ha detto chiaro: "Stiamo aumentando le GPU allo stesso ritmo, ma non otteniamo affatto miglioramenti di intelligenza proporzionali."
GPT-4.5 è il caso studio perfetto. Budget di training probabilmente superiore a GPT-4, ma nessun salto qualitativo percepito. Le capacità migliorate sono state descritte come "bad bang for the buck". Non perché le scaling laws si siano rotte — ma perché funzionano esattamente come previsto. La curva non si ferma, semplicemente diventa sempre più piatta.
E c'è un altro muro in arrivo. Ilya Sutskever, co-fondatore di OpenAI, lo ha sintetizzato a NeurIPS 2024: "Data is the fossil fuel of AI. We have but one internet." Epoch AI stima che i dati testuali di alta qualità su internet saranno esauriti tra il 2026 e il 2032. L'esponente dei dati è il più generoso, ma i dati stanno finendo.
Le Abilità Emergenti Erano un Miraggio?
Una delle narrazioni più potenti a favore dello scaling era quella delle abilità emergenti: superata una certa soglia di dimensione, i modelli acquisivano improvvisamente capacità che non avevano prima. Come se scalare abbastanza producesse un salto qualitativo, non solo quantitativo.
Nel 2023, un team di Stanford ha smontato questa narrativa in un paper pubblicato a NeurIPS. Schaeffer, Miranda e Koyejo hanno dimostrato che le abilità emergenti sono in larga parte un artefatto della scelta della metrica.
Il meccanismo è semplice: metriche discontinue (tipo "ha risposto corretto sì/no") producono transizioni apparentemente improvvise. Metriche continue (tipo "quanto era accurata la risposta su una scala da 0 a 1") mostrano miglioramenti graduali e prevedibili. Su 29 metriche del benchmark BIG-Bench, 25 non mostrano alcuna proprietà emergente quando misurate con metriche lineari.
Non significa che i modelli grandi non facciano cose che i piccoli non fanno. Significa che il passaggio è graduale, non magico. E questo ha implicazioni dirette: se il miglioramento è graduale e prevedibile, puoi calcolare se il costo aggiuntivo di un modello più grande si giustifica per il tuo specifico caso d'uso. Spesso la risposta è no.
Le allucinazioni sono un esempio perfetto. Scalare non le elimina — le riduce gradualmente, ma con rendimenti decrescenti che rendono ogni punto percentuale di miglioramento sempre più costoso.
L'Industria Ha Già Cambiato Rotta
Se le scaling laws indicano rendimenti decrescenti nello scaling puro, l'industria ha tre opzioni: ignorare la matematica (costoso), trovare nuove dimensioni da scalare (creativo), o rendere efficiente ciò che già funziona (intelligente). Il 2025-2026 mostra che le opzioni due e tre hanno vinto.
Mixture of Experts. Oltre il 60% dei modelli open-source nel 2025 usa architetture MoE. Il principio: non attivare tutto il modello per ogni token, ma solo gli "esperti" rilevanti. DeepSeek-V3 ha 671 miliardi di parametri totali ma ne attiva solo 37 miliardi per ogni token — e il training finale è costato $5.6 milioni. A confronto, Llama 3.1 405B (modello denso, tutti i parametri attivi) è costato $170 milioni.
Modelli piccoli e densi. Phi-4 di Microsoft, 14 miliardi di parametri, batte GPT-4o su MATH e GPQA — benchmark di matematica e scienze a livello dottorale. Non perché ha più parametri, ma perché è stato addestrato su dati sintetici curati e corpora di altissima qualità. Anche Phi-4-mini (3.8B) impressiona: 83.7% su ARC-C — il più alto nel leaderboard dei modelli piccoli — e 88.6% su GSM8K. Modelli sotto 10B parametri ora eguagliano ciò che modelli 100B+ facevano solo 18 mesi fa.
Test-time compute. Invece di scalare il pre-training, scalare il compute durante l'inferenza. I modelli reasoning come o1 e o3 di OpenAI dedicano più tempo a "pensare" prima di rispondere. È una dimensione di scaling completamente diversa: non modelli più grandi, ma ragionamento più lungo. Con le sue sfide — chain-of-thought più lunghe non sempre migliorano l'accuratezza, e il costo di inferenza esplode — ma è una direzione che non richiede modelli più grandi.
La Lezione di Llama: Da Chinchilla a 200 Token per Parametro
L'evoluzione della famiglia Llama di Meta è la dimostrazione più chiara di come l'industria ha metabolizzato le scaling laws.
| Generazione | Parametri | Token/Parametro | Strategia |
|---|---|---|---|
| Llama 1 | 65B | ~20 | Chinchilla-optimal |
| Llama 2 | 70B | ~30 | Leggermente oltre Chinchilla |
| Llama 3 | 70B | 200+ | 10x oltre Chinchilla |
In tre generazioni, il rapporto token/parametro è passato da 20 a oltre 200. I parametri sono rimasti sostanzialmente stabili. I dati sono aumentati di 10 volte.
Perché? Un paper del 2024 — "Beyond Chinchilla-Optimal" — spiega il ragionamento. Le leggi di Chinchilla ottimizzano il costo di training. Ma nel mondo reale, il costo di inferenza spesso supera quello di training per ordini di grandezza. Per un modello servito a miliardi di richieste, conviene addestrare un modello più piccolo molto più a lungo: il costo extra di training si ripaga con un'inferenza enormemente più economica.
È la stessa logica dell'efficienza vs scala che si vede nel dibattito RAG vs long context: il vincitore non è chi ha più risorse, ma chi le usa meglio.
E i risultati lo confermano: Llama 3 70B, addestrato su 15 trilioni di token, è sostanzialmente superiore a Llama 1 65B addestrato su 1.4 trilioni. Stessa dimensione, dati radicalmente diversi, performance incomparabili.
L'Inferenza Costa 280 Volte Meno (e Scende Ancora)
C'è un numero che cambia la prospettiva su tutto il dibattito. Il costo per ottenere performance equivalenti a GPT-3.5 su MMLU è passato da $20 per milione di token nel novembre 2022 a $0.07 nell'ottobre 2024. Una riduzione di 280 volte in meno di due anni.
Questo dato — dallo Stanford AI Index 2025 — è forse il segnale più chiaro di dove sta andando l'industria. Non verso modelli sempre più grandi e costosi, ma verso modelli sempre più efficienti e accessibili.
L'efficienza algoritmica migliora del 3x all'anno: stessa performance con un terzo del compute. La "Densing Law" — documentata da Xiao, Cai e Zhao nel 2025 — mostra che l'efficienza per parametro migliora esponenzialmente nel tempo. Modelli più recenti raggiungono performance equivalenti con meno parametri, grazie a miglioramenti architetturali e algoritmi di training migliori. Non servono più parametri — servono parametri migliori.
Un Llama 3 8B su una singola GPU produce risultati paragonabili a ciò che un 70B produceva un anno prima — ma con 8 volte meno hardware, latenza inferiore, e costi che permettono di deployare on-premise anche a team piccoli.
Cosa Significa per Chi Sviluppa
Se sei uno sviluppatore che integra LLM nei propri prodotti, le scaling laws ti dicono tre cose concrete.
Il modello più grande non è il modello migliore per il tuo caso d'uso. Le power law garantiscono che un modello più grande sia marginalmente migliore su una media di benchmark. Ma "marginalmente" è la parola chiave. Per task specifici — code generation, math, classificazione — modelli specializzati più piccoli battono regolarmente generalisti più grandi. Phi-4 con 14B batte GPT-4o su math e scienze. Un modello da 8B che gira su una GPU e risponde in 200ms è spesso più utile di un 70B che richiede 8 GPU e risponde in 2 secondi.
Il costo di inferenza è il vero costo. Il training si paga una volta. L'inferenza si paga ad ogni richiesta. A 10.000 richieste al giorno, la differenza tra un modello efficiente e uno sovradimensionato è di ordini di grandezza in costi annuali. Le scaling laws ottimizzate per l'inferenza — quelle post-Chinchilla — dicono esattamente questo: addestra il modello più piccolo che funziona per il tuo task, ma addestralo bene e a lungo.
La tendenza è dalla tua parte. L'inferenza costa 280 volte meno di due anni fa. L'efficienza algoritmica triplica ogni anno. I modelli piccoli di oggi sono i modelli grandi di ieri. Se il tuo prodotto funziona con un modello da 8B oggi, tra un anno funzionerà con un modello da 3B che costa la metà. Non c'è motivo di fidarsi ciecamente del modello più grande solo perché è più grande.
Il vero messaggio delle scaling laws non è "più grande è meglio". È che la performance scala con risorse — e le risorse più efficaci non sono sempre quelle più ovvie. A volte è il dato, non il parametro. A volte è l'architettura, non la dimensione. A volte è il tempo di ragionamento, non il tempo di training.
Le aziende che hanno capito le scaling laws non stanno costruendo modelli più grandi. Stanno costruendo modelli più intelligenti. La differenza, per chi sviluppa, è di ordini di grandezza in costi, latenza e accessibilità.
Fonti:
- Kaplan et al. — Scaling Laws for Neural Language Models (2020)
- Hoffmann et al. — Training Compute-Optimal Large Language Models / Chinchilla (2022)
- Schaeffer et al. — Are Emergent Abilities of LLMs a Mirage? (2023)
- Sardana, Portes, Doubov & Frankle — Beyond Chinchilla-Optimal (2024)
- Stanford HAI — AI Index Report 2025
- Epoch AI — How Much Does It Cost to Train Frontier AI Models
- Epoch AI — Will We Run Out of Data?
- Fortune — Google Gemini Cost $191M to Train
- Gary Marcus — Confirmed: LLMs Have Reached Diminishing Returns
- Stanford HAI — AI's Ostensible Emergent Abilities Are a Mirage
- Sapien.io — The Diminishing Returns of Scaling AI Models
- NVIDIA Blog — Mixture of Experts Frontier Models
- Epoch AI — What Went Into Training DeepSeek R1
- MIT News — AI Environmental Impact