Il report Anthropic sull'agentic coding: cosa dice davvero (e cosa la realtà smentisce)
Anthropic dice che l'AI tocca il 60% del lavoro di coding. Ma ammette che la delega completa resta allo 0-20%. La distanza tra il trend dichiarato e il vissuto del dev è il vero dato — letto con la telemetria, non col marketing.
Alessandro Saiani
Human in the Loop

Una mappa disegnata da chi vende il territorio è accurata. Le strade ci sono, le distanze tornano, i fiumi scorrono dove dovrebbero. Quello che cambia è la legenda: i cartelli che dicono "qui si arriva facile", "questo passo è già aperto", "il viaggio vale la pena". Non sono falsi. Sono scritti da qualcuno che ha interesse a farti partire.
Il "2026 Agentic Coding Trends Report" di Anthropic, uscito qualche mese fa, è una mappa di questo tipo. Otto trend sul futuro del coding agentico, corredati da case study di clienti che usano Claude Code. È un documento utile, in parte perfino onesto. Ma è anche, per costruzione, materiale di chi vende l'infrastruttura agentica.
Il punto interessante non è "è tutto marketing" — sarebbe pigro, perché diversi trend sono confermati da dati indipendenti. E non è nemmeno "l'AI cambia tutto" — l'hype che si legge in cinquanta blog identici. Il punto è un dato che il report stesso ammette e che quasi tutta la copertura salta: l'AI tocca il 60% del lavoro di coding, ma la delega completa resta allo 0-20% dei task. Anthropic la chiama "intelligent human oversight" e la incornicia come forza della collaborazione. Letta dall'altra parte, è un soffitto di delega. La frase è la stessa. La cornice cambia tutto.
Cosa è davvero questo report
Prima di leggerlo serve sapere che genere di documento è. Non è uno studio peer-reviewed, non è una telemetria cross-tool, non è un campione randomizzato. È un forecast and framing document: previsione di direzione più inquadramento narrativo.
Si basa, per dichiarazione propria, su due cose. La prima è ricerca interna Anthropic sui pattern d'uso dei propri ingegneri — self-report, non verificabile dall'esterno. La seconda sono case study di alcune organizzazioni clienti. Sono storie di successo selezionate, non un campione.
Questo non lo squalifica. Lo colloca. Una previsione di direzione e una telemetria sul campo sono generi diversi, non verità e bugia. Il report serve come ipotesi su dove sta andando il territorio. Per misurare quanto ci sei vicino, servono altri strumenti. La differenza tra Anthropic e i dati indipendenti — Faros, DORA, METR — non è "chi mente": è forecast contro misura. Il lettore deve solo sapere quale dei due ha in mano.
Gli otto trend, in sintesi: i cicli di sviluppo si comprimono da settimane a ore; i sistemi multi-agent sostituiscono il single-agent; gli agent eseguono task lunghi ore o giorni; la supervisione umana resta intelligente ma necessaria; l'agentic coding raggiunge codebase legacy e utenti non tecnici; l'economia della produttività si ridisegna; arrivano gli utenti non tecnici che costruiscono i propri tool; la sicurezza diventa architetturale fin dall'inizio.
Prendiamone tre, quelli dove la distanza tra mappa e territorio si misura meglio.
Il soffitto che il report ammette: 60% sì, ma delega 0-20%
Partiamo dal dato che apre il pezzo, perché è il più onesto del report e il più ignorato dalla copertura.
Anthropic scrive, basandosi sulla ricerca interna sui propri ingegneri, che l'AI è coinvolta in circa il 60% del lavoro di coding. Ma che i dev riescono a delegare completamente solo lo 0-20% dei task. Tradotto: nell'80-100% dei casi c'è ancora un umano dentro il loop — a verificare, correggere, decidere. Il report lo incornicia come "intelligent human oversight" e lo presenta come la forma matura della collaborazione uomo-macchina.
È vero. Ed è anche un soffitto. Dopo anni di hype sull'autonomia, la quota di lavoro che si può davvero lasciare correre da sola senza un umano che guarda è una fetta sottile. La stessa Anthropic, nel comunicare il report, lo dice in modo che vale la pena incorniciare:
"Autonomous doesn't yet mean unsupervised."
Autonomo non significa ancora non supervisionato. È la frase più importante del documento, ed è quella che la narrativa mainstream taglia, perché non vende keynote. Il valore non sparisce con l'agentic coding. Si sposta: dal fare al supervisionare. Ne ho scritto applicando lo stesso framing alla velocità individuale in Il paradosso della velocity AI — lì il soffitto è il 10% di potenziale che il singolo dev usa davvero; qui è lo 0-20% di delega che l'organizzazione riesce a concedere. Due numeri diversi, stessa forma: una distanza tra ciò che si dice possibile e ciò che si vive.
Questo non è un contraddittorio al report. È il report che dice la verità a bassa voce.
Multi-agent: "sostituisce" il single-agent? Lo smentisce Anthropic stessa
Il secondo trend dice che i sistemi multi-agent sostituiscono le architetture single-agent per i task complessi. Qui il contraddittorio più forte non arriva da un competitor. Arriva da Anthropic, in un altro suo documento.
Nel paper di ingegneria sul proprio sistema di ricerca multi-agent (giugno 2025), Anthropic scrive nero su bianco:
"most coding tasks involve fewer truly parallelizable tasks than research, and LLM agents are not yet great at coordinating and delegating to other agents in real time"
La maggior parte dei task di coding ha meno parti davvero parallelizzabili della ricerca, e gli agent non sono ancora bravi a coordinarsi in tempo reale. Il famoso +90,2% di performance del multi-agent vale per i task di ricerca, non di coding. E costa circa 15 volte più token di una chat normale — al punto che, sempre nel paper, "l'uso di token da solo spiega l'80% della varianza" nei risultati dei task di ricerca. Più token, più ricerca parallela, miglior risultato. Ma sui task di ricerca.
Cognition arriva alla stessa conclusione dal lato pratico. Nel loro lavoro sui sistemi multi-agent osservano che il decision-making si frammenta quando più agent scrivono in parallelo, e che i sistemi multi-agent funzionano meglio quando le scritture restano single-threaded e gli agent aggiuntivi contribuiscono intelligenza, non azioni. Lo swarm di agent che scrivono in parallelo è fragile. Il pattern che regge è un solo agent che scrive, con gli altri che osservano e suggeriscono.
Ho dedicato un pezzo intero a quando dividere e quando no, Subagents: quando dividere e quando no, con i numeri e i casi reali — inclusi i conti da decine di migliaia di dollari per pipeline multi-agent lasciate correre. La sintesi che conta qui: il report dice "multi-agent sostituisce single-agent". La realtà misurata è "multi-agent affianca single-agent per i pochi task davvero parallelizzabili, e per il resto le scritture restano single-threaded". Non è la stessa frase.
Economia della produttività: il volume cresce. E la qualità?
Il sesto trend è il più rilevante per chi paga le licenze: l'economia della produttività si ridisegna, il volume di output cresce, e una quota del lavoro AI-assisted è lavoro interamente nuovo che senza agent non sarebbe stato tentato.
La prima metà è confermata dalla telemetria indipendente. Il report 2026 di Faros AI — non un sondaggio, ma telemetria reale su 22.000 sviluppatori e oltre 4.000 team per due anni — misura un aumento del volume netto: gli epic per dev crescono del 66%, il throughput del 33,7%, il merge rate delle PR del 16,2%. Il volume sale davvero. Su questo Anthropic ha ragione.
Poi guardi il resto dello stesso report Faros, ed è qui che la mappa si stacca dal territorio:
| Metrica (telemetria Faros, alta adozione AI) | Variazione |
|---|---|
| Epic per dev | +66% |
| Throughput | +33,7% |
| Code churn (rework di codice appena scritto) | +861% |
| Rapporto incidenti/PR | +242,7% |
| Aumento bug per dev (2025 → 2026) | da +9% a +54% |
| Tempo mediano in review | +441,5% |
| PR mergiate senza alcuna review | +31,3% |
La sintesi di Faros è secca: il volume sale, la qualità scende, e il divario si allarga man mano che l'adozione si approfondisce. Il code churn — la quota di codice riscritto poco dopo essere stato scritto — cresce di quasi nove volte. E la crescita dei bug per sviluppatore accelera: l'aumento anno su anno passa da +9% nel 2025 a +54% nel 2026. E un terzo in più di PR finisce in main senza che nessuno l'abbia guardata.
C'è di più, e tocca direttamente il primo trend del report (i cicli che si comprimono "da settimane a ore"). È vero a livello di singolo task, falso a livello di delivery aziendale: il tempo mediano in review esplode del 441,5%. Il collo di bottiglia non sparisce, si sposta a valle. Generi codice più in fretta e poi resti fermo a verificarlo più a lungo. La compressione del ciclo a monte diventa congestione a valle.
DORA 2025 di Google, su un campione diverso (sondaggio di circa 5.000 dev), arriva alla stessa famiglia di conclusioni con un concetto utile: l'AI è un amplificatore. Il 95% dei dev la usa, oltre l'80% riporta guadagni di produttività, ma l'adozione mantiene una relazione negativa con la stabilità del software delivery. L'AI ingrandisce i punti di forza e di debolezza che un'organizzazione ha già.
Sul self-report c'è una lezione che vale per tutto il report Anthropic, e l'ha quantificata METR: nel loro RCT del 2025, dev esperti su task reali risultarono il 19% più lenti con l'AI, mentre si percepivano il 20% più veloci — un divario di percezione di quasi 40 punti. Ne ho parlato in dettaglio nel paradosso della velocity, e qui basta il principio: il self-report sovrastima sistematicamente. Una precisazione doverosa, perché gira male: METR ha più di recente rivisto il nuovo esperimento (febbraio 2026) e richiamato l'incertezza sull'entità reale dello speedup — non ha ritrattato il 19% del 2025. La cautela non è "l'AI rallenta", è "non fidarsi della percezione, misurare". E il report Anthropic poggia in parte proprio su percezione interna e su case study auto-selezionati.
Il conflitto di interesse, pesato (senza liquidare)
Anthropic vende Claude Code, l'Agent SDK, l'infrastruttura agentica. Un report intitolato "Agentic Coding Trends" che conclude che l'agentic coding è il futuro è anche un documento di marketing. Tre marcatori concreti, da tenere a mente leggendolo:
I case study sono quasi tutti clienti Claude. Selezione di successi, non campione rappresentativo. La ricerca interna è self-report non verificabile dall'esterno — e abbiamo appena visto quanto il self-report sbagli. E la cornice stessa è una scelta narrativa: lo 0-20% di delega presentato come forza collaborativa anziché come soffitto.
Ma fermarsi qui sarebbe cinismo pigro, l'altra faccia dell'hype. Il modo onesto di pesarlo è questo: il report è utile come ipotesi di direzione, parziale come misura. Non è falso — è orientato per costruzione. La mappa è buona, la legenda è di parte. Sapendolo, la usi per quello che vale: capire dove sta andando il territorio, non quanto sei già arrivato.
Cosa il report coglie giusto
L'onestà va in entrambe le direzioni. Diverse cose nel report reggono al contraddittorio dei dati indipendenti, e dirlo è doveroso quanto smontare il resto.
Il caveat 60/0-20% è intellettualmente onesto: molti report l'avrebbero nascosto, Anthropic l'ha messo in chiaro. "Autonomous doesn't yet mean unsupervised" è allineato con METR, con Faros e con la realtà quotidiana della verifica umana. La crescita del volume di output è confermata dalla telemetria Faros: il volume sale davvero, è la qualità il prezzo nascosto. Il concetto di AI come amplificatore è confermato da DORA. E il trend sulla sicurezza — capacità dual-use che richiedono difese embedded fin dall'inizio — converge con quello che ho descritto in Red teaming dell'agentic coding: non è hype, è un rischio reale che cresce con l'autonomia.
C'è anche un filo tecnico che il report tocca e che vale la pena seguire: gli agent che girano per ore hanno bisogno di tenere lo stato, e la gestione della memoria è oggi il vero vincolo delle run lunghe — ne ho scritto in Memoria degli agenti: stato dell'arte. Un agent "long-running" senza una buona gestione della memoria non è autonomo, è solo lungo.
E sul fronte organizzativo, la conferma più scomoda l'ho argomentata altrove: incollare l'AI sopra il flusso di lavoro di sempre non produce il salto, lo ingoia. È il tema di L'AI sopra il workflow non funziona, e si lega all'amplificatore di DORA: l'AI ingrandisce il processo che già hai, buono o cattivo che sia.
Una sezione onesta
Tre limiti di questa stessa analisi, perché la regola vale anche per me.
Il PDF ufficiale del report non è facilmente leggibile come testo, e l'elenco dei trend deriva da sintesi terze convergenti, non dalla citazione letterale di ogni passaggio. Le frasi che ho virgolettato vengono dal paper engineering Anthropic sul multi-agent e dalla comunicazione ufficiale, fonti che ho potuto verificare; i singoli numeri dei case study (le ore risparmiate dichiarate dai clienti) sono dati interni Anthropic non triangolati, e li tratto come affermazioni di parte, non come fatti misurati.
La data esatta del report non l'ho stampata: collocazione "inizio 2026", senza pretesa di precisione al giorno. E alcuni numeri di case study che girano — una run da molte ore, una codebase enorme modificata in una singola sessione — potrebbero riferirsi allo stesso caso descritto in modi diversi: non li uso come prove distinte, sono best case auto-selezionati e contano poco per il dev medio.
Infine: Faros e DORA misurano cose diverse con metodi diversi (telemetria contro sondaggio), e convergono sulla direzione ma non sono lo stesso dato. Il +66% di epic e il +861% di churn sono Faros, telemetria. Il "95% di adozione" e l'amplificatore sono DORA, sondaggio. Tenerli separati è parte del mestiere di leggere la mappa.
La lettura finale
Il report Anthropic non mente e non rivela. Dice una cosa vera con la cornice che gli conviene: l'AI è ovunque nel lavoro di coding (60%), ma la quota che si può lasciare correre da sola è sottile (0-20%). La telemetria indipendente aggiunge il prezzo che il framing tende a sfumare: il volume sale, ma con esso salgono churn, incidenti e bug, e il collo di bottiglia migra a valle, sul tempo di review.
Né "cambia tutto" né "è tutto marketing". La distanza misurabile tra il trend dichiarato e il vissuto del dev è essa stessa il dato. E quella distanza ha un nome operativo: supervisione. Il valore non sparisce con l'agentic coding — si sposta. Dal digitare al verificare, dal produrre al decidere cosa entra in main. L'uomo non esce dal loop. Si sposta nel punto dove conta di più: il momento in cui qualcuno guarda davvero il codice prima che diventi un incidente in produzione.
Chi legge la mappa sapendo chi l'ha disegnata parte lo stesso. Solo che porta una bussola.
Fonti:
- 2026 Agentic Coding Trends Report — Anthropic
- How we built our multi-agent research system — Anthropic
- Multi-Agents: What's Actually Working — Cognition
- AI Acceleration Whiplash — Faros AI (2026)
- DORA Report 2025 — Google
- Key takeaways from the DORA Report 2025 — Faros AI
- METR: uplift update (24 feb 2026)
- METR: AI usage survey (11 mag 2026)