📄 Analisi10 minuti di lettura

Tredici scambi contro uno. Il prezzo fisso era tarato su come lavoravamo prima

Un articolo in chat richiede 13 round di botta e risposta, lo stesso articolo con Claude Code un solo prompt umano. Anthropic ha provato a scorporare l'uso agentico dall'abbonamento e ha fatto marcia indietro il giorno stesso: quello che resta è agire sui limiti.

AS

Alessandro Saiani

Human in the Loop

Tredici scambi contro uno. Il prezzo fisso era tarato su come lavoravamo prima

Fra quattro giorni, il 13 settembre, scade una promozione che quasi nessuno ha guardato con attenzione. I limiti settimanali maggiorati del 50% su Claude Code finiscono, e secondo l'help center di Anthropic i limiti "return to their standard levels". Nella stessa pagina c'è una precisazione che vale più della notizia: "5-hour usage limits are not affected by this promotion."

Solo uno dei due strati si muove. Ed è il motivo per cui vale la pena guardare come è fatto davvero il conto, invece di limitarsi a constatare che si stringe.

Perché la storia vera non è che gli abbonamenti a prezzo fisso stiano diventando più tirchi. È che erano stati progettati per un modo di lavorare che non è più quello che abbiamo.

Il numero che spiega tutto

L'Anthropic Economic Index di giugno ha misurato una cosa che nessuno stava misurando: quanti scambi umani servono per produrre lo stesso risultato con strumenti diversi.

"the median chat and Cowork conversation producing a blog post or an article involves 13 rounds of back-and-forth, while the median blog-producing Claude Code session contains a single human prompt."

Tredici round di botta e risposta contro un solo prompt umano. Stesso output, stessa persona, ordine di grandezza completamente diverso di interazione.

Non è un caso isolato di quella categoria. Nello stesso report, le conversazioni che producono script e codice mostrano 0,53 punti in più di autonomia su una scala da 1 a 5 quando passano da Claude Code, e l'autonomia risulta più alta in 26 categorie su 31. La spiegazione che gli autori danno è la parte che conta:

"the gap persists when we compare conversations served by the same model… suggesting that the product used is likely more important than the underlying model."

Non è il modello a fare la differenza. È la forma del lavoro.

Perché il flat funzionava

Un abbonamento a prezzo fisso regge su un presupposto che nessuno scrive mai nei termini di servizio: che il consumo sia limitato dal tempo di chi paga.

In una chat quel presupposto è solido. Scrivi una domanda, aspetti, leggi la risposta, ci ragioni, riformuli. Tredici round significano tredici momenti in cui una persona ha dovuto leggere qualcosa e decidere il passo successivo. Quel ritmo mette un tetto naturale al consumo: mentre pensi non consumi, mentre dormi non consumi, e in una giornata lavorativa ci stanno solo un certo numero di scambi.

È lo stesso principio del buffet: puoi mangiare quanto vuoi, ma sei comunque una persona sola con uno stomaco solo, e il locale fa i conti sulla media.

Un prompt singolo che genera un'ora di lavoro autonomo rompe quel principio. Non perché l'utente sia in malafede, ma perché il tetto naturale è sparito: il consumo non è più proporzionale al tuo tempo, è proporzionale a quanto lavoro hai delegato.

E il carico agentico è anche più caro per token. Sempre dall'Economic Index: il 54% delle sessioni Claude Code è servito da Opus, contro il 10% delle conversazioni in chat. Il lavoro delegato non solo consuma di più, consuma sul modello che costa cinque volte tanto.

I due strati, e perché conta quale si muove

Il metering dei piani a pagamento funziona su due livelli sovrapposti, e capirli spiega cosa succede il 13 settembre.

C'è una finestra di cinque ore che scorre e si libera da sola, pensata per l'uso di sessione. E c'è un limite settimanale valido su tutti i modelli, con reset a un orario fisso assegnato al tuo account. Lo stesso bucket, va detto, è condiviso fra Claude Code, Claude.ai e Cowork: quello che bruci in uno lo perdi negli altri.

Il 13 settembre si muove solo il secondo. La finestra di cinque ore resta dov'è.

La distinzione non è burocratica. Lo strato dei cinque ore governa il lavoro interattivo, quello in cui stai davanti allo schermo e il tuo tempo fa da limite. Il tetto settimanale governa l'altro: le sessioni lunghe, gli agenti che macinano, il lavoro che continua mentre fai altro. Toccare il settimanale significa intervenire esattamente sul consumo agentico, lasciando intatto quello umano.

Detto altrimenti: non stanno stringendo il rubinetto: stanno stringendo quel rubinetto.

Quanto costa davvero

Sui numeri assoluti bisogna essere prudenti, perché le stime non concordano fra loro.

La telemetria pubblicata da Faros ad agosto indica circa 6 dollari per sviluppatore al giorno, con il 90% degli utenti sotto i 12 dollari giornalieri, e 100-200 dollari al mese per deployment di team su Sonnet. Altre fonti di monitoring danno cifre quasi doppie, intorno ai 13 dollari per giorno attivo e 150-250 al mese. Non sono conciliabili, e vanno prese come intervallo fra stime indipendenti, non come dato.

Quello che le fonti concordano nel dire è la struttura del costo: gli output token pesano cinque volte gli input, e le funzionalità agentiche moltiplicano. Agent Teams in plan mode consuma circa sette volte i token di una sessione standard.

Metti insieme i tre fatti e l'aritmetica si compone da sola. Un prompt invece di tredici, sul modello che costa il quintuplo, con funzioni che moltiplicano per sette. Il conto che tornava con l'uso interattivo non torna più, e non serve immaginare l'utente estremo: basta l'uso normale di uno strumento agentico.

La parte onesta

Qui però va detto quello che rovina la narrazione comoda, perché la narrazione comoda è che stiano progressivamente tirando la cinghia. I fatti dicono un'altra cosa.

Il 6 maggio Anthropic ha raddoppiato in modo permanente i limiti della finestra di cinque ore per Pro, Max, Team ed Enterprise seat-based, e ha rimosso il throttling nelle ore di punta per Pro e Max. La promozione settimanale, partita a maggio, è stata prorogata più volte invece di scadere alla data prevista. E il costo dell'inferenza è calato di circa dieci volte nel corso del 2025: quello che serviva per un livello GPT-4 costava intorno ai 30 dollari per milione di token a inizio 2024, oggi sta sotto i 5.

Se la traiettoria fosse "stringere progressivamente", nessuno di questi tre fatti avrebbe senso. La tensione è reale, ma non è lineare: da una parte il carico per utente cresce, dall'altra il costo unitario crolla, e le due forze si rincorrono.

Un'ultima precisazione, perché sta girando molto: il numero che si legge in giro, "dal 14 settembre i limiti scendono del 17%", non viene dall'help center. Anthropic scrive solo che tornano ai livelli standard. Il 25% permanente sopra la vecchia baseline, da cui si ricava quel 17%, arriva da un post pubblicato su X il 29 agosto e ripreso da terzi. È probabilmente corretto, ma non è la stessa cosa di una comunicazione ufficiale, e conviene saperlo.

Il tentativo fallito, e cosa è rimasto

Qui devo una correzione ai lettori di questo blog.

A maggio ho scritto che dal 15 giugno l'Agent SDK avrebbe avuto un conto separato dal piano di abbonamento: uso programmatico fuori dal pool, credito mensile dedicato in dollari, 20 per Pro e fino a 200 per Enterprise. Era l'annuncio ufficiale, e la logica era esattamente quella descritta fin qui: il carico agentico non sta nel flat, quindi lo si porta fuori.

Non è mai entrato in vigore. Il 15 giugno, il giorno stesso in cui doveva partire, Anthropic ha sospeso il cambio. Agent SDK, claude -p, GitHub Actions e app di terze parti hanno continuato a pescare dai limiti dell'abbonamento come prima, e l'azienda ha dichiarato che avrebbe rilavorato il piano dando preavviso.

La marcia indietro è arrivata dopo un mese di opposizione pubblica: Jeremy Howard che definiva la policy "misleading", sviluppatori che annunciavano il passaggio a OpenAI e DeepSeek, e il team di comunicazione di Anthropic che si è preso una Community Note su X poche ore dopo l'annuncio. Il tutto mentre si profilava una guerra di prezzo con OpenAI, che non aiuta a introdurre restrizioni.

Questo cambia la lettura, e la rende più interessante.

Il problema economico è reale: l'hanno tentato, e non si tenta una cosa così impopolare per capriccio. Ma la strada esplicita, quella in cui dici ai clienti "questo tipo di uso adesso si paga a parte", si è rivelata politicamente impraticabile. Ritirata in trenta giorni, il giorno della partenza.

E allora resta l'altra strada, che è quella che stiamo guardando: non scorporare il carico agentico, ma stringere lo strato dove vive. Il tetto settimanale non ha un nome che dice "agenti", non richiede un annuncio che scateni un mese di polemiche, e non compare in fattura. Cambia solo un numero.

Il 15 giugno era il piano A, ed è fallito.

Ma nel frattempo, senza che nessuno protestasse, era già passata un'altra strada.

La stratificazione che è già avvenuta

Se cerchi il punto in cui il carico pesante è uscito dal prezzo fisso, non devi guardare al tipo di utilizzo. Devi guardare ai modelli.

Le regole dei piani, sull'help center di Anthropic, dicono due cose diverse a seconda di quanto paghi.

Su Max, sui posti premium Team ed Enterprise: "You can use up to 50% of your weekly usage limits on Fable models at no extra cost." I modelli di punta pescano dal budget normale, ma con un tetto al 50%, e con una precisazione che vale tutto il ragionamento fatto finora: li consumano "faster than other Claude models".

Su Pro e sui posti standard: "Fable 5 and Fable 5.1 aren't included in your plan's usage limits. You can use them with usage credits."

Rileggila. Sui piani inferiori i modelli di punta non sono nell'abbonamento. Girano a consumo, e sull'accesso via API la stessa pagina precisa che sono fatturati "at standard API rates".

Quindi la separazione fra flat e usage-based non è una previsione da fare: è già in produzione. Solo che non passa per il tipo di lavoro, come nel tentativo di giugno, ma per due assi che nessuno ha contestato:

  • il modello: i più capaci bruciano il budget più in fretta, con un tetto oltre il quale non vai
  • il livello di piano: sotto una certa soglia, quei modelli escono del tutto dal prezzo fisso

Il primo asse è la parte più elegante, ed è quella che intuisci solo quando ci finisci dentro. Non ti aumentano il prezzo e non ti tolgono l'accesso: il tuo budget si svuota più in fretta quando usi le cose care. È una tariffa, ma pagata in capacità invece che in euro, e non compare da nessuna parte in fattura.

Il secondo dice il resto: chi ha bisogno davvero dei modelli di punta, e non sta sul piano più alto, sta già pagando a consumo. Il flat gli resta per il lavoro leggero.

Sul quanto più in fretta bisogna essere prudenti: fonti di settore parlano di un peso circa doppio rispetto a una sessione Opus, ma l'help center non pubblica alcun moltiplicatore. Dice solo "più in fretta", e quella è l'unica formulazione che si può attribuire ad Anthropic.

Messo tutto in fila, il quadro è questo: una strada esplicita tentata e ritirata in trenta giorni, e due strade implicite che funzionano da mesi senza che nessuno abbia scritto un thread di protesta. Il 13 settembre, con il tetto settimanale che si abbassa, è la terza mossa dello stesso spartito.

E qui arriva il problema più grande: non sai cosa hai comprato

Tutto il ragionamento fatto finora presuppone che si possa fare un conto. In realtà non si può, ed è la cosa che mi ha sorpreso di più mettendo insieme i pezzi.

Anthropic non pubblica un numero di token per nessun piano. Non per Pro, non per Max, per nessuno. Non esiste una cifra da andare a cercare: qualunque pagina la riporti se l'è inventata.

Quello che viene misurato è una quota di una sessione di cinque ore, non un budget di token. E l'unico ancoraggio quantitativo che l'azienda pubblica è relativo, non assoluto: Pro offre "at least five times the usage per session compared to our free service". Cinque volte una cosa che a sua volta non è quantificata.

A questo si aggiungono i pesi per modello, che come abbiamo visto esistono ma non hanno un moltiplicatore pubblicato: l'help center dice "più in fretta" e si ferma lì. Il 2x rispetto a Opus circola perché compare nel testo in-app di Claude Code, non in una documentazione.

Anche volendo contarli, i token restano una stima. La documentazione dell'API sul token counting lo scrive esplicitamente: "the actual number of input tokens used when creating a message might differ by a small amount".

Metti insieme le tre cose e viene fuori la vera natura di quello che compri: una quota non pubblicata, di una capacità non quantificata, pesata con moltiplicatori non dichiarati, misurata con stime. Più il diritto, riservato al fornitore, di aggiustare quella quota.

Non sto dicendo che qualcuno stia barando. Sto dicendo una cosa più semplice e più scomoda: anche volendo, non potresti accorgertene. Non esiste il numero contro cui verificare.

E l'effetto pratico si è visto pochi giorni fa. Con l'uscita di Fable 5.1 il primo settembre, utenti su piani Max hanno riferito di aver prosciugato una finestra da cinque ore in meno di trenta minuti, in un caso in 52 minuti partendo da un singolo prompt, in un altro in quattro minuti per via dell'attività di cache. La causa non è un moltiplicatore cattivo: è che un task agentico può ramificarsi silenziosamente in quattro o sei chiamate concorrenti, e tu vedi solo un prompt. Anthropic ha risposto resettando i limiti al lancio e prorogando i boost.

Che è la conferma migliore di tutto il pezzo. Se il consumo fosse prevedibile, non ci sarebbe bisogno di resettare i contatori il giorno del lancio di un modello.

Cosa farne, sapendo che non puoi contare

Se il numero assoluto non esiste, il consiglio "misura il tuo consumo" è inutile così com'è. Ma tre cose restano possibili, e sono in ordine di quanto contano.

Misura il delta, non il valore. /usage non ti dirà mai quanti token hai comprato, perché quel numero non è pubblicato. Ti dice però a che punto sei adesso. Lanciarlo prima del 13 settembre e rilanciarlo il 15, sullo stesso tipo di lavoro, produce l'unico dato che nessuno può darti dall'esterno: quanto è cambiato per te. È una misura relativa, ed è tutto quello che il sistema consente.

Verifica su quale asse ti trovi, perché quello è documentato. A differenza dei token, le regole dei piani sono scritte: se stai su Pro o su un posto standard, i modelli di punta non sono nel tuo abbonamento e girano già a consumo. Se stai su Max, ci sono ma con un tetto al 50% e bruciano più in fretta. Questa è una cosa che puoi sapere con certezza in due minuti, e cambia le decisioni più di qualunque stima di token.

Il consumo che non vedi è quello che si ramifica. Il caso dei cinque ore prosciugati in 52 minuti da un singolo prompt non nasce da un moltiplicatore: nasce da un task che si apre in quattro o sei chiamate concorrenti mentre tu ne vedi una. È lo stesso meccanismo per cui i subagent costano più di quanto sembri, ed è l'unica leva su cui hai davvero controllo: tetti sulla delega, effort basso dove la qualità regge, e nessun agente lanciato "tanto per".

E poi c'è la conclusione che nessuno mette nei consigli, ma che segue dal resto.

Se hai bisogno di sapere quanto stai spendendo, il piano a prezzo fisso non è lo strumento giusto. Non perché sia una fregatura: perché è progettato per non essere quantificabile, ed è quella la sua natura. L'API costa di più e ti dice esattamente cosa paghi, riga per riga. Il flat costa meno e ti chiede di rinunciare a saperlo.

Per la maggior parte del lavoro quel baratto conviene, ed è il motivo per cui questi piani hanno avuto successo. Ma è un baratto, e vale la pena sceglierlo sapendo che lo stai facendo, invece di scoprirlo un martedì pomeriggio quando i contatori si fermano a metà di una cosa che stavi finendo.

Il buffet non chiude. Ha solo smesso di dirti quanto è grande il piatto.


Fonti:

  1. Anthropic Help Center — Claude Code weekly limits promotion
  2. Anthropic Economic Index report: Cadences (giugno 2026)
  3. Faros.ai — Claude Code token limits e telemetria dei costi (agosto 2026)
  4. Claude Code Docs — Manage costs effectively
  5. QCode — Claude Code weekly limits end 2026-09-13: la formulazione ufficiale
  6. Anthropic Help Center — Claude Fable models on your plan
  7. The New Stack — Anthropic pauses Claude Agent SDK subscription change on day it was due to take effect
  8. The Decoder — Anthropic backs off unpopular billing overhaul as price war with OpenAI looms
  9. Claude Platform Docs — Token counting
  10. Developers Digest — How Claude's usage limits actually work with Fable 5: windows, multipliers, burn rates