📰 Announcement11 minuti di lettura

Claude Opus 4.6 e Sonnet 4.6: Cosa Cambia per Chi Sviluppa

Opus 4.6 porta Agent Teams e 1M di contesto. Sonnet 4.6 raggiunge il 98% delle performance a costo ridotto. Benchmark, pricing e novità pratiche.

AS

Alessandro Saiani

Human in the Loop

Claude Opus 4.6 e Sonnet 4.6: Cosa Cambia per Chi Sviluppa

Due rilasci in 12 giorni. Opus 4.6 il 5 febbraio, Sonnet 4.6 il 17. Anthropic non ha rallentato il ritmo — e i numeri raccontano una storia interessante, soprattutto per chi scrive codice.

La sintesi: Opus è diventato più intelligente e può gestire team di agenti. Sonnet è diventato così bravo che in diversi benchmark supera Opus — a circa il 60% del costo. Vediamo cosa significa in pratica.


Opus 4.6: Agent Teams e 1 Milione di Token

I Numeri

BenchmarkOpus 4.6Opus 4.5Delta
SWE-bench Verified80.8%80.9%~
Terminal-Bench 2.065.4%59.8%+5.6
GPQA Diamond91.3%87.0%+4.3
ARC-AGI-268.8%37.6%+31.2
OSWorld72.7%66.3%+6.4
BrowseComp84.0%67.8%+16.2
Humanity's Last Exam53.1%43.4%+9.7

SWE-bench è stabile (80.8% vs 80.9% — sostanzialmente identico). Ma i miglioramenti veri sono altrove: +31 punti su ARC-AGI-2 (ragionamento), +16 su BrowseComp (navigazione web), +6 su OSWorld (computer use). Opus 4.6 non è tanto "più bravo a scrivere codice" quanto "più bravo a ragionare, navigare e agire nel mondo".

Context Window: 1M di Token in Beta

Per la prima volta un modello Opus arriva a 1 milione di token di contesto (in beta). L'output massimo raddoppia da 64K a 128K token. In pratica: puoi dargli un'intera codebase di media dimensione e ottenere risposte che tengono conto di tutto.

Agent Teams: Più Agenti in Parallelo

La novità più significativa per lo sviluppo. Agent Teams permette di lanciare più agenti Claude Code in parallelo, coordinati da un orchestratore.

Come funziona:

  • Un agente "Lead" riceve il task e lo spezza in sotto-task
  • Assegna ogni sotto-task a un "Teammate" (agente separato con la propria context window)
  • Ogni teammate opera in un pane tmux indipendente
  • Il Lead monitora il progresso e raccoglie i risultati

Ottimale per 2-5 teammate. Il consumo di token scala linearmente col numero di agenti. Si attiva impostando CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1.

Esempio pratico: devi fare un refactoring che tocca frontend, backend e test. Invece di farlo sequenzialmente, lanci tre agenti in parallelo — ognuno lavora sulla sua area, il Lead coordina.

Adaptive Thinking

Il vecchio thinking: {type: "enabled"} è deprecato. Si usa thinking: {type: "adaptive"} — Claude decide autonomamente quando e quanto pensare. Quattro livelli di effort: low, medium, high (default), e max (nuovo, solo Opus 4.6).

Fast Mode

Stesso modello, stessa intelligenza, fino a 2.5x più veloce nella generazione. Il pricing è premium ($30/$150 per MTok — 6x il costo standard), ma per task dove la latenza conta è significativo.

Altre Novità

  • Context Compaction (beta): riassunto automatico del contesto quando si avvicina al limite. Conversazioni teoricamente infinite
  • Web Search con Dynamic Filtering: Claude può scrivere codice per filtrare i risultati prima che entrino nel contesto
  • Data Residency Controls: parametro inference_geo per scegliere dove gira l'inference (EU compliance)

Breaking Change Importante

Il prefill dei messaggi assistant non è più supportato su Opus 4.6. Se la tua app lo usa, otterrai un errore 400. Migrazione necessaria.


Sonnet 4.6: Performance da Opus a Prezzo da Sonnet

Rilasciato il 17 febbraio, 12 giorni dopo Opus. Ed è qui che la storia diventa interessante.

I Numeri che Contano

BenchmarkSonnet 4.6Opus 4.6% di Opus
SWE-bench Verified79.6%80.8%98.5%
Terminal-Bench 2.059.1%65.4%90.4%
OSWorld72.5%72.7%99.7%
TAU2-bench Retail91.7%91.9%99.8%
GDPval-AA Elo16331606meglio
MCP-Atlas61.3%59.5%meglio
Finance Agent63.3%60.7%meglio

Leggi bene l'ultima colonna. Sonnet 4.6 non solo si avvicina a Opus su quasi tutto — lo supera su tre benchmark: creatività (GDPval), uso di tool MCP (MCP-Atlas) e agenti finanziari.

Il tutto a $3/$15 per MTok contro i $5/$25 di Opus. Circa il 60% del costo a parità di task.

Il Nuovo Default Gratuito

Sonnet 4.6 è ora il modello predefinito per tutti gli utenti su claude.ai — sia Free che Pro. Il tier gratuito include per la prima volta: creazione file, connectors, skills e compaction.

Tradotto: il modello che in molti benchmark raggiunge il 98-100% delle performance di Opus è accessibile a chiunque, gratis.

Computer Use: Miglior Modello di Sempre

72.5% su OSWorld-Verified. Quando Anthropic lanciò computer use nell'ottobre 2024, il punteggio era 14.9%. In 16 mesi è salito di quasi 5 volte. Sonnet 4.6 è il modello più affidabile al mondo per automazione browser e interazione con GUI.

Coding: Preferito 7 Volte su 10

Nei test interni Claude Code, Sonnet 4.6 è stato preferito nel ~70% dei casi rispetto a Sonnet 4.5, e nel 59% dei casi rispetto a Opus 4.5.

I miglioramenti specifici:

  • Legge il contesto prima di modificare il codice (meno "spara e prega")
  • Meno overengineering — soluzioni più semplici e mirate
  • Meno false dichiarazioni di successo — quando non riesce, lo dice
  • Frontend development emerge come area particolarmente forte

Confronto con la Concorrenza

BenchmarkOpus 4.6Sonnet 4.6GPT-5.2Gemini 3.1 Pro
SWE-bench80.8%79.6%80.0%80.6%
Terminal-Bench 2.065.4%59.1%64.7%68.5%
GPQA Diamond91.3%89.9%*92.4%94.3%
OSWorld72.7%72.5%38.2%

*con adaptive thinking a max effort

Su SWE-bench siamo in un range strettissimo: 79.6% - 80.8% tra i quattro modelli. La differenza pratica nel coding è minima.

Dove i modelli divergono:

  • Computer use: Claude domina (72.7%), GPT-5.2 è a 38.2%
  • Ragionamento scientifico (GPQA): Gemini 3.1 Pro è in testa con 94.3%
  • Terminal/CLI: Gemini 3.1 Pro a 68.5%, Opus a 65.4%. Ma GPT-5.3-Codex (su chip Cerebras) ha poi raggiunto 77.3%

La vera competizione non è più su chi è "il migliore" — è su prezzo, velocità e integrazione nell'ecosistema.


Pricing: La Tabella Completa

ModelloInputOutputContestoOutput Max
Opus 4.6$5/MTok$25/MTok200K (1M beta)128K
Opus 4.6 Fast$30/MTok$150/MTok200K128K
Sonnet 4.6$3/MTok$15/MTok200K (1M beta)64K
Haiku 4.5$0.80/MTok$4/MTok200K8K

I prezzi non sono cambiati rispetto alla generazione precedente. Stesso costo, più performance.

Per il caching (utile con codebase grandi):

ModelloCache Write (5min)Cache Write (1h)Cache Hit
Opus 4.6$6.25/MTok$10/MTok$0.50/MTok
Sonnet 4.6$3.75/MTok$6/MTok$0.30/MTok

Per Chi Sviluppa: Quale Scegliere

Usa Opus 4.6 quando:

  • Lavori su codebase grandi che richiedono 1M di contesto
  • Hai bisogno di Agent Teams per task paralleli
  • Il task richiede ragionamento complesso multi-step
  • Fai coding agentico dove l'AI deve pianificare, eseguire e verificare autonomamente

Usa Sonnet 4.6 quando:

  • Fai coding quotidiano — refactoring, feature, fix
  • Il costo conta (60% di Opus per il 98% delle performance)
  • Hai bisogno di computer use — il miglior modello per automazione browser
  • Usi Claude Code free tier — è il default
  • Sviluppi frontend — area dove Sonnet 4.6 eccelle particolarmente

Il consiglio pratico

Per la maggior parte del lavoro di sviluppo quotidiano, Sonnet 4.6 è la scelta giusta. I benchmark parlano chiaro: su SWE-bench la differenza con Opus è di 1.2 punti, su OSWorld di 0.2. La differenza di costo è 5x.

Opus 4.6 ha senso per task specifici: orchestrazione multi-agente, codebase enormi, ragionamento scientifico. Non per scrivere un componente React.


Il Dato che Conta: 4% di GitHub

Mentre confrontiamo benchmark, c'è un numero che racconta dove sta andando tutto questo: il 4% di tutti i commit pubblici su GitHub è scritto da Claude Code. Raddoppiato in un mese. La previsione è oltre il 20% entro fine 2026.

Il revenue run-rate di Claude Code ha superato i 2.5 miliardi di dollari. Non è più un esperimento — è il modo in cui una fetta crescente dell'industria scrive software.

Con Opus 4.6 e Sonnet 4.6, Anthropic non ha solo rilasciato modelli migliori. Ha rilasciato l'infrastruttura per il coding agentico su larga scala: team di agenti, contesto da 1 milione di token, compaction per sessioni infinite, e un modello che al prezzo più basso supera il flagship della generazione precedente.


Fonti