Claude Opus 4.6 e Sonnet 4.6: Cosa Cambia per Chi Sviluppa
Opus 4.6 porta Agent Teams e 1M di contesto. Sonnet 4.6 raggiunge il 98% delle performance a costo ridotto. Benchmark, pricing e novità pratiche.
Alessandro Saiani
Human in the Loop

Due rilasci in 12 giorni. Opus 4.6 il 5 febbraio, Sonnet 4.6 il 17. Anthropic non ha rallentato il ritmo — e i numeri raccontano una storia interessante, soprattutto per chi scrive codice.
La sintesi: Opus è diventato più intelligente e può gestire team di agenti. Sonnet è diventato così bravo che in diversi benchmark supera Opus — a circa il 60% del costo. Vediamo cosa significa in pratica.
Opus 4.6: Agent Teams e 1 Milione di Token
I Numeri
| Benchmark | Opus 4.6 | Opus 4.5 | Delta |
|---|---|---|---|
| SWE-bench Verified | 80.8% | 80.9% | ~ |
| Terminal-Bench 2.0 | 65.4% | 59.8% | +5.6 |
| GPQA Diamond | 91.3% | 87.0% | +4.3 |
| ARC-AGI-2 | 68.8% | 37.6% | +31.2 |
| OSWorld | 72.7% | 66.3% | +6.4 |
| BrowseComp | 84.0% | 67.8% | +16.2 |
| Humanity's Last Exam | 53.1% | 43.4% | +9.7 |
SWE-bench è stabile (80.8% vs 80.9% — sostanzialmente identico). Ma i miglioramenti veri sono altrove: +31 punti su ARC-AGI-2 (ragionamento), +16 su BrowseComp (navigazione web), +6 su OSWorld (computer use). Opus 4.6 non è tanto "più bravo a scrivere codice" quanto "più bravo a ragionare, navigare e agire nel mondo".
Context Window: 1M di Token in Beta
Per la prima volta un modello Opus arriva a 1 milione di token di contesto (in beta). L'output massimo raddoppia da 64K a 128K token. In pratica: puoi dargli un'intera codebase di media dimensione e ottenere risposte che tengono conto di tutto.
Agent Teams: Più Agenti in Parallelo
La novità più significativa per lo sviluppo. Agent Teams permette di lanciare più agenti Claude Code in parallelo, coordinati da un orchestratore.
Come funziona:
- Un agente "Lead" riceve il task e lo spezza in sotto-task
- Assegna ogni sotto-task a un "Teammate" (agente separato con la propria context window)
- Ogni teammate opera in un pane tmux indipendente
- Il Lead monitora il progresso e raccoglie i risultati
Ottimale per 2-5 teammate. Il consumo di token scala linearmente col numero di agenti. Si attiva impostando CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1.
Esempio pratico: devi fare un refactoring che tocca frontend, backend e test. Invece di farlo sequenzialmente, lanci tre agenti in parallelo — ognuno lavora sulla sua area, il Lead coordina.
Adaptive Thinking
Il vecchio thinking: {type: "enabled"} è deprecato. Si usa thinking: {type: "adaptive"} — Claude decide autonomamente quando e quanto pensare. Quattro livelli di effort: low, medium, high (default), e max (nuovo, solo Opus 4.6).
Fast Mode
Stesso modello, stessa intelligenza, fino a 2.5x più veloce nella generazione. Il pricing è premium ($30/$150 per MTok — 6x il costo standard), ma per task dove la latenza conta è significativo.
Altre Novità
- Context Compaction (beta): riassunto automatico del contesto quando si avvicina al limite. Conversazioni teoricamente infinite
- Web Search con Dynamic Filtering: Claude può scrivere codice per filtrare i risultati prima che entrino nel contesto
- Data Residency Controls: parametro
inference_geoper scegliere dove gira l'inference (EU compliance)
Breaking Change Importante
Il prefill dei messaggi assistant non è più supportato su Opus 4.6. Se la tua app lo usa, otterrai un errore 400. Migrazione necessaria.
Sonnet 4.6: Performance da Opus a Prezzo da Sonnet
Rilasciato il 17 febbraio, 12 giorni dopo Opus. Ed è qui che la storia diventa interessante.
I Numeri che Contano
| Benchmark | Sonnet 4.6 | Opus 4.6 | % di Opus |
|---|---|---|---|
| SWE-bench Verified | 79.6% | 80.8% | 98.5% |
| Terminal-Bench 2.0 | 59.1% | 65.4% | 90.4% |
| OSWorld | 72.5% | 72.7% | 99.7% |
| TAU2-bench Retail | 91.7% | 91.9% | 99.8% |
| GDPval-AA Elo | 1633 | 1606 | meglio |
| MCP-Atlas | 61.3% | 59.5% | meglio |
| Finance Agent | 63.3% | 60.7% | meglio |
Leggi bene l'ultima colonna. Sonnet 4.6 non solo si avvicina a Opus su quasi tutto — lo supera su tre benchmark: creatività (GDPval), uso di tool MCP (MCP-Atlas) e agenti finanziari.
Il tutto a $3/$15 per MTok contro i $5/$25 di Opus. Circa il 60% del costo a parità di task.
Il Nuovo Default Gratuito
Sonnet 4.6 è ora il modello predefinito per tutti gli utenti su claude.ai — sia Free che Pro. Il tier gratuito include per la prima volta: creazione file, connectors, skills e compaction.
Tradotto: il modello che in molti benchmark raggiunge il 98-100% delle performance di Opus è accessibile a chiunque, gratis.
Computer Use: Miglior Modello di Sempre
72.5% su OSWorld-Verified. Quando Anthropic lanciò computer use nell'ottobre 2024, il punteggio era 14.9%. In 16 mesi è salito di quasi 5 volte. Sonnet 4.6 è il modello più affidabile al mondo per automazione browser e interazione con GUI.
Coding: Preferito 7 Volte su 10
Nei test interni Claude Code, Sonnet 4.6 è stato preferito nel ~70% dei casi rispetto a Sonnet 4.5, e nel 59% dei casi rispetto a Opus 4.5.
I miglioramenti specifici:
- Legge il contesto prima di modificare il codice (meno "spara e prega")
- Meno overengineering — soluzioni più semplici e mirate
- Meno false dichiarazioni di successo — quando non riesce, lo dice
- Frontend development emerge come area particolarmente forte
Confronto con la Concorrenza
| Benchmark | Opus 4.6 | Sonnet 4.6 | GPT-5.2 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-bench | 80.8% | 79.6% | 80.0% | 80.6% |
| Terminal-Bench 2.0 | 65.4% | 59.1% | 64.7% | 68.5% |
| GPQA Diamond | 91.3% | 89.9%* | 92.4% | 94.3% |
| OSWorld | 72.7% | 72.5% | 38.2% | — |
*con adaptive thinking a max effort
Su SWE-bench siamo in un range strettissimo: 79.6% - 80.8% tra i quattro modelli. La differenza pratica nel coding è minima.
Dove i modelli divergono:
- Computer use: Claude domina (72.7%), GPT-5.2 è a 38.2%
- Ragionamento scientifico (GPQA): Gemini 3.1 Pro è in testa con 94.3%
- Terminal/CLI: Gemini 3.1 Pro a 68.5%, Opus a 65.4%. Ma GPT-5.3-Codex (su chip Cerebras) ha poi raggiunto 77.3%
La vera competizione non è più su chi è "il migliore" — è su prezzo, velocità e integrazione nell'ecosistema.
Pricing: La Tabella Completa
| Modello | Input | Output | Contesto | Output Max |
|---|---|---|---|---|
| Opus 4.6 | $5/MTok | $25/MTok | 200K (1M beta) | 128K |
| Opus 4.6 Fast | $30/MTok | $150/MTok | 200K | 128K |
| Sonnet 4.6 | $3/MTok | $15/MTok | 200K (1M beta) | 64K |
| Haiku 4.5 | $0.80/MTok | $4/MTok | 200K | 8K |
I prezzi non sono cambiati rispetto alla generazione precedente. Stesso costo, più performance.
Per il caching (utile con codebase grandi):
| Modello | Cache Write (5min) | Cache Write (1h) | Cache Hit |
|---|---|---|---|
| Opus 4.6 | $6.25/MTok | $10/MTok | $0.50/MTok |
| Sonnet 4.6 | $3.75/MTok | $6/MTok | $0.30/MTok |
Per Chi Sviluppa: Quale Scegliere
Usa Opus 4.6 quando:
- Lavori su codebase grandi che richiedono 1M di contesto
- Hai bisogno di Agent Teams per task paralleli
- Il task richiede ragionamento complesso multi-step
- Fai coding agentico dove l'AI deve pianificare, eseguire e verificare autonomamente
Usa Sonnet 4.6 quando:
- Fai coding quotidiano — refactoring, feature, fix
- Il costo conta (60% di Opus per il 98% delle performance)
- Hai bisogno di computer use — il miglior modello per automazione browser
- Usi Claude Code free tier — è il default
- Sviluppi frontend — area dove Sonnet 4.6 eccelle particolarmente
Il consiglio pratico
Per la maggior parte del lavoro di sviluppo quotidiano, Sonnet 4.6 è la scelta giusta. I benchmark parlano chiaro: su SWE-bench la differenza con Opus è di 1.2 punti, su OSWorld di 0.2. La differenza di costo è 5x.
Opus 4.6 ha senso per task specifici: orchestrazione multi-agente, codebase enormi, ragionamento scientifico. Non per scrivere un componente React.
Il Dato che Conta: 4% di GitHub
Mentre confrontiamo benchmark, c'è un numero che racconta dove sta andando tutto questo: il 4% di tutti i commit pubblici su GitHub è scritto da Claude Code. Raddoppiato in un mese. La previsione è oltre il 20% entro fine 2026.
Il revenue run-rate di Claude Code ha superato i 2.5 miliardi di dollari. Non è più un esperimento — è il modo in cui una fetta crescente dell'industria scrive software.
Con Opus 4.6 e Sonnet 4.6, Anthropic non ha solo rilasciato modelli migliori. Ha rilasciato l'infrastruttura per il coding agentico su larga scala: team di agenti, contesto da 1 milione di token, compaction per sessioni infinite, e un modello che al prezzo più basso supera il flagship della generazione precedente.
Fonti
- Anthropic — Introducing Claude Opus 4.6
- Anthropic — Introducing Claude Sonnet 4.6
- Claude API Docs — What's New in Claude 4.6
- Claude API Docs — Pricing
- TechCrunch — Opus 4.6 with Agent Teams
- CNBC — Sonnet 4.6 Default Free
- VentureBeat — Sonnet 4.6 Matches Flagship at 1/5 Cost
- Vellum — Opus 4.6 vs 4.5 Benchmarks
- Digital Applied — Sonnet 4.6 Benchmarks Guide
- SemiAnalysis — Claude Code 4% GitHub Commits