📄 Analisi9 minuti di lettura

Claude Opus 4.7: Cosa Cambia per Chi Sviluppa

Stesso prezzo, 3x risoluzione, +12 punti su CursorBench. Ma il tokenizer è cambiato: stesso input, più token. Ecco cosa sapere prima di migrare.

AS

Alessandro Saiani

Human in the Loop

Claude Opus 4.7: Cosa Cambia per Chi Sviluppa

$5 input, $25 output per milione di token. Identico a Opus 4.6. Stessa fattura, modello nuovo. Anthropic ha rilasciato oggi Claude Opus 4.7 e sulla carta sembra un upgrade gratis: 3x la risoluzione delle immagini, +12 punti su CursorBench, il triplo dei task completati su Rakuten-SWE-Bench. Il catch? Il tokenizer è cambiato. E questo significa che il tuo "stesso input" potrebbe costare fino al 35% in più senza che tu tocchi una riga di codice.

Vediamo cosa conta davvero.


I Numeri che Contano

Prima di tutto, i benchmark. Non perché siano la verità assoluta, ma perché su questi numeri si baseranno le decisioni di chi deve scegliere quale modello mettere in produzione.

BenchmarkOpus 4.6Opus 4.7Delta
CursorBench58%70%+12 punti
Rakuten-SWE-Bench (task completati)1x3x+200%
Rakuten-SWE-Bench (Code Quality)baselinedouble-digit improvement--
Rakuten-SWE-Bench (Test Quality)baselinedouble-digit improvement--
CodeRabbit (bug recall)baseline+10%+su bug difficili
XBOW (visual-acuity)54.5%98.5%+44 punti

Il dato che salta all'occhio è XBOW: da 54.5% a 98.5% in visual-acuity. Non è un miglioramento incrementale, è un salto di categoria. E si collega direttamente alla feature più interessante di questo rilascio.


Vision 3x: Non È Solo Marketing

Opus 4.7 supporta immagini fino a 2.576 pixel sul lato lungo, per un massimo di 3.75 megapixel. È circa tre volte la risoluzione supportata da Opus 4.6.

Perché importa? Perché fino a ieri, passare uno screenshot di un'interfaccia complessa a Claude significava comprimerlo. I dettagli si perdevano. Le label piccole diventavano illeggibili. I diagrammi architetturali con testo fine venivano interpretati a metà.

Ora puoi passare un wireframe Figma a risoluzione piena e aspettarti che il modello legga ogni label, ogni annotazione, ogni nota in margine. Puoi fotografare una lavagna dopo un meeting di design e ottenere una trascrizione accurata. Puoi dare in input screenshot di terminali con output densi senza doverli prima tagliare in pezzi.

Il dato di XBOW conferma questa direzione. XBOW fa penetration testing automatizzato e la visual-acuity è fondamentale per analizzare interfacce web alla ricerca di vulnerabilità. Passare dal 54.5% al 98.5% significa che il modello ora vede quasi tutto ciò che c'è sullo schermo. Quel "quasi" è un 1.5% che probabilmente tiene sveglio qualcuno in Anthropic.

Per chi lavora con strutture chimiche, schemi elettronici o planimetrie -- domini dove il dettaglio visivo è tutto -- questo è il miglioramento più rilevante dell'intero rilascio.


Il Tokenizer Cambiato: Attenzione alla Fattura

Ed eccoci al punto che Anthropic menziona in fondo al post, quasi di passaggio: il tokenizer è stato aggiornato.

In pratica, lo stesso identico testo che mandavi a Opus 4.6 produce tra 1.0x e 1.35x token con Opus 4.7. Il prezzo per milione di token non è cambiato, ma il numero di token per la stessa richiesta sì.

Facciamo i conti. Se hai un prompt che con Opus 4.6 consumava 10.000 token di input, con Opus 4.7 potrebbe consumarne tra 10.000 e 13.500. A $5 per milione, la differenza su una singola chiamata è trascurabile. Ma se fai 100.000 chiamate al giorno, quel 35% in più si traduce in migliaia di dollari al mese.

Anthropic dice che il nuovo tokenizer "migliora l'affidabilità". È plausibile: tokenizer diversi catturano pattern linguistici diversi, e un tokenizer più granulare può aiutare il modello a gestire meglio edge case sintattici. Ma è anche vero che produce più token, il che è un guadagno diretto per chi li vende.

Cosa fare: prima di migrare, prendi un campione rappresentativo delle tue chiamate API e fai un dry run con il nuovo modello. Confronta il conteggio token. Se il delta è sotto il 10%, probabilmente non vale la pena preoccuparsi. Se è sopra il 20%, aggiorna i tuoi budget.

# Model ID per la migrazione
model: "claude-opus-4-7"

# Confronta token usage prima e dopo
# (usa lo stesso prompt su entrambi i modelli)

/ultrareview: Code Review con il Modello Più Potente

Nuova feature di Claude Code: il comando /ultrareview lancia una code review approfondita usando il modello al massimo delle sue capacità. Non è un review normale -- è un'analisi strutturale del codice che cerca problemi logici, non solo stilistici.

Gli utenti Pro e Max hanno tre /ultrareview gratuite. Dopo, il costo dipende dal piano e dalla dimensione della codebase analizzata. Non è chiaro se le tre gratuite si rinnovino mensilmente o siano una tantum.

Stripe, che è partner di Anthropic per il testing, ha commentato tramite Clarence Huang (VP of Technology) che il modello rappresenta "a significant leap for our developers", accelerando la velocity di sviluppo. Se il modello riesce davvero a ridurre i cicli di iterazione, /ultrareview potrebbe essere più utile in fase di design che in fase di review post-commit.


Effort xhigh: Il Nuovo Default

Opus 4.7 introduce un nuovo livello di effort: xhigh. Si posiziona tra high e max. Claude Code ora usa xhigh come default.

La gerarchia completa diventa:

low → medium → high → xhigh → max

In pratica xhigh dà al modello più tempo per "pensare" rispetto a high, ma senza il costo computazionale pieno di max. È il punto di equilibrio che Anthropic ha trovato dopo aver osservato come gli sviluppatori usano Claude Code in produzione: high non era abbastanza per task complessi, max era troppo costoso per l'uso quotidiano.

Replit lo conferma indirettamente. Il presidente di Replit, Michele Catasta, ha dichiarato che il modello è "more efficient and precise at tasks" -- probabilmente perché xhigh raggiunge risultati che prima richiedevano max.


Task Budgets: Controlla Quanto Spende l'Agente

In beta pubblica, i task budgets permettono di impostare un tetto di spesa in token per ogni run di Claude Code. Se hai mai lanciato un agente su un task ambiguo e l'hai trovato tre ore dopo ancora a iterare (e a consumare token), capisci perché serve.

Non è una feature che cambia il modo in cui scrivi codice. È una feature che cambia il modo in cui dormi la notte quando un agente gira in auto mode.

A proposito di auto mode: è ora esteso a tutti gli utenti Max. Combinato con i task budgets, hai finalmente un modo ragionevole di lasciare Claude Code al lavoro senza supervisione -- con un limite esplicito su quanto può spendere prima di fermarsi e chiedere.

Per chi sta sperimentando con agenti autonomi che girano per ore, i task budgets sono probabilmente la feature più pratica di tutto il rilascio.


Cosa Dicono i Partner

Oltre a Stripe, le citazioni dei partner raccontano una storia coerente.

Cursor (Co-Founder e CEO): "70% vs 58% on CursorBench." Nessun commento qualitativo, solo il numero. Quando il co-founder di un IDE AI-first comunica con un benchmark, vuol dire che quel numero è reale e verificabile.

Notion (AI Lead): "+14% over Opus 4.6, a third of the tool errors." Il dato sugli errori tool è sottile ma importante. Un terzo degli errori nelle chiamate a funzione significa meno retry, meno token sprecati, meno latenza percepita dall'utente finale.

XBOW (CEO): "98.5% visual-acuity vs 54.5% for Opus 4.6." Il CEO di un'azienda di cybersecurity che cita un singolo numero con un decimale è qualcuno che ha fatto test rigorosi.

Replit (President): "Easy upgrade decision...more efficient and precise at tasks." Questo è il dato più rilevante per chi fa inferenza su scala. Se Replit -- che esegue milioni di completion al giorno -- conferma maggiore efficienza e precisione, il modello è genuinamente migliorato.


Safety: Cosa Sapere

Il profilo di safety è simile a Opus 4.6, con due miglioramenti specifici: honesty (meno hallucination nei fatti dichiarati) e resistenza a prompt injection.

Un punto interessante: le cyber capabilities sono esplicitamente ridotte rispetto a Mythos Preview. Anthropic ha introdotto un Cyber Verification Program per dare accesso alle capacità offensive solo a security professional verificati. È una scelta di posizionamento netta: Opus 4.7 è il modello per sviluppare, Mythos è quello per attaccare (in modo controllato).


Cosa Fare Lunedì Mattina

Cinque cose concrete.

1. Controlla il tokenizer. Prendi le tue 10 chiamate API più frequenti e confronta il conteggio token tra claude-opus-4-6 e claude-opus-4-7. Se il delta medio è sopra il 15%, aggiorna le proiezioni di costo.

2. Prova /ultrareview su una PR aperta. Hai tre gratuite. Usale su codice che conosci bene, così puoi valutare la qualità dei finding rispetto alla tua esperienza.

3. Imposta un task budget. Se usi Claude Code in auto mode, definisci un budget prima di lanciare. Non c'è motivo di non farlo ora che la feature è in beta pubblica.

4. Testa la vision. Se hai workflow che passano immagini al modello -- screenshot, diagrammi, mockup -- prova con la risoluzione piena. La differenza sui dettagli fini dovrebbe essere evidente.

5. Aggiorna il model ID. Se sei su API, il passaggio è una riga:

# Prima
model = "claude-opus-4-6"

# Dopo
model = "claude-opus-4-7"

Il pricing è lo stesso. I benchmark sono migliori su tutta la linea. Il tokenizer costa potenzialmente di più. L'unica ragione per non migrare è se hai workflow estremamente sensibili al conteggio token e non puoi assorbire un aumento fino al 35%.

Per tutti gli altri, è un upgrade che vale la pena fare. Non perché sia rivoluzionario -- le scaling laws ci hanno insegnato che i salti incrementali sono la norma -- ma perché è un upgrade a costo nominale zero con benefici misurabili. E nel mondo delle API a pagamento, questa è la definizione di pranzo gratis. Quasi.


Fonti

  1. Anthropic - Claude Opus 4.7 announcement