📰 Announcement9 minuti di lettura

Opus 4.6 vs GPT-5.3 Codex: Cosa Cambia Per Chi Sviluppa

Opus 4.6 porta 1M di contesto e Agent Teams. GPT-5.3 Codex è il 25% più veloce. Due rilasci lo stesso giorno: ecco cosa cambia per chi sviluppa.

AS

Alessandro Saiani

Human in the Loop

Opus 4.6 vs GPT-5.3 Codex: Cosa Cambia Per Chi Sviluppa

Il 5 febbraio Anthropic ha rilasciato Claude Opus 4.6. OpenAI ha risposto circa mezz'ora dopo con GPT-5.3 Codex.

Il giorno prima si erano punzecchiati sui social per gli spot del Super Bowl. Il giorno dopo, hanno sincronizzato i rilasci al minuto. Coincidenza? Il mio sospetto è che OpenAI sapesse in anticipo i tempi di Anthropic.

Ma una volta che li usi davvero, la sensazione è che questi due modelli non stiano combattendo la stessa battaglia.


I Punti Chiave

  • GPT-5.3 Codex è il 25% più veloce — Codex finalmente non sembra lento
  • Claude Opus 4.6 porta il contesto a 1M token e introduce Agent Teams (agenti che lavorano in parallelo)
  • Terminal-Bench 2.0: GPT avanti di 12 punti. OSWorld: Claude avanti di 8
  • GPT è stato usato per ottimizzare sé stesso. Claude fa un salto enorme nella stabilità su contesti lunghi
  • Ognuno ha i suoi punti di forza — non c'è un vincitore assoluto

GPT-5.3 Codex

Qual era il problema storico di Codex? Qualità ottima, ma lento.

Quel +25% di velocità si dovrebbe sentire nell'uso quotidiano. Devo ancora metterci le mani sopra a lungo, ma la direzione è chiara.

In passato usavo Codex quando volevo codice affidabile. L'output era solido, ma l'attesa era dolorosa. Anche quando streamava risultati parziali, non capivi dove stesse andando, se stesse deviando, e non osavi interromperlo.

Questa volta è diverso.

GPT-5.3 Codex spinge sull'interactive coding. Supporta un loop più collaborativo: puoi chiedere "Questo approccio ha senso?" o "Dovremmo cambiare direzione?" e guidarlo in tempo reale.

I numeri:

BenchmarkGPT-5.3 CodexPrecedente
Terminal-Bench 2.077.3%64.0%
SWE-Bench Pro56.8%
OSWorld64.7%

Benchmark GPT-5.3 Codex

Dettaglio GPT-5.3 Codex

Ma onestamente, il miglioramento nell'interazione conta più della classifica.

C'è anche un dettaglio da fantascienza: è il primo modello (almeno in questa linea di prodotti) usato per ottimizzare sé stesso. Il team OpenAI ha utilizzato versioni preliminari di GPT-5.3 per affinare il proprio training, gestire il deployment e diagnosticare problemi.

Il Lato Ombra: Cybersecurity

GPT-5.3 Codex è il primo modello OpenAI classificato come "High capability" nel dominio cybersecurity secondo il loro Preparedness Framework. L'accesso completo alle API per gli sviluppatori è stato ritardato, e il lancio è avvenuto con controlli più stretti del solito.

Un modello che sa scrivere codice molto bene sa anche trovare (e potenzialmente sfruttare) vulnerabilità molto bene. OpenAI ne è consapevole.


Claude Opus 4.6

Claude questa volta espande Opus a una context window da 1.000.000 di token (ancora in beta), con supporto per output fino a 128k token.

Ma non è solo più contesto. Ci sono tre novità architetturali importanti:

  • Adaptive Thinking — il modello decide autonomamente quando serve ragionamento esteso, senza che tu debba chiederlo
  • Effort Controls — quattro livelli (low, medium, high, max) per bilanciare intelligenza, velocità e costo
  • Context Compaction — nelle conversazioni lunghe, riassume automaticamente il contesto più vecchio per non perdere il filo

Su MRCR v2 — un test che nasconde 8 "aghi" in un haystack da 1M token — Opus 4.6 ne ha trovati il 76%. Sonnet 4.5 si è fermato al 18.5%. Il divario è enorme.

Context window Claude Opus 4.6

Cosa si sente in pratica?

Per codebase di grandi progetti, prima dovevi spezzare tutto in chunk o sbattevi contro il limite di contesto. Ora puoi buttarci dentro l'intero progetto, e il modello lo capisce davvero. Non la comprensione di facciata: trova le parti rilevanti, traccia le relazioni, collega i puntini.

Il problema del "context rot" è sostanzialmente risolto. I contesti lunghi facevano deviare i modelli, perdere dettagli chiave. Opus 4.6 che resta stabile a 1M token è genuinamente impressionante.

BenchmarkClaude Opus 4.6
Terminal-Bench 2.065.4% (12 punti dietro GPT)
SWE-bench Verified81.4%
OSWorld72.7% (8 punti avanti a GPT)
GDPval-AA+144 ELO vs GPT-5.2

Benchmark Claude Opus 4.6

OSWorld misura la capacità di completare task in un ambiente desktop reale. Claude al 72.7% è nettamente sopra il 64.7% di GPT. Su task complessi, multi-step e catene di ragionamento lunghe, Claude è più stabile.


Agent Teams

Oltre all'upgrade del modello, Opus 4.6 porta anche Agent Teams: la possibilità di lanciare più agenti che lavorano in parallelo.

È ancora sperimentale. Permette a più istanze di Claude Code di formare un team e collaborare.

L'architettura ha quattro parti:

  1. Team Lead — la sessione principale che crea il team, assegna il lavoro e unisce i risultati
  2. Teammates — istanze separate di Claude Code, ognuna con la propria context window
  3. Task List — lista condivisa di task che i teammate possono prendere in carico
  4. Mailbox — sistema di messaggistica tra agenti

La differenza chiave rispetto ai subagent? I teammate possono parlare direttamente tra loro e contestarsi a vicenda, invece di riferire solo al main agent.

Scenario ideale: un teammate sul frontend, uno sul backend, uno sui test. Ognuno lavora indipendentemente ma si coordinano su interfacce e decisioni.


Il Quadro

GPT ha risolto il punto debole storico di Codex: la velocità. Claude ha fatto un salto reale sulla capacità e stabilità con contesti lunghi.

Spingono in direzioni diverse, e entrambe le direzioni fanno avanzare l'AI coding.

Non c'è un vincitore. C'è un ecosistema che migliora.