📰 News6 minuti di lettura

GPT-5.4: OpenAI Unifica Reasoning, Coding e Computer Use in un Solo Modello

OpenAI lancia GPT-5.4 Thinking e ritira GPT-5.1. Un modello generalista che fonde reasoning, coding e azioni agentiche. Cosa cambia per chi sviluppa.

AS

Alessandro Saiani

Human in the Loop

GPT-5.4: OpenAI Unifica Reasoning, Coding e Computer Use in un Solo Modello

75% su OSWorld. Meglio degli umani (72.4%). Un modello AI che interagisce con un desktop meglio della media delle persone testate.

GPT-5.4 e' uscito il 5 marzo. E mentre tutti guardavano i benchmark di coding, il dato piu' interessante era un altro: OpenAI ha smesso di fare modelli specializzati. GPT-5.4 prende il reasoning di GPT-5.2 Thinking, il coding di GPT-5.3 Codex e ci aggiunge computer use nativo. Un modello unico che fa tutto.

Vediamo cosa significa davvero.


Tre Varianti, Una Base

GPT-5.4 arriva in tre forme:

  • Thinking -- la versione su ChatGPT, disponibile per tutti gli utenti Plus e Team
  • Pro -- variante premium con limiti piu' alti e accesso prioritario
  • API -- per sviluppatori, integrata anche in Codex

Il punto chiave: sotto il cofano e' lo stesso modello. Non c'e' piu' un modello per ragionare, uno per scrivere codice e uno per navigare il web. GPT-5.4 fa tutto.

La context window e' massiccia: 1.05 milioni di token (922K input + 128K output). Numeri comparabili a Opus 4.6, che era arrivato a 1M in beta un mese prima.


I Benchmark: Dove Brilla e Dove No

Partiamo dai numeri crudi.

BenchmarkGPT-5.4Claude Opus 4.6Note
SWE-Bench Verified77.2%80.8%Claude resta in testa
SWE-Bench Pro57.7%--Il piu' alto in assoluto
OSWorld75.0%72.7%Supera gli umani (72.4%)

Il quadro e' sfumato. Su SWE-Bench Verified -- il benchmark standard per il coding su repository open source -- Claude Opus 4.6 resta davanti di 3.6 punti. Non poco.

Ma GPT-5.4 domina su SWE-Bench Pro, che testa la capacita' di lavorare su codebase privati e piu' complessi. 57.7% e' il punteggio piu' alto mai registrato da qualsiasi modello su questo benchmark. La differenza? SWE-Bench Pro richiede di capire codice senza documentazione pubblica, senza Stack Overflow, senza training data. E' piu' vicino a quello che facciamo ogni giorno.

Su OSWorld -- che misura l'interazione con ambienti desktop reali -- il 75% e' impressionante. Un mese fa Opus 4.6 aveva stabilito il record a 72.7%. GPT-5.4 lo supera e, dato ancora piu' notevole, batte il benchmark umano di 72.4%.


Meno Allucinazioni, Meno Spreco

Due numeri che passano in sordina ma che contano per chi usa questi modelli in produzione:

  • -33% di claim falsi rispetto a GPT-5.3
  • -47% di token usage su workflow tool-heavy

Il primo dato significa meno codice inventato, meno API inesistenti, meno "ho fatto la modifica" quando in realta' non ha toccato nulla. Il secondo significa che su task che richiedono molte chiamate a tool (file system, terminale, browser), GPT-5.4 e' quasi due volte piu' efficiente nei token consumati.

Per chi paga a token, quel -47% si traduce direttamente in costi dimezzati su certi workflow.


Pricing API

InputOutput
GPT-5.4$2.50/MTok$15/MTok

Confronto rapido: Opus 4.6 costa $5/$25. GPT-5.4 e' esattamente la meta' sull'input e il 60% sull'output. A parita' di task, costa significativamente meno.

Gemini 3.1 Pro resta il piu' economico della fascia frontier, ma il rapporto prezzo/performance di GPT-5.4 e' competitivo.


Le Debolezze: Sam Altman Parla Chiaro

Qui la cosa si fa interessante. In un'intervista su TechRadar, Altman ha ammesso tre debolezze specifiche di GPT-5.4:

1. Il frontend fa schifo (parole sue, piu' o meno)

"Frontend taste is far behind Opus 4.6 and Gemini 3.1 Pro"

Se chiedi a GPT-5.4 di generare un'interfaccia, il codice funziona ma il risultato visivo e' mediocre. Claude e Gemini producono UI che sembrano progettate da qualcuno con gusto. GPT-5.4 produce UI che sembrano progettate da qualcuno che ha letto la documentazione di Tailwind ma non ha mai aperto Dribbble.

2. Manca contesto real-world

Il modello ragiona bene in astratto ma fatica quando serve conoscenza del mondo reale -- convenzioni di progetto, pattern comuni in certi stack, decisioni architetturali che un dev senior prenderebbe "a naso".

3. Si ferma prima di finire

Su task lunghi e complessi, GPT-5.4 tende a fermarsi prima di completare il lavoro. Dichiara di aver finito quando in realta' mancano pezzi. E' lo stesso problema che aveva GPT-5.3, evidentemente non ancora risolto del tutto.

Il fatto che Altman ammetta queste debolezze pubblicamente e' un buon segno. Significa che le stanno tracciando come priorita'.


Il Ritiro di GPT-5.1

L'11 marzo, sei giorni dopo il lancio di GPT-5.4, OpenAI ha ritirato l'intera famiglia GPT-5.1 da ChatGPT.

La migrazione:

Modello ritiratoSostituito da
GPT-5.1 InstantGPT-5.3 Instant
GPT-5.1 ThinkingGPT-5.4 Thinking
GPT-5.1 ProGPT-5.4 Pro

Le API di GPT-5.1 restano disponibili per ora, ma il messaggio e' chiaro: il lifecycle dei modelli si accorcia. GPT-5.1 ha avuto una vita di circa quattro mesi.

Per chi ha codice che punta a gpt-5.1-thinking via API, non c'e' urgenza immediata. Ma pianificate la migrazione.


Il Panorama a Marzo 2026

Facciamo un passo indietro e guardiamo il quadro completo.

Capacita'LeaderScore
Coding (repo open source)Claude Opus 4.680.8% SWE-Bench
Coding (codebase privati)GPT-5.457.7% SWE-Bench Pro
Computer useGPT-5.475.0% OSWorld
Frontend/UIClaude + Gemini-- (qualitativo)
Prezzo/performanceGemini 3.1 Pro--

Non c'e' un vincitore assoluto. C'e' un ecosistema dove ogni player ha i propri punti di forza.

Claude resta il migliore per coding su repository open source e per la qualita' del frontend. GPT-5.4 eccelle su codebase privati e computer use. Gemini offre il miglior rapporto qualita'/prezzo.


Cosa Significa per Chi Sviluppa

La convergenza e' il trend. OpenAI ha smesso di fare modelli specializzati perche' i dev non vogliono switchare tra cinque modelli diversi. Vogliono un modello che ragiona, scrive codice, naviga il web e interagisce con il desktop.

GPT-5.4 e' il primo tentativo serio di modello "tutto in uno" nella fascia frontier. I risultati sono promettenti su reasoning e computer use, meno sul coding puro dove Claude mantiene il vantaggio.

Il consiglio pratico: se lavorate principalmente su codebase proprietari senza molta documentazione pubblica, GPT-5.4 merita un test serio. Quel 57.7% su SWE-Bench Pro racconta qualcosa di reale. Se invece il vostro lavoro e' piu' orientato al frontend o a repository ben documentati, Claude resta la scelta piu' solida.

E se il budget conta, date un'occhiata a quanto spendete in token. Quel -47% su workflow tool-heavy non e' marketing -- e' denaro risparmiato.


Fonti

  1. OpenAI -- Introducing GPT-5.4
  2. TechCrunch -- OpenAI launches GPT-5.4
  3. TechRadar -- Sam Altman on GPT-5.4 weaknesses
  4. DeviceBase -- Retiring GPT-5.1 models