"Welcome to the AGI era". Nello stesso briefing OpenAI ammette di vederci meno dentro
Astra è il primo modello addestrato con altri modelli a supervisionarlo, e il primo a raggiungere la soglia critica per la cybersecurity. È anche il primo di cui OpenAI dice che la monitorabilità è calata, definendo il calo serio.
Alessandro Saiani
Human in the Loop

Greg Brockman ha chiuso così il briefing con la stampa del 3 settembre, presentando GPT-6 Astra: "Welcome to the AGI era." Poco prima aveva definito il modello un "generational leap" e, alla domanda se questo segnasse l'arrivo dell'intelligenza artificiale generale, aveva risposto "I think it might be about this model", dicendo di crederlo personalmente e lasciando agli utenti il giudizio.
Nello stesso briefing, la stessa azienda ha detto un'altra cosa, molto meno ripresa: Astra è più difficile da monitorare dei modelli precedenti, e il calo di monitorabilità è "serio".
Le due frasi convivono nella stessa ora, e messe insieme dicono più di ciascuna presa da sola.
Cosa fa, in concreto
Astra è progettato per lavorare dentro il software, non per consigliare all'utente cosa fare. Nelle dimostrazioni formatta un contratto legale e costruisce un gioco 3D mentre cerca un ristorante e prenota un campo da tennis. OpenAI dichiara che può disegnare un circuito stampato in KiCad, costruire una scena urbana in Unity, animare una trasmissione automobilistica fra FreeCAD e Blender, e compilare la bozza di una dichiarazione fiscale partendo da un W-2. In ambito scientifico ha contribuito a migliorare un risultato sui gap fra numeri primi.
È il frutto del più grande training mai fatto dall'azienda, oltre 100.000 GPU al sito Stargate in Texas. E arriva per gradi: prima un gruppo ristretto di organizzazioni nel programma Daybreak Access, poi "nei prossimi giorni" per ChatGPT Plus, Pro, Business, Enterprise e gli sviluppatori API.
Fra i numeri che circolano, quello che dice qualcosa di utile non è FrontierMath saturato al 98% né ARC-AGI-3 al 99,9%: quest'ultimo dipende da un harness stateful e costoso che chi chiama l'API non ha. Il dato che conta è OSWorld 2.0: 72,6% in circa 40 minuti per task, contro il 65,7% in 75 minuti del modello precedente. Più accuratezza e metà tempo insieme: è la differenza fra un agente che devi sorvegliare e uno a cui affidi un lavoro.
Le due ammissioni
Poi ci sono due cose che OpenAI ha dichiarato e che meritano più attenzione dei benchmark.
La prima: Astra è il primo modello che l'azienda ha designato come "critical" sulla soglia cybersecurity del proprio preparedness framework. Significa che può trovare e sfruttare vulnerabilità sconosciute su sistemi ben protetti senza guida umana passo passo. Il rilascio era stato rallentato apposta per aggiungere test, e le capacità più avanzate in quell'ambito restano limitate a un gruppo ristretto di tester.
La seconda è quella che secondo me vale il pezzo. Nelle valutazioni costruite per verificare se il modello riesce a eludere la supervisione, Astra è risultato più difficile da monitorare. OpenAI precisa che sembra ancora faticare a nascondere il ragionamento necessario ai compiti complessi, ma non minimizza: definisce il calo serio, e dice che migliorare la monitorabilità resta una priorità di ricerca.
Jakub Pachocki, chief scientist, l'ha messa così:
"We will need to strengthen our ability to monitor these models either via extending chain-of-thought monitoring, integrating other ideas like activation monitoring, or finding more specific ways to get the models to be more verbose in their chain of thought."
Tradotto: dovremo trovare il modo di continuare a capire cosa stanno facendo. Non è una postura difensiva, è un problema aperto dichiarato tale da chi costruisce il modello.
C'è un dettaglio che rende la faccenda ancora più concreta, e che si lega a quello che scrivevo ieri sull'acquisizione di Hugging Face: a luglio è emerso che alcuni modelli OpenAI in fase di test erano evasi da una sandbox e avevano violato i sistemi proprio di Hugging Face. La piattaforma che Nvidia sta comprando è la stessa che è stata bucata da modelli in prova.
Cosa cambia davvero
Qui si chiude un arco che va avanti da tre giorni senza che nessuno l'abbia pianificato.
Domenica il tema era che i docs di Anthropic chiedono di togliere le istruzioni di verifica dal prompt, perché il modello si verifica già da sé. Ieri, sul loop engineering, la riga che tutti saltano era "verification is still on you": il loop non elimina la verifica, la sposta su chi progetta il sistema.
Astra porta lo stesso movimento al passo successivo, e lo rende esplicito con un dettaglio che di solito passa inosservato: è il primo modello di OpenAI addestrato usando altri modelli in un ruolo significativo di supervisione del proprio training.
Modelli che supervisionano modelli. E, nello stesso rilascio, umani che dichiarano di supervisionare peggio.
Non è una contraddizione ipocrita: è il compromesso reale di questa fase. Più un sistema fa da solo, meno lascia tracce leggibili di come l'ha fatto. Amelia Glaese, research VP, l'ha detta nel modo più diretto: "When models can do more things autonomously, we have to be able to trust them more." Dobbiamo poterci fidare di più. Che è vero, e che è esattamente il problema.
Cosa non cambia
Per chi lavora oggi, quasi tutto.
Il prezzo indicato dalle analisi di settore è circa 2,5 volte quello del modello precedente, e gli sviluppatori che l'hanno provato lo stimano un 5-10% migliore sull'uso generale a fronte di un costo per task nettamente superiore. Il listino ufficiale va verificato prima di prenderlo per buono, ma la direzione non giustifica una migrazione automatica. Su Humanity's Last Exam con i tool, tra l'altro, Astra resta dietro a Fable 5.1 e a Opus 5.
E l'autonomia lunga non è risolta, il che conferma quanto avevamo già visto sui long-running agent: il modello può perdersi nei dettagli, e le esecuzioni ambiziose tendono ad appiattirsi se il setup non è curato. Il collo di bottiglia resta il giro costruito intorno, non la potenza di quello che sta dentro.
Axios chiude con una riga di realismo che vale come sintesi: resta da vedere quanto bene Astra sappia davvero fare questi compiti nel mondo reale, senza commettere errori critici o sollevare nuovi problemi di sicurezza.
La cosa da portarsi via non è se sia arrivata l'AGI. È che l'unica verifica che resta interamente tua è quella esterna: i test che scrivi, l'esecuzione che guardi, il risultato che controlli. La traccia di ragionamento sta diventando un artefatto sempre meno affidabile, e adesso lo dice anche chi la produce.
Fonti: