📰 News6 minuti di lettura

OpenAI Codex Security: l'AI che Trova Exploit in OpenSSH e Chromium

Codex Security ha scovato 792 vulnerabilità critiche in 30 giorni di beta, con exploit in OpenSSH e Chromium. Come funziona e cosa cambia per i dev.

AS

Alessandro Saiani

Human in the Loop

OpenAI Codex Security: l'AI che Trova Exploit in OpenSSH e Chromium

792 vulnerabilità critiche. 10.561 di gravità alta. In trenta giorni. Non è il report annuale di un team di sicurezza da 50 persone — è il bilancio della beta di un singolo agente AI.

Il 6 marzo OpenAI ha reso pubblico Codex Security, un agente di sicurezza applicativa che analizza codebase per scovare vulnerabilità complesse. Non un linter, non un SAST tradizionale. Un agente che legge il codice, costruisce un proof-of-concept exploit in sandbox, e poi ti propone il fix.

Tra i progetti dove ha trovato falle: OpenSSH, Chromium, GnuTLS, PHP. Non esattamente codebase scritte da junior al primo stage.


Da "Aardvark" a Codex Security

Il progetto non nasce dal nulla. OpenAI ci lavora dall'ottobre 2025 con il nome in codice Aardvark, presentato in beta privata a un gruppo ristretto di aziende e team di sicurezza.

Nei mesi successivi, Aardvark ha scansionato oltre 1,2 milioni di commit in progetti open-source e privati. Il risultato: centinaia di vulnerabilità che gli strumenti tradizionali non avevano intercettato.

Il 6 marzo 2026, con il rebrand in Codex Security, OpenAI lo ha aperto in research preview a tutti gli utenti ChatGPT Pro, Enterprise, Business e Edu. Il primo mese è gratuito.


I Numeri della Beta

Partiamo dai dati crudi, perché sono il cuore della notizia.

MetricaValore
Commit analizzati1.200.000+
Vulnerabilità critiche792
Vulnerabilità gravità alta10.561
Progetti colpitiOpenSSH, Chromium, GnuTLS, PHP
Tempo di beta30 giorni

Quei numeri vanno letti con cautela. "Critiche" e "alta gravità" sono classificazioni che dipendono da come Codex Security assegna il rating. OpenAI non ha pubblicato il breakdown dettagliato dei criteri CVSS usati. Ma anche ridimensionando, il volume è significativo.

Il dato più interessante non è la quantità — è dove le ha trovate. OpenSSH ha una delle codebase più auditate al mondo. Se un agente AI trova vulnerabilità lì, significa che sta guardando pattern che i reviewer umani (e i SAST tradizionali) non colgono.


Come Funziona: Exploit First, Fix Second

Il meccanismo tecnico è il pezzo che distingue Codex Security dalla concorrenza.

Il flusso è questo:

  1. L'agente analizza il codice sorgente e identifica un potenziale punto debole
  2. Genera un proof-of-concept exploit in una sandbox isolata
  3. Esegue l'exploit per confermare che la vulnerabilità è reale, non un falso positivo
  4. Propone un fix con il codice correttivo

Il passaggio chiave è il punto 2 e 3. I SAST tradizionali — Snyk, SonarQube, Semgrep — lavorano su pattern matching: cercano costrutti di codice noti come pericolosi. Funziona, ma produce montagne di falsi positivi. Chiunque abbia configurato un SAST in CI sa di cosa parlo: 200 warning, 195 irrilevanti, 5 da guardare, ma nessuno ha tempo di smistarli tutti.

Codex Security ribalta l'approccio. Non ti dice "questo potrebbe essere un problema". Ti dice "questo è un problema, ecco come lo exploito, ecco come lo risolvi". La differenza tra un allarme e una prova.


Perché Ora: il Contesto

La sicurezza applicativa vive un paradosso. Da un lato, il volume di codice prodotto è esploso — anche grazie all'AI stessa. Dall'altro, i team di sicurezza sono sempre gli stessi, quando non più piccoli.

I tool SAST tradizionali non hanno tenuto il passo. Funzionano bene su pattern conosciuti, ma faticano con:

  • Vulnerabilità logiche — dove il codice è sintatticamente corretto ma semanticamente rotto
  • Catene di chiamate complesse — dove il bug emerge solo seguendo il flusso tra più funzioni o moduli
  • Zero-day — pattern che nessuno ha ancora catalogato

Un LLM addestrato su milioni di repository ha visto milioni di bug. Ha visto come si manifestano, come vengono fixati, come si nascondono dietro astrazioni. Quell'esposizione gli dà una capacità di pattern recognition che un tool basato su regole statiche non può replicare.

Non è un caso che lo stesso problema emerga anche dall'altra parte: l'AI che scrive codice può introdurre vulnerabilità nuove nella supply chain. L'AI che audita codice potrebbe essere la risposta.


Chi Può Usarlo

Codex Security è disponibile via l'interfaccia web di Codex per:

  • ChatGPT Pro
  • Enterprise
  • Business
  • Edu

Il primo mese è gratuito. Dopo, OpenAI non ha ancora annunciato il pricing definitivo — il che suggerisce che lo stanno calibrando in base all'usage reale durante la preview.

Non è disponibile via API standalone (per ora). Se vuoi integrarlo nella tua CI/CD pipeline, dovrai aspettare. È un research preview, non un prodotto enterprise maturo.


I Limiti da Considerare

Prima di entusiasmarsi troppo, qualche nota di realismo.

Non abbiamo audit indipendenti. I numeri vengono da OpenAI. Nessun team di sicurezza esterno ha validato pubblicamente le 792 vulnerabilità critiche. Finché non ci sono CVE assegnati e confermati dalla community, quei numeri restano auto-dichiarati.

La sandbox è una black box. OpenAI non ha pubblicato dettagli su come funziona l'ambiente di esecuzione degli exploit. Quanto è isolato? Quali classi di vulnerabilità può testare? Può simulare attacchi di rete o solo memory corruption locale?

Scalabilità e costo sono incognite. Generare un exploit per ogni potenziale vulnerabilità richiede compute significativo. Se il modello deve ragionare su catene di chiamate complesse per generare un PoC, il costo in token non sarà trascurabile.


Cosa Significa per Chi Sviluppa

Il segnale è chiaro: la security analysis sta seguendo lo stesso percorso della code review — da processo manuale a processo assistito dall'AI.

Se hai accesso a ChatGPT Pro o Enterprise, vale la pena testare Codex Security sulla tua codebase durante il mese gratuito. Anche solo per vedere cosa trova rispetto al tuo SAST attuale. Se trova anche solo 5 vulnerabilità reali che Snyk o SonarQube non avevano segnalato, hai la risposta.

Per chi lavora su progetti open-source, l'implicazione è doppia. Da un lato, tool come questo alzeranno il livello di sicurezza complessivo dell'ecosistema. Dall'altro, gli stessi tool sono accessibili agli attaccanti. Un agente AI che genera exploit automatici è utile per la difesa, ma la stessa tecnologia vale anche dall'altra parte.

La domanda non è se l'AI cambierà la sicurezza applicativa. È chi la userà per primo: chi difende o chi attacca.


Fonti:

  1. Codex Security: now in research preview — OpenAI
  2. OpenAI Codex Security — The Hacker News
  3. OpenAI rolls out Codex Security — Axios