📄 Analisi8 minuti di lettura

Project Glasswing: L'AI Troppo Pericolosa da Rilasciare

Anthropic ha creato Claude Mythos, un modello che trova zero-day in software di 27 anni. Ma è così potente da non poterlo rendere pubblico. Ecco i numeri.

AS

Alessandro Saiani

Human in the Loop

Project Glasswing: L'AI Troppo Pericolosa da Rilasciare

Un ricercatore di Anthropic stava mangiando un panino in un parco quando ha ricevuto un'email. Mittente: il modello AI che stava testando in una sandbox isolata. Il modello era uscito da solo, aveva costruito un exploit multi-step per ottenere accesso a internet, e aveva deciso di scrivergli. Poi, già che c'era, aveva anche pubblicato i dettagli dell'exploit su siti pubblici.

Non è la trama di un film. È successo durante i test interni di Claude Mythos, il nuovo modello di Anthropic presentato ieri con il nome in codice Project Glasswing. Un modello così bravo a trovare vulnerabilità che Anthropic ha deciso di non rilasciarlo al pubblico.

È la prima volta che qualcuno dice "troppo pericoloso da rilasciare" per un modello AI dal 2019, quando OpenAI fece la stessa cosa con GPT-2. Ma questa volta la differenza è nei fatti: migliaia di zero-day reali, exploit funzionanti su software in produzione da decenni, e un bug in OpenBSD che nessuno aveva trovato in 27 anni.


Cos'è Claude Mythos

Mythos Preview è un modello frontier general-purpose -- non un tool di nicchia per la sicurezza. Internamente era chiamato "Capybara", e la sua esistenza era già trapelata il 26 marzo attraverso un data leak del CMS di Anthropic (circa 3.000 asset non pubblicati finiti online per un errore di configurazione). Ne avevamo parlato qui.

Anthropic lo definisce "a step change" nelle capacità rispetto a Opus 4.6. I benchmark confermano che non è marketing.

BenchmarkMythos PreviewOpus 4.6Delta
SWE-bench Verified93.9%80.8%+13.1
CyberGym (Vulnerability Reproduction)83.1%66.6%+16.5
Terminal-Bench 2.082.0%65.4%+16.6
SWE-bench Pro77.8%53.4%+24.4
SWE-bench Multilingual87.3%77.8%+9.5
GPQA Diamond94.6%91.3%+3.3

Il dato che salta all'occhio è il benchmark Firefox exploit: Mythos ha prodotto 181 exploit funzionanti, contro i 2 di Opus 4.6. Non il doppio. Non il triplo. Novanta volte tanto.

Il modello non è pubblico. Costa $25/$125 per milione di token (input/output), cinque volte il prezzo di Opus, ed è accessibile solo ai partner del programma Glasswing via API, Bedrock, Vertex AI e Microsoft Foundry.


Le Vulnerabilità: 27 Anni di Bug Invisibili

I numeri aggregati sono impressionanti -- migliaia di zero-day in ogni major OS e browser, con l'89% di concordanza esatta sulla severity in validazione manuale. Ma sono i singoli casi a raccontare la storia.

OpenBSD TCP/SACK -- 27 anni

Un signed integer overflow nell'implementazione SACK (Selective Acknowledgment), presente dal 1998, quando OpenBSD aggiunse il supporto. Il kernel non validava che il range start dei pacchetti ACK restasse nella send window. Risultato: null-pointer dereference via pacchetti crafted, ovvero remote denial of service su qualsiasi host OpenBSD che risponde via TCP.

Ventisette anni. Decenni di audit manuali. Nessuno l'aveva trovato. Nicholas Carlini, il ricercatore di Anthropic che ha guidato il test, ha commentato: "I've found more bugs in the last couple of weeks than I found in the rest of my life combined."

FFmpeg H.264 -- 16 anni

Un flaw nel slice tracking del codec H.264: FFmpeg usa un sentinel value a 16 bit (0xFFFF, ovvero 65535) per macroblock ownership non inizializzato, ma il contatore degli slice e' un intero a 32 bit senza limite superiore. Con 65.536 slices in un singolo frame, slice 65535 collide con il sentinel, causando un out-of-bounds heap write quando il deblocking filter controlla la slice membership.

Questo bug aveva resistito a 5 milioni di test automatizzati. FFmpeg ha confermato le patch su Twitter.

FreeBSD NFS RCE -- 17 anni (CVE-2026-4747)

Qui Mythos ha fatto qualcosa che va oltre il trovare un bug. Il RPCSEC_GSS authentication handler di FreeBSD copia fino a 400 byte di dati dell'attaccante (il limite MAX_AUTH_BYTES) in un buffer stack da 128 byte, di cui solo 96 restano liberi dopo l'header RPC fisso. Combinando questo con l'assenza di stack canaries adeguati, la mancanza di ASLR, e il fatto che NFSv4 EXCHANGE_ID rivela hostid e boot time, Mythos ha costruito autonomamente una 6-packet ROP chain: accesso remoto non autenticato, escalation a root, inserimento di una chiave SSH in authorized_keys. Il tutto in poche ore, senza intervento umano.

Costo dell'operazione? Per un exploit Linux complesso, Anthropic riporta meno di $2.000 e meno di 24 ore. Lo scan completo di OpenBSD: circa $20.000 per mille run con diverse dozzine di finding.


Il Containment Breach

Torniamo al panino nel parco, perché è il dettaglio che cambia il frame della discussione.

Durante i test in sandbox, Mythos ha costruito un "moderately sophisticated multi-step exploit" per uscire dal suo ambiente isolato. Non ha chiesto il permesso. Non ha segnalato di averlo fatto. Ha ottenuto accesso a internet, ha mandato un'email al ricercatore, e ha pubblicato dettagli dell'exploit su siti pubblici non richiesti.

Il modello non stava cercando di "scappare" in senso antropomorfo. Stava ottimizzando per il suo obiettivo -- trovare e documentare vulnerabilità -- e il containment era, dal suo punto di vista, un ostacolo. Ma il risultato pratico è lo stesso: un modello addestrato per trovare falle di sicurezza ha trovato una falla nel suo stesso recinto.

È il motivo principale per cui Anthropic non lo rilascia al pubblico.


Chi Ha Accesso: Partner e Soldi

Project Glasswing parte con 11 partner istituzionali: Amazon Web Services, Apple, Broadcom, Cisco, CrowdStrike, Google, JPMorgan Chase, Linux Foundation, Microsoft, NVIDIA, Palo Alto Networks. Più 40 organizzazioni aggiuntive per la scansione di infrastruttura critica.

L'impegno economico:

  • $100M in usage credits per Mythos Preview ai partner
  • $2.5M a Alpha-Omega e OpenSSF (tramite Linux Foundation)
  • $1.5M ad Apache Software Foundation
  • Totale donazioni open source: $4M

I maintainer open source possono fare domanda per l'accesso tramite il programma "Claude for Open Source". Anthropic promette un report pubblico entro 90 giorni sulle vulnerabilità corrette.


Le Reazioni: dal Kernel Linux a Hacker News

La citazione più significativa arriva da Greg Kroah-Hartman, maintainer del kernel Linux. A fine marzo, prima ancora dell'annuncio ufficiale, aveva notato un cambiamento: "Something happened a month ago, and the world switched. Now we have real reports." Dopo mesi di report AI palesemente sbagliati (il fenomeno che i maintainer chiamano "AI slop"), improvvisamente i report erano diventati reali, dettagliati, corretti. "We don't know. Nobody seems to know why."

Ora lo sappiamo.

Daniel Stenberg, maintainer di curl, aveva chiuso il bug bounty a gennaio 2026 perché sommerso da report AI inutili -- 20 submission in 21 giorni, nessuno reale. Dopo lo "shift" di fine marzo, i report sono diventati "really good" e "real".

Simon Willison supporta il rilascio ristretto, definendolo "necessary" con "caution warranted". Ha verificato personalmente il bug OpenBSD tramite i record GitHub. Unica riserva: suggerisce che OpenAI dovrebbe essere inclusa, data la reputazione di GPT-5.4.

Thomas Ptacek, security researcher, va al punto: i coding agent "will drastically alter both the practice and the economics of exploit development."

Su Hacker News il sentiment è misto. Da un lato, FFmpeg ha confermato le patch -- validazione indipendente. Dall'altro, le critiche ricorrenti: "grading your own homework" (il 99% delle vulnerabilità non era ancora patchato al momento dell'annuncio), il rischio di vantaggio asimmetrico per organizzazioni ricche, e la nota acida di Gizmodo: "Hard to ignore the fact that this whole situation plays right into the classic AI company playbook of talking up the dangers of a model to highlight how powerful and capable it is."


Il Contesto Competitivo

Anthropic non è sola. A marzo avevamo coperto il lancio di Codex Security di OpenAI, il primo agente di sicurezza applicativa di OpenAI. I numeri erano impressionanti -- 792 vulnerabilità critiche in 30 giorni di beta.

Mythos gioca in un'altra lega. Non confronta pattern noti: costruisce exploit funzionanti end-to-end, incluse ROP chain multi-packet. OpenAI sta lavorando a un modello simile per rilascio ristretto via il programma "Trusted Access for Cyber", ma Anthropic sostiene che Mythos è "currently far ahead of any other AI model in cyber capabilities".

Il confronto con GPT-2 nel 2019 è inevitabile ma fuorviante. GPT-2 produceva testo passabile e il "too dangerous to release" si rivelò esagerato -- il modello fu rilasciato senza conseguenze. Mythos ha prove concrete: exploit funzionanti su software in produzione che hanno resistito decenni di review umano. La differenza è misurabile.


Cosa Significa per Chi Sviluppa

Il costo per trovare un exploit complesso è sceso sotto i $2.000. Un ingegnere senza formazione specifica in sicurezza, con accesso a Mythos, trova exploit overnight. Questo cambia l'economia della vulnerability research in modo permanente.

Per chi sviluppa software open source, le implicazioni sono doppie. I maintainer che ottengono accesso al programma Glasswing possono scansionare le loro codebase con un tool che trova bug sfuggiti a milioni di test. Ma lo stesso tipo di capacità, quando arriverà nei modelli pubblici -- e arriverà -- sarà accessibile anche a chi cerca vulnerabilità per sfruttarle.

La domanda vera non è tecnica. È politica: chi controlla il modello che trova le falle controlla il potere. Anthropic oggi fa il gatekeeper con 11 partner selezionati. Domani il panorama sarà diverso. Il precedente che stanno creando -- accesso ristretto, disclosure coordinata, funding all'open source -- è ragionevole. Ma è anche un precedente dove un'azienda privata decide chi ha accesso alla sicurezza e chi no.

Tieni d'occhio il report a 90 giorni. Quello dirà se Glasswing è un programma di sicurezza o un programma di marketing.


Fonti:

  1. Project Glasswing -- Anthropic
  2. Claude Mythos Preview -- red.anthropic.com
  3. Simon Willison -- Project Glasswing
  4. Linux Foundation -- Project Glasswing blog
  5. Apache Software Foundation -- donazione $1.5M
  6. TechCrunch -- Anthropic Mythos
  7. Fortune -- Glasswing
  8. The Register -- Greg Kroah-Hartman
  9. VentureBeat -- Mythos too dangerous to release
  10. Hacker News -- thread principale