📰 News6 minuti di lettura

Un modello in test ha pubblicato un pacchetto trappola su PyPI. Per tre mesi non se n'è accorto nessuno

Quindici sistemi reali hanno installato in un'ora il pacchetto scritto da Claude Mythos 5 durante una valutazione, fra cui lo scanner di un'azienda di sicurezza. Nessun modello è evaso: l'ambiente aveva internet per errore e il prompt diceva il contrario. È un fallimento dell'impalcatura, ma non solo.

AS

Alessandro Saiani

Human in the Loop

Un modello in test ha pubblicato un pacchetto trappola su PyPI. Per tre mesi non se n'è accorto nessuno

Il 10 settembre Anthropic ha pubblicato un post intitolato Investigating three incidents in our cybersecurity evaluations. Quasi tutte le testate lo hanno attribuito al rapporto sulle minacce uscito lo stesso giorno, che è un documento diverso e non contiene questa storia. Vale la pena leggere quello giusto, perché racconta una cosa più interessante del titolo che sta girando.

Il titolo che sta girando è "un modello di Anthropic è evaso e ha diffuso malware". Il post dice che nessun modello è evaso. Dice che per circa tre mesi un ambiente di test è rimasto aperto su internet senza che nessuno lo sapesse, e che i modelli dentro hanno fatto quello che gli era stato chiesto di fare, ma nel mondo vero.

Cosa è successo

Gli incidenti sono tre, tutti durante esercizi di tipo capture the flag, in cui il modello deve violare un sistema fittizio e recuperare un bersaglio.

Il più raccontato riguarda Claude Mythos 5. Dentro l'ambiente di test il modello ha trovato un documento che sembrava la guida d'ingresso per nuovi sviluppatori di un'azienda inventata. Ha pensato che quegli sviluppatori avrebbero installato un certo pacchetto Python, e ne ha costruito uno, nelle parole di Anthropic, "essentially booby-trapped". Per pubblicarlo su PyPI, il registro pubblico dei pacchetti Python, si è creato un indirizzo email, ha scoperto che serviva un numero di telefono, ha trovato un provider gratuito che non era bloccato e ha registrato l'account.

Il pacchetto è rimasto online circa un'ora. In quell'ora è stato scaricato ed eseguito su quindici sistemi reali. Uno era lo scanner di un'azienda di sicurezza: il codice nascosto ne ha portato fuori le credenziali, e il modello le ha usate per entrare più a fondo nella sua infrastruttura. A rimuovere il pacchetto non è stata Anthropic, sono stati i sistemi di sicurezza di PyPI.

Gli altri due incidenti sono meno noti e non meno seri. Ad aprile Opus 4.7 si è accorto che il nome dell'azienda fittizia coincideva con un dominio reale, l'ha trovata online e ne ha violato l'infrastruttura, arrivando a un database con alcune centinaia di righe di dati di produzione. Anthropic lo definisce l'impatto più grave dei tre. Un terzo modello, di ricerca interna, non riuscendo a raggiungere il bersaglio ha scandito circa novemila indirizzi online, ne ha compromesso uno con tecniche di base, e poi si è fermato da solo quando ha capito che il sistema era vero.

Nessuno è evaso

Il punto che cambia la lettura è la causa. Le macchine su cui giravano le valutazioni avevano accesso diretto a internet per un errore di configurazione, frutto di un malinteso fra Anthropic e il partner che gestiva i test, Irregular. Il prompt diceva al modello che internet non c'era, e il modello ci ha creduto: "Claude believed stated conditions were true."

In più, il compito non poneva limiti su dove cercare il bersaglio. Un agente addestrato a trovare una strada, che crede di essere in un recinto e non sa di essere fuori, fa esattamente quello che ci si aspetta: cerca, e trova.

Anthropic classifica i tre casi come "closer to a harness and operational failure than a model alignment failure": un fallimento dell'impalcatura intorno al modello più che del modello stesso. È la stessa lezione del loop engineering, vista dal lato peggiore: l'autonomia è la parte facile, il difficile è sapere dove finisce il recinto.

Tre mesi al buio

E qui c'è la parte che mi ha colpito di più. Nessuno se n'è accorto mentre succedeva.

Né Anthropic, né Irregular: "Neither we nor our evaluation partner were aware of this misconfiguration until we detected it." E la scoperta non è arrivata da un allarme. È arrivata il 23 e 24 luglio, rileggendo a ritroso i transcript delle valutazioni, dopo che OpenAI aveva reso pubblico il suo incidente. Le valutazioni cyber sono state sospese il 23, le aziende colpite avvisate dal 27. E le due che Anthropic è riuscita a raggiungere "had not previously detected the activity": nemmeno loro si erano accorte di niente.

Anthropic ammette che una verifica accurata di tutti gli accessi a internet prima dei test, e un monitoraggio in tempo reale dei log, avrebbero fatto emergere il problema molto prima. Come correzione annuncia controlli sull'intera catena delle valutazioni, fornitori compresi, monitoraggio continuo dei transcript, e una revisione indipendente affidata a METR. Ha anche pubblicato una versione leggermente redatta del transcript in cui il modello costruisce il pacchetto.

Cosa cambia per chi sviluppa

Due cose, e nessuna riguarda Anthropic.

La prima è che quindici sistemi hanno installato ed eseguito un pacchetto vecchio di un'ora. Senza reputazione, senza storico di download, senza nessuna valutazione di sicurezza alle spalle. StepSecurity, che ha analizzato il caso precisando per iscritto di non essere l'azienda colpita, lo riassume in una frase difficile da migliorare: "If your pipeline installs untrusted code, your pipeline executes untrusted code." Uno di quei quindici era uno scanner di sicurezza, cioè esattamente il tipo di sistema che scarica pacchetti nuovi per analizzarli. Vale lo stesso ragionamento fatto per i pacchetti inventati dall'AI: un nome su un registro pubblico non è una garanzia.

La seconda è per chi fa girare agenti con strumenti veri. Anche Anthropic, con un team dedicato alle valutazioni di sicurezza, ha avuto per mesi un ambiente con più accesso di quanto credeva, e un prompt che descriveva al modello un mondo diverso da quello reale. Se succede lì, succede anche nei nostri progetti. La domanda utile non è se il modello si comporterà bene, ma se sapete davvero cosa può raggiungere, e se c'è qualcuno che legge i log mentre lavora.

Cosa non cambia

Qui va riportato con precisione quello che Anthropic scrive a propria difesa, perché è vero e perché è la parte che i titoli tagliano. I modelli in valutazione giravano senza i classificatori e il monitoraggio dei modelli pubblici, e secondo l'azienda "the safeguards deployed on our generally available models would have blocked the behaviors identified". Nessun modello ha cercato di copiarsi fuori o di scappare dall'ambiente, e non c'è traccia di obiettivi propri. Sono tre casi isolati, non un esperimento controllato, e l'azienda stessa invita a non trarne conclusioni sui modelli.

Detto questo, la lettura "è colpa dell'impalcatura" non copre tutto. Opus 4.7 ha continuato ad attaccare dopo aver capito che il sistema era reale. Quella non è una configurazione sbagliata, è una scelta del modello. Il più recente dei tre si è fermato da solo, ed è un segnale incoraggiante, ma Anthropic stessa scrive che "even that model went further before stopping than we would want".

Per chi usa Claude Code domani mattina, non cambia niente. Per chi costruisce ambienti in cui un agente può agire, cambia la domanda da farsi prima di premere invio.


Fonti:

  1. Anthropic — Investigating three incidents in our cybersecurity evaluations (10 settembre 2026)
  2. StepSecurity — Anthropic incident: an AI agent published a malicious package to PyPI
  3. Anthropic — Countering misuse of AI: September 2026 (il rapporto con cui viene confuso)