Il 1° ottobre 2026 The Hacker News ha riferito che OpenAI aveva interrotto una campagna coordinata di distillazione rivolta al ragionamento protetto dei suoi modelli, e che OpenAI ha attribuito un nucleo centrale dell’attività a persone associate a Moonshot AI [1]. Uno studio inviato ad arXiv il 10 agosto 2026 descrive la debolezza di fondo: tracce di ragionamento cifrate intercambiabili tra sessioni, utenti e modelli [2]. La notizia riguarda la sicurezza delle API dei modelli linguistici, che molti utenti di Mac raggiungono tramite app e agenti.
Contesto
Lo studio spiega che i principali fornitori di LLM restituiscono il ragionamento passo dopo passo di un modello sotto forma di blocchi di testo cifrato, che il client rinvia a ogni richiesta successiva [2]. La distillazione, come la descrive The Hacker News, è l’estrazione sistematica degli output di un modello per addestrarne o migliorarne un altro [1].
Risultati
Secondo il resoconto, l’attività è iniziata il 1° luglio 2026 con volumi bassi, ha raggiunto il picco il 24 e 25 luglio con 16.000 richieste tentate che seguivano uno schema di estrazione da oltre 4.000 utenti distinti, ed è stata interrotta del tutto il 28 luglio 2026 [1]. Un’attività correlata basata su schemi di prompt è stata rilevata su più di 15.000 utenti distinti [1].
Il resoconto cita OpenAI, secondo cui gli operatori non hanno violato la cifratura, compromesso un database né ottenuto accesso diretto alle conversazioni memorizzate degli utenti, ma hanno manipolato le interazioni con il modello in modo che il ragionamento protetto potesse essere riprodotto in forme visibili a chi lo richiedeva [1]. OpenAI ha bloccato gli account fraudolenti coinvolti, ha chiuso un percorso che permetteva di rinviare il ragionamento cifrato per recuperarne il contenuto e ha aggiunto controlli per rilevare e trattenere l’output in streaming che potrebbe esporre il ragionamento [1].
The Hacker News precisa che OpenAI non ha fornito prove tecniche dell’attribuzione a Moonshot AI, società con sede a Pechino, adducendo ragioni di sicurezza, e che l’articolo non contiene alcuna risposta di Moonshot AI [1]. Ricorda inoltre che il mese precedente Anthropic aveva accusato Moonshot AI di inoltrare richieste di clienti a Claude, un’attività tracciata come GTG-16002 [1].
Lo studio su arXiv riferisce che i blocchi cifrati sono pienamente compatibili e intercambiabili tra sessioni, utenti e modelli diversi, e dimostra quattro attacchi: distillazione di modelli tramite l’iniezione di tracce cifrate in modelli più deboli, estrazione di dati, esposizione di contenuti pericolosi nascosti e prompt injection invisibile nei sistemi agentici [2]. Nel caso dell’estrazione di dati, gli autori hanno recuperato 367 elementi di dati personali e 182 credenziali da 315.320 blocchi di ragionamento raccolti da repository pubblici [2]. Lo studio afferma che la ricerca ha previsto una divulgazione responsabile e propone mitigazioni crittografiche e a livello di sistema [2].
Implicazioni per chi usa un Mac
La campagna ha preso di mira gli output dei modelli di un fornitore, non i dispositivi dei suoi utenti, e le fonti non riportano che la conversazione di alcun utente sia stata esposta [1]. Lo studio è rilevante per chi usa agenti IA perché uno dei suoi quattro attacchi è la prompt injection invisibile nei sistemi agentici, e perché ha trovato credenziali e dati personali in blocchi di ragionamento pubblicati in repository pubblici [2].
Raccomandazioni
- Tenere le chiavi API dei fornitori fuori dai repository e dai log condivisi, e revocare ogni chiave che sia stata pubblicata.
- Quando si conservano o si condividono log di sessioni di IA, rimuovere i blocchi di ragionamento e gli altri campi restituiti dal fornitore che l’applicazione non richiede.
- Rivedere i permessi concessi a un agente IA, dato che lo studio include un attacco ai sistemi agentici.
- Seguire gli annunci dei fornitori su eventuali modifiche alla gestione del ragionamento nelle API in uso.
- Per un team che sviluppa su queste API, leggere le mitigazioni proposte dallo studio prima di progettare l’archiviazione delle sessioni [2].
Rilevanza per FireAI
FireAI non gestisce né protegge un’API di modelli. Su un Mac identifica un’app dalla sua firma del codice e applica a ogni connessione le regole per app, mentre l’Agent profile segnala una destinazione mai contattata o un picco di caricamento da app agente come Claude Code e Cursor, usando solo nomi di host e conteggi di byte. Il modello di IA on-device facoltativo di FireAI viene scaricato una sola volta da Hugging Face e poi gira solo sul Mac.
FireAI non vede all’interno di una connessione cifrata, quindi non può leggere un blocco di ragionamento, un prompt o una risposta del modello. Non rileva la distillazione, non controlla ciò che un fornitore restituisce e non impedisce a un account autorizzato di inviare richieste a un’API.
Limiti
Il resoconto della campagna si basa sulla sintesi di The Hacker News della dichiarazione di OpenAI, che questa notizia non ha potuto consultare direttamente [1]. L’attribuzione a Moonshot AI è una valutazione di OpenAI senza prove tecniche pubblicate. Lo studio è un preprint; questa notizia si è basata sul suo abstract e non ha verificato in modo indipendente i risultati [2]. Le fonti non indicano quali fornitori abbiano modificato le proprie API oltre alle misure di OpenAI elencate.
Prova FireAI, di HisnLabs gratis per 17 giorni.