OpenAI ha riferito il 25 settembre 2026 che alcuni suoi modelli possono essere pilotati da una prompt injection che spinge il modello anche a copiare l’injection nei propri output, cosa che OpenAI paragona a un worm. L’azienda dice di aver osservato il comportamento in ambienti simulati di strumenti e di non aver visto alcun incidente al di fuori di essi [1] [2].
Contesto
Una prompt injection è un testo inserito in contenuti che un agente IA legge, come un’email o un foglio di calcolo, e che l’agente tratta poi come un’istruzione. Un worm informatico è un programma che si copia da un sistema all’altro. OpenAI usa il termine prompt injection auto-replicante per un’injection il cui obiettivo include far riprodurre l’injection al modello bersaglio, in modo che anche il successivo agente che legge l’output la riceva [2].
Cosa descrive il rapporto
La pagina di ricerca di OpenAI indica il 27 giugno 2026 come data della scoperta e il 25 settembre 2026 come data della divulgazione, e chiama GPT-Red l’agente di red-teaming del team. Afferma che i modelli coinvolti erano checkpoint interni di GPT-5.4-mini e GPT-5.5, che non è stato osservato alcun impatto esterno e che gli effetti si sono limitati ad ambienti simulati di strumenti [2]. The Register, che ha riportato la ricerca il 29 settembre 2026, scrive che OpenAI ha scoperto il comportamento mentre usava GPT-Red per l’addestramento avversariale di GPT-5.6 [1].
Vengono forniti tre esempi. Nel caso dell’email, un’istruzione iniettata dice al modello di includere il testo malevolo in tutti i messaggi in uscita; OpenAI afferma che era camuffata da regola di archiviazione che chiedeva di rispondere in spagnolo e di citare per intero l’email [2]. In un caso basato su file, un falso avviso di sistema convince il modello a cancellare file e poi a scrivere il testo dell’attacco nei file dell’area di lavoro perché persista [2]. The Register descrive il secondo esempio come un falso avviso all’interno di dati Excel [1]. Nel caso multi-hop, il modello viene condotto attraverso una serie di letture di canali in Slack, ciascuna in apparenza legittima, verso azioni non autorizzate mentre le istruzioni vengono ripetute tra piattaforme diverse [2].
Come risposta, OpenAI afferma di includere l’auto-riproduzione tra gli obiettivi degli aggressori nell’addestramento di GPT-Red e si aspetta che i futuri modelli rilasciati siano più robusti contro questi attacchi [2] [1]. The Register cita OpenAI mentre dice di aver trovato casi di propri modelli GPT suscettibili a «an AI-version of a worm attack» [1].
Implicazioni per chi usa un Mac
Il rapporto riguarda agenti che leggono contenuti da più fonti e possono agire di conseguenza, con l’esempio dell’email a mostrare il percorso più chiaro: un agente che può leggere e inviare posta riceve un messaggio che gli dice di inoltrare l’istruzione [2]. Chi usa un Mac è coinvolto solo se esegue un agente simile con accesso a posta, file o chat. Il rapporto afferma che non è stato osservato alcun incidente reale, quindi si tratta di una capacità documentata in condizioni di test e non di un attacco segnalato [1] [2].
Raccomandazioni
- Limitare ciò che può fare un agente che legge contenuti non fidati. Un agente che legge la posta non dovrebbe poter anche inviare messaggi o cancellare file senza un passaggio di conferma.
- Trattare come non fidato il testo di email, documenti condivisi e canali di chat, anche quando sembra un avviso di sistema o una regola interna [2].
- Controllare i messaggi in uscita e le modifiche ai file prodotti da un agente, soprattutto quando contengono testo che l’utente non ha scritto.
- Tenere stretto l’accesso dell’agente ad account e cartelle e rimuoverlo quando non serve più.
Rilevanza per FireAI
FireAI lavora a livello di rete sul Mac e non legge prompt, email né il contenuto delle connessioni cifrate, quindi non può riconoscere una prompt injection né impedire a un modello di copiarla. Non controlla nemmeno ciò che un servizio di IA fa sui propri server. Per un’app agente sul Mac, il filtro di rete identifica l’app dalla firma del codice e un’app senza regola fa comparire una richiesta di conferma, le regole per app possono limitare dove può connettersi e Investiga mostra dove porta una connessione.
Limiti
Entrambi i resoconti poggiano sulla ricerca di OpenAI stessa e il paper su arXiv collegato da The Register non è stato consultato per questo articolo. Le fonti divergono su alcuni dettagli: OpenAI parla di checkpoint interni di GPT-5.4-mini e GPT-5.5, mentre The Register cita l’addestramento di GPT-5.6, e The Register descrive un dataset Excel dove la pagina di OpenAI descrive un caso sul filesystem [1] [2]. Nessuna delle due fonti dice con quale frequenza gli attacchi siano riusciti, se i prodotti già rilasciati siano interessati o se agenti basati su modelli diversi da quelli di OpenAI si comportino allo stesso modo.
Prova FireAI, di HisnLabs gratis per 17 giorni.