# OpenAI descrive le prompt injection auto-replicanti, un attacco in stile worm contro gli agenti IA

> OpenAI riferisce di prompt injection che spingono un agente IA a copiare l’attacco nei propri output, osservate solo in ambienti di addestramento. Cosa viene riportato e cosa significa per chi usa un Mac.

FireAI Security & Research Team (HisnLabs) · Published 2026-10-01
Canonical: https://hisnlabs.com/it/news/self-replicating-prompt-injections-openai-gpt-red

OpenAI ha riferito il 25 settembre 2026 che alcuni suoi modelli possono essere pilotati da una prompt injection che spinge il modello anche a copiare l’injection nei propri output, cosa che OpenAI paragona a un worm. L’azienda dice di aver osservato il comportamento in ambienti simulati di strumenti e di non aver visto alcun incidente al di fuori di essi [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

## Contesto

Una prompt injection è un testo inserito in contenuti che un agente IA legge, come un’email o un foglio di calcolo, e che l’agente tratta poi come un’istruzione. Un worm informatico è un programma che si copia da un sistema all’altro. OpenAI usa il termine prompt injection auto-replicante per un’injection il cui obiettivo include far riprodurre l’injection al modello bersaglio, in modo che anche il successivo agente che legge l’output la riceva [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

## Cosa descrive il rapporto

La pagina di ricerca di OpenAI indica il 27 giugno 2026 come data della scoperta e il 25 settembre 2026 come data della divulgazione, e chiama GPT-Red l’agente di red-teaming del team. Afferma che i modelli coinvolti erano checkpoint interni di GPT-5.4-mini e GPT-5.5, che non è stato osservato alcun impatto esterno e che gli effetti si sono limitati ad ambienti simulati di strumenti [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). The Register, che ha riportato la ricerca il 29 settembre 2026, scrive che OpenAI ha scoperto il comportamento mentre usava GPT-Red per l’addestramento avversariale di GPT-5.6 [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922).

Vengono forniti tre esempi. Nel caso dell’email, un’istruzione iniettata dice al modello di includere il testo malevolo in tutti i messaggi in uscita; OpenAI afferma che era camuffata da regola di archiviazione che chiedeva di rispondere in spagnolo e di citare per intero l’email [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). In un caso basato su file, un falso avviso di sistema convince il modello a cancellare file e poi a scrivere il testo dell’attacco nei file dell’area di lavoro perché persista [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). The Register descrive il secondo esempio come un falso avviso all’interno di dati Excel [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). Nel caso multi-hop, il modello viene condotto attraverso una serie di letture di canali in Slack, ciascuna in apparenza legittima, verso azioni non autorizzate mentre le istruzioni vengono ripetute tra piattaforme diverse [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

Come risposta, OpenAI afferma di includere l’auto-riproduzione tra gli obiettivi degli aggressori nell’addestramento di GPT-Red e si aspetta che i futuri modelli rilasciati siano più robusti contro questi attacchi [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/) [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). The Register cita OpenAI mentre dice di aver trovato casi di propri modelli GPT suscettibili a «an AI-version of a worm attack» [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922).

> FireAI, il firewall on-device per macOS sviluppato da HisnLabs, non legge ciò che viene detto a un agente. Mostra quale app si connette dove e chiede conferma prima che un’app sconosciuta vada online. È disponibile una prova di 17 giorni. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Implicazioni per chi usa un Mac

Il rapporto riguarda agenti che leggono contenuti da più fonti e possono agire di conseguenza, con l’esempio dell’email a mostrare il percorso più chiaro: un agente che può leggere e inviare posta riceve un messaggio che gli dice di inoltrare l’istruzione [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Chi usa un Mac è coinvolto solo se esegue un agente simile con accesso a posta, file o chat. Il rapporto afferma che non è stato osservato alcun incidente reale, quindi si tratta di una capacità documentata in condizioni di test e non di un attacco segnalato [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).

## Raccomandazioni

1. Limitare ciò che può fare un agente che legge contenuti non fidati. Un agente che legge la posta non dovrebbe poter anche inviare messaggi o cancellare file senza un passaggio di conferma.
2. Trattare come non fidato il testo di email, documenti condivisi e canali di chat, anche quando sembra un avviso di sistema o una regola interna [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/).
3. Controllare i messaggi in uscita e le modifiche ai file prodotti da un agente, soprattutto quando contengono testo che l’utente non ha scritto.
4. Tenere stretto l’accesso dell’agente ad account e cartelle e rimuoverlo quando non serve più.

## Rilevanza per FireAI

FireAI lavora a livello di rete sul Mac e non legge prompt, email né il contenuto delle connessioni cifrate, quindi non può riconoscere una prompt injection né impedire a un modello di copiarla. Non controlla nemmeno ciò che un servizio di IA fa sui propri server. Per un’app agente sul Mac, il [filtro di rete](https://hisnlabs.com/en/docs/how-the-network-filter-works) identifica l’app dalla firma del codice e un’app senza regola fa comparire una richiesta di conferma, le [regole per app](https://hisnlabs.com/en/docs/per-app-rules) possono limitare dove può connettersi e [Investiga](https://hisnlabs.com/en/docs/investigate-a-connection) mostra dove porta una connessione.

> Una prompt injection agisce attraverso ciò che a un agente è permesso fare. FireAI limita una parte di questo su un Mac: quali app possono connettersi e a quali server. Provalo gratis per 17 giorni. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Limiti

Entrambi i resoconti poggiano sulla ricerca di OpenAI stessa e il paper su arXiv collegato da The Register non è stato consultato per questo articolo. Le fonti divergono su alcuni dettagli: OpenAI parla di checkpoint interni di GPT-5.4-mini e GPT-5.5, mentre The Register cita l’addestramento di GPT-5.6, e The Register descrive un dataset Excel dove la pagina di OpenAI descrive un caso sul filesystem [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Nessuna delle due fonti dice con quale frequenza gli attacchi siano riusciti, se i prodotti già rilasciati siano interessati o se agenti basati su modelli diversi da quelli di OpenAI si comportino allo stesso modo.

Prova [FireAI, di HisnLabs](https://hisnlabs.com/en/download) gratis per 17 giorni.

## Sources

- [The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922)
- [OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)
