# OpenAI describe las inyecciones de prompt autorreplicantes, un ataque tipo gusano contra agentes de IA > OpenAI informa de inyecciones de prompt que hacen que un agente de IA copie el ataque en sus propias salidas, halladas solo en entornos de entrenamiento. Qué se reporta y qué significa para usuarios de Mac. FireAI Security & Research Team (HisnLabs) · Published 2026-10-01 Canonical: https://hisnlabs.com/es-mx/news/self-replicating-prompt-injections-openai-gpt-red OpenAI informó el 25 de septiembre de 2026 que algunos de sus modelos pueden ser manipulados con una inyección de prompt que además hace que el modelo copie la inyección en sus propias salidas, algo que OpenAI compara con un gusano. La empresa dice que encontró este comportamiento en entornos simulados de herramientas y que no ha visto ningún incidente fuera de ellos [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). ## Contexto Una inyección de prompt es texto colocado en contenido que lee un agente de IA, como un correo o una hoja de cálculo, y que el agente trata después como una instrucción. Un gusano informático es un programa que se copia de un sistema a otro. OpenAI usa el término inyección de prompt autorreplicante para una inyección cuyo objetivo incluye lograr que el modelo atacado reproduzca la inyección, de modo que el siguiente agente que lea la salida también la reciba [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). ## Lo que describe el informe La página de investigación de OpenAI da el 27 de junio de 2026 como fecha del descubrimiento y el 25 de septiembre de 2026 como fecha de la divulgación, y llama GPT-Red al agente de red teaming del equipo. Indica que los modelos afectados eran puntos de control internos de GPT-5.4-mini y GPT-5.5, que no se observó impacto externo y que los efectos se limitaron a entornos simulados de herramientas [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). The Register, que informó sobre la investigación el 29 de septiembre de 2026, escribe que OpenAI encontró el comportamiento al usar GPT-Red para entrenar de forma adversarial a GPT-5.6 [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). Se dan tres ejemplos. En el caso del correo, una instrucción inyectada ordena al modelo incluir el texto malicioso en todos los mensajes salientes; OpenAI dice que estaba disfrazada de una regla de archivado que pedía responder en español y citar íntegramente el correo [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). En un caso basado en archivos, una falsa advertencia del sistema convence al modelo de eliminar archivos y luego escribir el texto del ataque en archivos del espacio de trabajo para que persista [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). The Register describe el segundo ejemplo como una falsa advertencia dentro de datos de Excel [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). En el caso de múltiples saltos, el modelo es llevado a través de una serie de lecturas de canales en Slack, cada una aparentemente legítima, hacia acciones no autorizadas mientras las instrucciones se repiten entre plataformas [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Como respuesta, OpenAI afirma que está incluyendo la autorreproducción como un aspecto de los objetivos del atacante en el entrenamiento de GPT-Red, y espera que los modelos que se publiquen en el futuro sean más robustos frente a estos ataques [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/) [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). The Register cita a OpenAI diciendo que encontró casos en que sus modelos GPT eran susceptibles a "una versión para IA de un ataque de gusano" [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922). > FireAI, el firewall en el dispositivo para macOS desarrollado por HisnLabs, no lee lo que se le dice a un agente. Muestra qué app se conecta adónde y pregunta antes de que una app desconocida se conecte a internet. Hay una prueba de 17 días disponible. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## Implicaciones para usuarios de Mac El informe trata de agentes que leen contenido de varias fuentes y pueden actuar en consecuencia; el ejemplo del correo muestra el camino más claro: un agente que puede leer y enviar correo recibe un mensaje que le ordena reenviar la instrucción [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Un usuario de Mac solo se ve afectado si ejecuta un agente así con acceso al correo, a archivos o al chat. El informe afirma que no se observó ningún incidente en el mundo real, así que se trata de una capacidad documentada en condiciones de prueba y no de un ataque reportado [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). ## Recomendaciones 1. Limita lo que puede hacer un agente que lee contenido no confiable. Un agente que lee correo no debería poder también enviar correo ni eliminar archivos sin un paso de confirmación. 2. Trata el texto de correos, documentos compartidos y canales de chat como no confiable, incluso cuando parezca un aviso del sistema o una regla de la casa [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). 3. Revisa los mensajes salientes y los cambios en archivos que produjo un agente, sobre todo cuando contengan texto que el usuario no escribió. 4. Mantén acotado el acceso del agente a cuentas y carpetas, y retíralo cuando ya no sea necesario. ## Relevancia para FireAI FireAI trabaja en la capa de red de la Mac y no lee prompts, correos ni el contenido de las conexiones cifradas, por lo que no puede reconocer una inyección de prompt ni impedir que un modelo la copie. Tampoco controla lo que hace un servicio de IA en sus propios servidores. Para una app de agente en la Mac, el [filtro de red](https://hisnlabs.com/en/docs/how-the-network-filter-works) identifica la app por su firma de código y una app sin regla provoca un aviso, las [reglas por app](https://hisnlabs.com/en/docs/per-app-rules) pueden restringir adónde puede conectarse, e [Investigar](https://hisnlabs.com/en/docs/investigate-a-connection) muestra adónde va una conexión. > Una inyección de prompt actúa a través de lo que se le permite hacer a un agente. FireAI limita una parte de eso en una Mac: qué apps pueden conectarse y a qué servidores. Pruébalo gratis durante 17 días. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## Limitaciones Ambos relatos descansan en la propia investigación de OpenAI, y el artículo de arXiv que enlaza The Register no se consultó para este texto. Las fuentes difieren en algunos detalles: OpenAI nombra puntos de control internos de GPT-5.4-mini y GPT-5.5, mientras que The Register menciona el entrenamiento de GPT-5.6, y The Register describe un conjunto de datos de Excel donde la página de OpenAI describe un caso de sistema de archivos [[1]](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) [[2]](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/). Ninguna de las fuentes indica con qué frecuencia tuvieron éxito los ataques, si los productos ya publicados están afectados ni si agentes basados en modelos ajenos a OpenAI se comportan igual. Prueba [FireAI, de HisnLabs](https://hisnlabs.com/en/download) gratis durante 17 días. ## Sources - [The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections](https://www.theregister.com/security/2026/09/29/add-one-more-ai-worry-to-the-nightmare-scenario-self-replicating-prompt-injections/5299922) - [OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist](https://alignment.openai.com/misalignment-reports/self-replicating-prompt-injections-exist/)