OpenAI informó el 25 de septiembre de 2026 que algunos de sus modelos pueden ser manipulados con una inyección de prompt que además hace que el modelo copie la inyección en sus propias salidas, algo que OpenAI compara con un gusano. La empresa dice que encontró este comportamiento en entornos simulados de herramientas y que no ha visto ningún incidente fuera de ellos [1] [2].
Contexto
Una inyección de prompt es texto colocado en contenido que lee un agente de IA, como un correo o una hoja de cálculo, y que el agente trata después como una instrucción. Un gusano informático es un programa que se copia de un sistema a otro. OpenAI usa el término inyección de prompt autorreplicante para una inyección cuyo objetivo incluye lograr que el modelo atacado reproduzca la inyección, de modo que el siguiente agente que lea la salida también la reciba [2].
Lo que describe el informe
La página de investigación de OpenAI da el 27 de junio de 2026 como fecha del descubrimiento y el 25 de septiembre de 2026 como fecha de la divulgación, y llama GPT-Red al agente de red teaming del equipo. Indica que los modelos afectados eran puntos de control internos de GPT-5.4-mini y GPT-5.5, que no se observó impacto externo y que los efectos se limitaron a entornos simulados de herramientas [2]. The Register, que informó sobre la investigación el 29 de septiembre de 2026, escribe que OpenAI encontró el comportamiento al usar GPT-Red para entrenar de forma adversarial a GPT-5.6 [1].
Se dan tres ejemplos. En el caso del correo, una instrucción inyectada ordena al modelo incluir el texto malicioso en todos los mensajes salientes; OpenAI dice que estaba disfrazada de una regla de archivado que pedía responder en español y citar íntegramente el correo [2]. En un caso basado en archivos, una falsa advertencia del sistema convence al modelo de eliminar archivos y luego escribir el texto del ataque en archivos del espacio de trabajo para que persista [2]. The Register describe el segundo ejemplo como una falsa advertencia dentro de datos de Excel [1]. En el caso de múltiples saltos, el modelo es llevado a través de una serie de lecturas de canales en Slack, cada una aparentemente legítima, hacia acciones no autorizadas mientras las instrucciones se repiten entre plataformas [2].
Como respuesta, OpenAI afirma que está incluyendo la autorreproducción como un aspecto de los objetivos del atacante en el entrenamiento de GPT-Red, y espera que los modelos que se publiquen en el futuro sean más robustos frente a estos ataques [2] [1]. The Register cita a OpenAI diciendo que encontró casos en que sus modelos GPT eran susceptibles a "una versión para IA de un ataque de gusano" [1].
Implicaciones para usuarios de Mac
El informe trata de agentes que leen contenido de varias fuentes y pueden actuar en consecuencia; el ejemplo del correo muestra el camino más claro: un agente que puede leer y enviar correo recibe un mensaje que le ordena reenviar la instrucción [2]. Un usuario de Mac solo se ve afectado si ejecuta un agente así con acceso al correo, a archivos o al chat. El informe afirma que no se observó ningún incidente en el mundo real, así que se trata de una capacidad documentada en condiciones de prueba y no de un ataque reportado [1] [2].
Recomendaciones
- Limita lo que puede hacer un agente que lee contenido no confiable. Un agente que lee correo no debería poder también enviar correo ni eliminar archivos sin un paso de confirmación.
- Trata el texto de correos, documentos compartidos y canales de chat como no confiable, incluso cuando parezca un aviso del sistema o una regla de la casa [2].
- Revisa los mensajes salientes y los cambios en archivos que produjo un agente, sobre todo cuando contengan texto que el usuario no escribió.
- Mantén acotado el acceso del agente a cuentas y carpetas, y retíralo cuando ya no sea necesario.
Relevancia para FireAI
FireAI trabaja en la capa de red de la Mac y no lee prompts, correos ni el contenido de las conexiones cifradas, por lo que no puede reconocer una inyección de prompt ni impedir que un modelo la copie. Tampoco controla lo que hace un servicio de IA en sus propios servidores. Para una app de agente en la Mac, el filtro de red identifica la app por su firma de código y una app sin regla provoca un aviso, las reglas por app pueden restringir adónde puede conectarse, e Investigar muestra adónde va una conexión.
Limitaciones
Ambos relatos descansan en la propia investigación de OpenAI, y el artículo de arXiv que enlaza The Register no se consultó para este texto. Las fuentes difieren en algunos detalles: OpenAI nombra puntos de control internos de GPT-5.4-mini y GPT-5.5, mientras que The Register menciona el entrenamiento de GPT-5.6, y The Register describe un conjunto de datos de Excel donde la página de OpenAI describe un caso de sistema de archivos [1] [2]. Ninguna de las fuentes indica con qué frecuencia tuvieron éxito los ataques, si los productos ya publicados están afectados ni si agentes basados en modelos ajenos a OpenAI se comportan igual.
Prueba FireAI, de HisnLabs gratis durante 17 días.