Noticias de seguridad e inteligencia artificial

Seguridad de agentes de IA · Por FireAI Security & Research Team · Publicado

OpenAI describe las inyecciones de prompt autorreplicantes, un ataque tipo gusano contra agentes de IA

OpenAI informa de inyecciones de prompt que hacen que un agente de IA copie el ataque en sus propias salidas, halladas solo en entornos de entrenamiento. Qué se sabe y qué implica para los usuarios de Mac.

Chat bubbles duplicating from one to the next, illustrating a self-replicating prompt injection spreading between AI agents.

OpenAI informó el 25 de septiembre de 2026 de que algunos de sus modelos pueden ser dirigidos mediante una inyección de prompt que además hace que el modelo copie la inyección en sus propias salidas, algo que OpenAI compara con un gusano. La empresa dice que halló este comportamiento en entornos simulados de herramientas y que no ha visto ningún incidente fuera de ellos [1] [2].

Contexto

Una inyección de prompt es texto colocado en un contenido que lee un agente de IA, como un correo o una hoja de cálculo, y que el agente trata después como una instrucción. Un gusano informático es un programa que se copia de un sistema a otro. OpenAI emplea el término inyección de prompt autorreplicante para una inyección cuyo objetivo incluye hacer que el modelo atacado reproduzca la inyección, de modo que el siguiente agente que lea la salida también la reciba [2].

Lo que describe el informe

La página de investigación de OpenAI da el 27 de junio de 2026 como fecha del hallazgo y el 25 de septiembre de 2026 como fecha de divulgación, y llama GPT-Red al agente de red teaming del equipo. Indica que los modelos afectados eran puntos de control internos de GPT-5.4-mini y GPT-5.5, que no se observó ningún impacto externo y que los efectos se limitaron a entornos simulados de herramientas [2]. The Register, que informó de la investigación el 29 de septiembre de 2026, escribe que OpenAI halló el comportamiento al usar GPT-Red para entrenar GPT-5.6 de forma adversarial [1].

Se dan tres ejemplos. En el caso del correo, una instrucción inyectada ordena al modelo incluir el texto malicioso en todos los mensajes salientes; OpenAI dice que se disfrazó de regla de archivo que pedía responder en español y citar íntegramente el correo [2]. En un caso basado en archivos, una falsa advertencia del sistema convence al modelo de borrar archivos y luego escribir el texto del ataque en archivos del espacio de trabajo para que persista [2]. The Register describe el segundo ejemplo como una falsa advertencia dentro de datos de Excel [1]. En el caso multisalto, el modelo es llevado a través de una serie de lecturas de canales de Slack, todas aparentemente legítimas, hacia acciones no autorizadas mientras las instrucciones se repiten entre plataformas [2].

Como respuesta, OpenAI afirma que incluye la autorreproducción como un aspecto de los objetivos del atacante en el entrenamiento de GPT-Red, y espera que los futuros modelos que publique sean más robustos frente a estos ataques [2] [1]. The Register cita a OpenAI diciendo que encontró casos en que sus modelos GPT eran susceptibles a «una versión para IA de un ataque de gusano» [1].

Implicaciones para los usuarios de Mac

El informe trata de agentes que leen contenido de varias fuentes y pueden actuar en consecuencia, y el ejemplo del correo muestra la vía más clara: un agente que puede leer y enviar correo recibe un mensaje que le ordena reenviar la instrucción [2]. Un usuario de Mac solo se ve afectado si ejecuta un agente así con acceso al correo, a archivos o al chat. El informe afirma que no se observó ningún incidente en el mundo real, de modo que se trata de una capacidad documentada en condiciones de prueba y no de un ataque notificado [1] [2].

Recomendaciones

  1. Limite lo que puede hacer un agente que lee contenido no fiable. Un agente que lee correo no debería poder además enviar correo ni borrar archivos sin un paso de confirmación.
  2. Trate el texto de correos, documentos compartidos y canales de chat como no fiable, aunque parezca un aviso del sistema o una norma de la casa [2].
  3. Revise los mensajes salientes y los cambios en archivos que haya producido un agente, sobre todo cuando contengan texto que el usuario no escribió.
  4. Mantenga estrecho el acceso del agente a cuentas y carpetas, y retírelo cuando ya no haga falta.

Relevancia para FireAI

FireAI trabaja en la capa de red del Mac y no lee prompts, correos ni el contenido de las conexiones cifradas, por lo que no puede reconocer una inyección de prompt ni impedir que un modelo la copie. Tampoco controla lo que hace un servicio de IA en sus propios servidores. Para una app de agente en el Mac, el filtro de red identifica la app por su firma de código y una app sin regla provoca una solicitud, las reglas por app pueden restringir adónde puede conectarse, e Investigar muestra adónde va una conexión.

Limitaciones

Ambos relatos se basan en la investigación del propio OpenAI, y el artículo de arXiv que enlaza The Register no se consultó para esta noticia. Las fuentes difieren en algunos detalles: OpenAI habla de puntos de control internos de GPT-5.4-mini y GPT-5.5, mientras que The Register menciona el entrenamiento de GPT-5.6, y The Register describe un conjunto de datos de Excel donde la página de OpenAI describe un caso de sistema de archivos [1] [2]. Ninguna de las fuentes indica con qué frecuencia tuvieron éxito los ataques, si los productos ya publicados están afectados ni si agentes basados en modelos ajenos a OpenAI se comportan igual.

Pruebe FireAI, de HisnLabs gratis durante 17 días.

Fuentes

  1. The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections
  2. OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist