Noticias de seguridad e inteligencia artificial

Seguridad de los agentes de IA · Por FireAI Security & Research Team · Publicado

Salt Labs secuestra el agente de IA Manus con un solo correo codificando una inyección de prompt en JSFuck

Salt Labs informó el 1 de octubre de 2026 de que un correo ofuscado hizo que el agente Manus ejecutara código y abriera una shell inversa; la protección actuó tras la ejecución. Ya está corregido.

An AI agent icon and the FireAI research mascot, next to the words “One email hijacks an AI agent.”

Los investigadores de Salt Labs publicaron el 1 de octubre de 2026 un relato de cómo eludieron las protecciones contra la inyección de prompts del agente de IA Manus y lograron ejecutar código mediante un solo correo electrónico [1]. SC Media, citando a TechRadar, también se hizo eco de la investigación y señala que el fallo concreto se ha corregido desde entonces a través de un programa de recompensas por errores [2]. El caso es relevante para los usuarios de Mac que conectan un agente de IA a su buzón y a otras cuentas.

Contexto

Una inyección de prompt coloca instrucciones en un contenido que lee un agente de IA, de modo que el agente las trata como órdenes. Salt Labs eligió como objetivo la integración con Gmail porque el correo es el principal proveedor de identidad de muchas cuentas. Según el informe, el agente procesaba el correo en un entorno aislado (sandbox) en la nube, con herramientas basadas en el Model Context Protocol y el token OAuth del usuario [1].

Lo que describe la investigación

Los investigadores explican que una inyección directa de un comando de shell fue detectada y bloqueada por las protecciones de la plataforma, y que una variante codificada en Base64 también fue detectada. Después codificaron la carga en JSFuck, una forma inusual de escribir JavaScript con un conjunto de caracteres muy reducido, y el correo pedía al agente que la descodificara con Node.js. El agente invocó el entorno de ejecución Node.js y ejecutó JavaScript arbitrario en su entorno del lado del servidor [1].

A continuación ampliaron la carga para ejecutar comandos del sistema dentro del entorno aislado y establecer una shell inversa hacia la infraestructura del atacante. Desde ahí llegaron al token OAuth de Gmail, a la interfaz de herramientas y a las credenciales de los servicios conectados, con acceso potencial a servicios como Google Drive y GitHub [1]. El hallazgo central es un desfase temporal: la protección detectó el ataque, pero «después de que el código ya se hubiera ejecutado» [1]. SC Media resume la lección así: inspeccionar el prompt es necesario pero no suficiente, y la protección debe extenderse a las acciones que realiza un agente a través de herramientas, API y sistemas [2].

El informe indica que el fallo concreto se comunicó a través del programa de recompensas por errores de Meta, que se ha resuelto y que ya no es explotable. No ofrece un calendario de la divulgación [1].

Implicaciones para los usuarios de Mac

En este caso, el código se ejecutó en el entorno aislado en la nube del proveedor, no en un Mac, por lo que lo expuesto fueron los tokens y las cuentas conectadas que tenía el agente [1]. La idea general se aplica también a los agentes locales: el contenido que lee un agente puede llevar instrucciones, y una defensa que solo inspecciona el prompt puede actuar demasiado tarde.

Recomendaciones

  1. Conecte un agente de IA solo a las cuentas que necesita, y prefiera el acceso de solo lectura cuando el servicio lo ofrezca.
  2. Revise periódicamente los servicios conectados y los tokens de cada agente, y revoque los que no se usen.
  3. Trate cualquier correo, página web o documento que lea un agente como una entrada no fiable.
  4. Prefiera agentes cuyas acciones requieran aprobación para ejecutar comandos, modificar archivos o contactar con destinos de red nuevos.
  5. Vigile con qué destinos de red contacta un agente en el Mac, e investigue cualquier destino nuevo.

Relevancia para FireAI

El Perfil de agente de FireAI reconoce los agentes de IA de un Mac, aprende adónde se conecta normalmente cada uno y señala para su revisión un destino contactado por primera vez o un pico de subida, usando solo nombres de servidor y recuentos de bytes. En su modo más estricto, bloquea un destino nuevo hasta que el usuario lo permite.

FireAI no se ejecuta en la nube de un proveedor, por lo que no puede ver ni detener lo que ocurrió dentro del entorno aislado de Manus. No lee correos ni prompts, no decide si una instrucción es una inyección y no lee el interior de las conexiones cifradas. Actúa en la parte de red de los agentes que se ejecutan en el Mac.

Limitaciones

El relato técnico es el de los propios investigadores, leído aquí a través de una republicación en Security Boulevard; esta noticia no lo ha reproducido de forma independiente. Las fuentes no informan de ninguna explotación por parte de terceros distintos de los investigadores, y no se da la fecha de la corrección. SC Media afirma que es probable que surjan otras formas creativas de elusión además de JSFuck [2].

Pruebe FireAI, de HisnLabs gratis durante 17 días.

Fuentes

  1. Salt Labs via Security Boulevard, 1 October 2026: How We Hijacked an AI Agent With a Single Email
  2. SC Media, 3 October 2026: Researchers bypass AI agent protections with JavaScript obfuscation