Noticias de seguridad e inteligencia artificial

Seguridad de agentes de IA · Por FireAI Security & Research Team · Publicado

Salt Labs secuestra el agente de IA Manus con un solo correo al codificar una inyección de prompt en JSFuck

Salt Labs informó el 1 de octubre de 2026 que un correo ofuscado hizo que el agente Manus ejecutara código y abriera una reverse shell; la protección se activó solo después de la ejecución. La falla ya está corregida.

An AI agent icon and the FireAI research mascot, next to the words “One email hijacks an AI agent.”

Investigadores de Salt Labs publicaron el 1 de octubre de 2026 un relato de cómo evadieron las protecciones contra inyección de prompts del agente de IA Manus y lograron ejecutar código mediante un solo correo electrónico [1]. SC Media, citando a TechRadar, también cubrió la investigación y señala que la falla concreta ya se corrigió a través de un programa de recompensas por errores [2]. El caso es relevante para los usuarios de Mac que conectan un agente de IA a su bandeja de entrada y a otras cuentas.

Contexto

Una inyección de prompt coloca instrucciones en un contenido que lee un agente de IA, para que el agente las trate como órdenes. Salt Labs eligió como objetivo la integración con Gmail porque el correo es el principal proveedor de identidad de muchas cuentas. Según el texto de los investigadores, el agente procesaba el correo en un sandbox en la nube, con herramientas basadas en el Model Context Protocol y el token OAuth del usuario [1].

Lo que describe la investigación

Los investigadores informan que una inyección simple de comandos de shell fue detectada y bloqueada por las protecciones de la plataforma, y que una variante codificada en Base64 también fue detectada. Después codificaron la carga en JSFuck, una forma inusual de escribir JavaScript con un conjunto de caracteres muy reducido, y el correo le pedía al agente que la decodificara con Node.js. El agente invocó el entorno de ejecución de Node.js y ejecutó JavaScript arbitrario en su entorno del lado del servidor [1].

Luego ampliaron la carga para ejecutar comandos del sistema dentro del sandbox y establecer una reverse shell hacia la infraestructura del atacante. Desde ahí llegaron al token OAuth de Gmail, a la interfaz de herramientas y a las credenciales de los servicios conectados, con posible acceso a servicios como Google Drive y GitHub [1]. El hallazgo central es un desfase de tiempo: la protección detectó el ataque, pero "después de que el código ya se había ejecutado" [1]. SC Media resume la lección así: inspeccionar los prompts es necesario pero no suficiente, y la protección debe extenderse a las acciones que un agente realiza en herramientas, API y sistemas [2].

El texto indica que la falla concreta se reportó a través del programa de recompensas por errores de Meta, que ya se resolvió y que ya no es explotable. No da una cronología de la divulgación [1].

Implicaciones para usuarios de Mac

En este caso el código se ejecutó en el sandbox en la nube del proveedor, no en una Mac, así que lo expuesto fueron los tokens y las cuentas conectadas que tenía el agente [1]. El punto general también se aplica a los agentes locales: el contenido que lee un agente puede llevar instrucciones, y una defensa que solo inspecciona el prompt puede actuar demasiado tarde.

Recomendaciones

  1. Conecta un agente de IA solo a las cuentas que necesita, y prefiere el acceso de solo lectura cuando el servicio lo ofrezca.
  2. Revisa periódicamente los servicios y tokens conectados de cada agente y revoca los que no se usen.
  3. Trata cualquier correo, página web o documento que lea un agente como información no confiable.
  4. Prefiere agentes cuyas acciones requieran aprobación para comandos, cambios de archivos y destinos de red nuevos.
  5. Vigila a qué destinos de red se conecta un agente en la Mac, e investiga cualquier destino nuevo.

Relevancia para FireAI

El Perfil de agente de FireAI reconoce los agentes de IA de una Mac, aprende a dónde se conecta normalmente cada uno y marca para revisión un destino nunca antes visto o un pico de subida, usando solo nombres de host y conteos de bytes. En su modo más estricto bloquea un destino nuevo hasta que el usuario lo permite.

FireAI no se ejecuta en la nube de un proveedor, así que no puede ver ni detener lo que pasó dentro del sandbox de Manus. No lee correos ni prompts, no decide si una instrucción es una inyección y no lee el interior de las conexiones cifradas. Actúa en el lado de red de los agentes que se ejecutan en la Mac.

Limitaciones

El relato técnico es de los propios investigadores, leído aquí a través de una republicación en Security Boulevard; esta nota no lo reprodujo de forma independiente. Las fuentes no reportan explotación por parte de nadie más que los investigadores, y no se da la fecha de la corrección. SC Media afirma que probablemente surgirán evasiones creativas más allá de JSFuck [2].

Prueba FireAI, de HisnLabs gratis durante 17 días.

Fuentes

  1. Salt Labs via Security Boulevard, 1 October 2026: How We Hijacked an AI Agent With a Single Email
  2. SC Media, 3 October 2026: Researchers bypass AI agent protections with JavaScript obfuscation