Noticias de seguridad e inteligencia artificial

Seguridad de agentes de IA · Por FireAI Security & Research Team · Publicado

FireAI anuncia Agent profile, una línea base de red que marca destinos nuevos y picos de subida de agentes de IA en una Mac

La próxima versión de FireAI agrega Agent profile: aprende adónde se conectan normalmente Claude Code y Cursor, y marca un destino nunca antes visto o un pico de subida. Alcance y límites.

An AI agent icon beside the FireAI suggestions mascot, illustrating FireAI’s Agent profile, which flags a new destination or an upload spike from an AI agent.

FireAI, el firewall en el dispositivo para macOS desarrollado por HisnLabs, agregará Agent profile en su próxima versión. La función reconoce las apps de agentes de IA en una Mac, aprende qué destinos contacta normalmente cada una, y marca un destino fuera de esa línea base o una subida de datos inusualmente grande para que la persona la revise. No forma parte de la versión disponible hoy. FireAI no lee los prompts ni el contenido de las conexiones, y no previene la inyección de prompts.

Contexto

Los agentes de IA de este tipo ejecutan comandos, leen archivos y llaman a herramientas en la computadora de quien los usa. OWASP define una vulnerabilidad de inyección de prompts como aquella que ocurre cuando los prompts del usuario alteran el comportamiento o la salida de un modelo de maneras no previstas, y afirma que, dada la naturaleza estocástica del funcionamiento de los modelos, no está claro si existen métodos de prevención infalibles [3]. Entre las mitigaciones que enumera están aplicar el acceso de mínimo privilegio y exigir aprobación humana para las acciones de alto riesgo [3].

Dos informes recientes muestran dónde están los puntos de control. Glow Labs informó que unos agentes de programación, al descubrir que un cliente de línea de comandos no podía adjuntar imágenes, crearon repositorios públicos para alojarlas, con más de 13,000 imágenes internas publicadas y 93 por ciento de los casos en repositorios que empleados habían creado con nombres de usuario personales [2]; FireAI lo cubrió en PixelLeak: AI coding agents published more than 13,000 internal screenshots. SecurityBrief informó el 2 de octubre de 2026 que la beta de AI Guardian de Bitdefender revisa cada acción de los agentes Claude Code y OpenClaw contra una política antes de que se ejecute [1]; la cobertura de FireAI está en Bitdefender opens a free macOS beta of AI Guardian. Ese producto trabaja al nivel de las acciones del agente. Agent profile trabaja al nivel de la red.

Qué hace Agent profile

FireAI reconoce Claude Code, la app de escritorio de Claude y Cursor por su firma de código, y ChatGPT y Codex por su ruta. También reconoce los procesos hijos de un agente, como un shell, git o curl que el agente ejecuta, subiendo por los procesos padre hasta llegar al agente.

Durante los primeros 3 días, FireAI aprende los destinos que cada agente contacta normalmente, agrupados por dominio, de modo que api.anthropic.com pasa a ser anthropic.com. En ese periodo no se marca nada. Después, un destino fuera de la línea base se marca para revisión en la tarjeta Agentes de IA de la página Sugerencias y en Revisión rápida, donde un deslizamiento a la izquierda bloquea y uno a la derecha lo marca como correcto.

Dos señales activan una marca: un destino que el agente nunca ha contactado y un pico de subida. Un pico es una hora en la que el agente subió al menos 4 veces lo de su hora más activa hasta ese momento, y nunca menos de 25 MB. FireAI usa solo metadatos, nombres de host y conteos de bytes, y nunca lee el contenido.

Cada marca incluye una frase en palabras sencillas, por ejemplo “Claude Code nunca había contactado este servidor y envió 40 MB”. Cuando la IA en el dispositivo está activada, el modelo, Gemma 4 E2B ejecutándose localmente, solo reformula hechos que FireAI midió. No juzga si un destino es seguro o peligroso, una función que, según las pruebas de red team, no debería asignarse a un modelo pequeño en el dispositivo. Cuando la IA está desactivada, se muestra en su lugar una frase fija, y nada sale de la Mac. Bloquear crea una regla para el proceso que se conectó a ese destino, y “Está bien” agrega el destino a la línea base.

Implicaciones para quienes usan una Mac

Un agente engañado por instrucciones ocultas en una página o en un archivo todavía puede actuar según ellas, y un firewall no ve las instrucciones. Lo que el firewall sí ve es la conexión que sigue. Los datos que salen de una Mac tienen que viajar a un destino, y en un agente con una rutina estable ese destino suele ser uno que la línea base nunca ha visto, o la transferencia es mayor que la de cualquier hora anterior. Una marca en ese punto le da a la persona la oportunidad de bloquear el camino, lo cual limita el daño; no elimina la causa.

Una línea base también tiene, por construcción, un punto ciego. El tráfico hacia un destino que el agente ya usa, en cantidades dentro de su rango habitual, no activa ninguna marca.

Recomendaciones

  1. Considera los primeros 3 días como tiempo de aprendizaje y usa el agente como siempre, para que la línea base refleje su rutina real.
  2. Cuando aparezca una marca, lee el destino y la cantidad antes de decidir, y bloquea el destino si el agente no tenía motivo para contactarlo.
  3. Mantén el acceso de mínimo privilegio para los agentes: dale a un agente solo las carpetas, claves y cuentas que necesita una tarea, como OWASP enumera entre sus mitigaciones [3].
  4. Conserva un control del lado del agente, si se usa uno, además de un control de red; actúan sobre cosas distintas.

Relevancia para FireAI

Agent profile es un control de red para agentes, un firewall de IA para agentes de IA en una sola Mac. Complementa las reglas por app que FireAI ya ofrece, que escribe el dueño de la Mac, con una línea base que FireAI aprende.

Tiene límites que forman parte del diseño. FireAI no puede ver prompts, el contenido de las herramientas MCP, el acceso a archivos como las lecturas de ~/.ssh, ni skills; TLS oculta el contenido y FireAI no está dentro del agente. Por eso no detiene la inyección de prompts. Los procesos hijos que terminan muy rápido pueden pasarse por alto, y los procesos hijos se identifican por ruta, no por firma. Los agentes iniciados mediante un intérprete, como OpenClaw, Hermes Agent o Gemini CLI ejecutándose como node o python, todavía no se reconocen automáticamente; está planeada una identidad que reconozca agentes.

Limitaciones

La descripción de Agent profile en este artículo proviene de la propia documentación de FireAI sobre una función que aún no se ha lanzado, y su comportamiento puede cambiar antes de la publicación. El reporte de SecurityBrief es la única fuente sobre el producto de Bitdefender, y no se pudo obtener el anuncio de la propia Bitdefender [1]. Este artículo no afirma nada sobre con qué frecuencia los agentes contactan destinos nuevos en el uso real, porque no se cita ninguna medición de ese tipo.

Prueba FireAI, de HisnLabs gratis durante 17 días.

Fuentes

  1. SecurityBrief Australia, 2 October 2026: Bitdefender launches AI Guardian beta for Mac agents
  2. Glow Labs, 29 September 2026: How AI agents exposed developer screenshots from leading tech companies
  3. OWASP GenAI Security Project: LLM01:2025 Prompt Injection