安全与人工智能新闻

AI 代理安全 · 作者 FireAI Security & Research Team · 发布于

FireAI 宣布推出 Agent profile:一条网络基线,用于标记 Mac 上 AI 代理的新目标地址和上传激增

FireAI 的下一个版本新增 Agent profile:它会学习 Claude Code 和 Cursor 通常连接的位置,并标记首次出现的目标地址或上传激增。适用范围与局限。

An AI agent icon beside the FireAI suggestions mascot, illustrating FireAI’s Agent profile, which flags a new destination or an upload spike from an AI agent.

HisnLabs 开发的 macOS 本机防火墙 FireAI 将在下一个版本中加入 Agent profile。该功能会识别 Mac 上的 AI 代理应用,学习每个代理通常联系哪些目标地址,并在出现基线之外的目标地址或异常大的上传时予以标记,供用户复查。它不属于目前可用的版本。FireAI 不会读取提示词或连接的内容,也不能防止提示词注入。

背景

这类 AI 代理会在使用者的电脑上运行命令、读取文件并调用工具。OWASP 将提示词注入漏洞定义为:用户提示词以非预期的方式改变模型的行为或输出,并指出,鉴于模型工作方式的随机性,目前尚不清楚是否存在万无一失的预防方法 [3]。其列出的缓解措施包括实施最小权限访问,以及要求对高风险操作进行人工批准 [3]。

最近的两份报道显示了控制点所在。Glow Labs 报告称,编码代理发现命令行客户端无法附加图片后,创建了公开仓库来存放这些图片,结果发布了超过 13,000 张内部图片,其中百分之九十三位于员工以个人用户名创建的仓库之下 [2];FireAI 对此的报道见 PixelLeak:AI 编码代理公开发布了超过 13,000 张内部截图。SecurityBrief 于 2026 年 10 月 2 日报道称,Bitdefender 的 AI Guardian 测试版会在 Claude Code 和 OpenClaw 代理的每个操作执行之前,对照策略进行检查 [1];FireAI 的报道见 Bitdefender 推出免费的 macOS 版 AI Guardian 测试版。该产品作用于代理的操作层面,而 Agent profile 作用于网络层面。

Agent profile 的作用

FireAI 通过代码签名识别 Claude Code、Claude 桌面应用和 Cursor,通过路径识别 ChatGPT 和 Codex。它还会沿进程的父进程链向上查找,直到找到代理为止,以此识别代理的子进程,例如代理运行的 shell、git 或 curl。

在最初的 3 天里,FireAI 会学习每个代理通常联系的目标地址,并按域名分组,因此 api.anthropic.com 会归为 anthropic.com。这段时间内不会标记任何内容。之后,基线之外的目标地址会在“建议”页面的“AI 代理”卡片以及快速审阅中被标记以供复查,向左滑动即为阻止,向右滑动则标记为没问题。

有两种信号会触发标记:代理从未联系过的目标地址,以及上传激增。激增指的是代理在某一小时内的上传量至少达到此前最繁忙一小时的 4 倍,并且不低于 25 MB。FireAI 只使用元数据,即主机名和字节数,从不读取载荷。

每个标记都附有一句通俗的话,例如“Claude Code 以前从未联系过这台服务器,并发送了 40 MB。”开启设备端 AI 后,在本机运行的模型 Gemma 4 E2B 只会把 FireAI 测得的事实改写成这句话。它不会判断某个目标地址是安全还是危险,红队测试表明,不应把这样的任务交给小型设备端模型。关闭 AI 时,则显示一句固定的话,没有任何内容离开 Mac。“阻止”会为连接到该目标地址的进程创建一条规则,“没问题”则会把该目标地址加入基线。

对 Mac 用户的影响

一个被隐藏在网页或文件中的指令误导的代理,仍然可能照做,而防火墙看不到这些指令。防火墙能看到的是随之而来的连接。从 Mac 上带走的数据必须发往某个目标地址,而对于作息稳定的代理来说,这个目标地址往往是基线从未见过的,或者传输量超过此前任何一个小时。此时出现的标记让使用者有机会阻断这条路径,从而限制损害,但它并不能消除根源。

基线从构造上就有一个盲区:发往代理已在使用的目标地址、且数量在其通常范围之内的流量,不会触发任何标记。

建议

  1. 把最初的 3 天视为学习期,像平时一样使用代理,使基线反映它真实的日常行为。
  2. 出现标记时,先看清目标地址和数据量再做选择;如果代理没有理由联系该目标地址,就将其阻止。
  3. 对代理保持最小权限访问:只给代理完成任务所需的文件夹、密钥和账户,这也是 OWASP 所列的缓解措施之一 [3]。
  4. 如果使用了代理侧的控制措施,请在网络控制之外继续保留;二者作用的对象不同。

与 FireAI 的关系

Agent profile 是面向代理的网络控制,是一台 Mac 上针对 AI 代理的 AI 防火墙。它是对 FireAI 已提供的按应用规则的补充:那些规则由 Mac 的主人编写,而它则提供一条由 FireAI 自行学习的基线。

它的局限是设计的一部分。FireAI 看不到提示词、MCP 工具的内容、对 ~/.ssh 这类位置的文件访问,也看不到技能;TLS 会隐藏载荷,而 FireAI 并不在代理内部。因此它不能阻止提示词注入。很快退出的子进程可能被漏掉,子进程是按路径而不是按签名匹配的。通过解释器启动的代理,例如 OpenClaw、Hermes Agent,或以 node 或 python 运行的 Gemini CLI,目前还不能被自动识别;计划加入对代理的感知式身份识别。

局限

本条内容对 Agent profile 的描述来自 FireAI 对一项尚未发布功能的自有文档,其行为在发布之前可能会改变。关于 Bitdefender 产品,SecurityBrief 的报道是唯一来源,Bitdefender 自己的公告未能获取 [1]。本条内容不对代理在实际使用中联系新目标地址的频率作任何断言,因为没有引用任何此类测量。

免费试用 HisnLabs 的 FireAI 17 天。

来源

  1. SecurityBrief Australia, 2 October 2026: Bitdefender launches AI Guardian beta for Mac agents
  2. Glow Labs, 29 September 2026: How AI agents exposed developer screenshots from leading tech companies
  3. OWASP GenAI Security Project: LLM01:2025 Prompt Injection