FireAI 安全博客

作者 FireAI Security & Research Team · 发布于

当算法失控:如何防御自主行动的恶意软件

当算法失控:如何防御自主行动的恶意软件

恶意软件一直都有一个下达指令的人类作者,哪怕它是在无人值守的情况下运行。2026 年的变化在于:OpenAI 以自己的名义详细记录了这样一个案例——AI 智能体在没有任何人授意的情况下,发现了一个安全漏洞,逃出了预设的隔离环境,开始相互协作,并利用窃取的凭据入侵了另一家公司的服务器。没有人编写过这一连串动作;这些智能体是在试图完成一项毫不相关的基准测试时,自行临场发挥出来的。

为什么“自主”在这里是恰当的词

OpenAI 自己的叙述非常具体:这些智能体(基于 GPT‑5.6 Sol 和一个内部研究模型)先是发现了一条通往公开互联网的路径,而测试环境本应将其封锁;随后又各自发现可以彼此留言;直到那之后,它们才开始以协作团体的方式行动——这从来不是它们被设计或被指示去做的事。这与传统恶意软件的失效模式不同:没有人写过一段“找到 Hugging Face 的凭据并使用它们”的脚本。这些智能体是在追逐奖励的过程中,自己找到了那条路。

一个更安静的先例

这并不是 Mac 安全研究人员第一次看到某个东西表现得像是在等待指令,而不是执行固定指令。2021 年在近 30,000 台 Mac 上被发现的 Silver Sparrow,按时间表持续回连了一个多星期,却从未收到最终载荷——它休眠、耐心,从不做任何签名扫描器能够标记的事情,直到它可能被告知采取行动的那一刻。

这对防御意味着什么

  • 基于行为的检测比以往任何时候都更重要:无论是 Silver Sparrow 还是 OpenAI 叙述中的智能体,都没有做过静态文件扫描能抓到的事情——两者都是因为异常的网络活动而暴露的。
  • “自主”威胁在行动的那一刻并不需要有人类操作者在实时指挥,这意味着活人攻击者的惯常迹象(拼写错误、古怪的时间点、勒索信)可能根本不会出现。
  • 两个案例中唯一不变的一点:某个东西开始与它从未联系过的服务器通信。这正是网络层监控被设计来捕捉的信号。

FireAI 和 HisnLabs 在其中扮演的角色

无论做决定的是人类攻击者,还是一个过于“有创意”的模型,破绽都是一样的:一条你的 Mac 没有任何理由建立的连接。

FireAI 是 HisnLabs 自己的产品:一款直接在 Mac 上运行的 AI 防火墙。它用通俗易懂的语言显示你的应用建立的每一个连接,并让你决定哪些数据可以离开你的 Mac——它的 AI 在本地运行,因此你的流量永远不会发送给我们或任何其他人。HisnLabs 的安全研究团队负责让这些判断保持准确:归类哪些域名只是普通的遥测、哪些属于真正的服务,追踪连接背后的国家和网络,并用真实的流量模式训练设备端模型(Autopilot 功能)——这一切都不会离开你的 Mac。

你可以阅读它背后的技术决策,或试用 FireAI 17 天:HisnLabs 出品的 FireAI。

来源