安全与人工智能新闻

大模型 API 安全 · 作者 FireAI Security & Research Team · 发布于

OpenAI 阻断推理内容提取行动,攻击者滥用了可互换的加密推理轨迹

OpenAI 称已于 2026 年 7 月 28 日阻断一场蒸馏行动;一篇研究论文显示,大模型 API 中的加密推理轨迹可在不同用户之间互换使用。

A key icon and the FireAI research mascot, illustrating OpenAI disrupting a campaign that extracted protected reasoning from its models.

The Hacker News 于 2026 年 10 月 1 日报道,OpenAI 阻断了一场针对其模型受保护推理内容的协同蒸馏行动,并称该活动的核心部分归因于与 Moonshot AI 有关联的个人 [1]。一篇于 2026 年 8 月 10 日提交至 arXiv 的研究论文描述了其背后的弱点:加密推理轨迹可在不同会话、用户和模型之间互换 [2]。此事涉及语言模型 API 的安全,而许多 Mac 用户正是通过各类 App 和代理访问这些 API。

背景

论文指出,主要的大模型服务商会以加密文本块的形式返回模型的逐步推理内容,客户端在随后的每次请求中把这些文本块原样回传 [2]。按 The Hacker News 的说明,蒸馏是指系统性地提取一个模型的输出,用于训练或改进另一个模型 [1]。

发现

据报道,该活动于 2026 年 7 月 1 日以较低的规模开始,7 月 24 日和 25 日达到峰值,来自 4,000 多名不同用户的账号以某种提取模式发出了 16,000 次请求,并于 2026 年 7 月 28 日被完全阻断 [1]。在超过 15,000 名不同用户中还检测到了相关的提示模式活动 [1]。

报道引述 OpenAI 的说法称,操作者既没有破解其加密,也没有入侵数据库或直接访问已存储的用户对话,而是操纵模型交互,使受保护的推理内容能够以请求者可见的形式被复现 [1]。OpenAI 封禁了相关的欺诈账号,关闭了允许用户重放加密推理内容以恢复其明文的途径,并增加了检查,用于识别并拦截可能暴露推理内容的流式输出 [1]。

The Hacker News 指出,OpenAI 以安全原因为由,没有为把此事归因于这家总部位于北京的公司 Moonshot AI 提供技术证据,文章中也没有 Moonshot AI 的回应 [1]。文章还提到,Anthropic 上个月曾指控 Moonshot AI 转发客户对 Claude 的请求,这一活动被追踪为 GTG-16002 [1]。

arXiv 论文报告称,这些加密块在不同会话、用户和模型之间完全兼容且可以互换,并演示了四种攻击:向较弱模型注入加密轨迹以进行模型蒸馏、数据提取、暴露隐藏的危险内容,以及对代理式系统的隐形提示注入 [2]。在数据提取的案例中,作者从公共代码仓库抓取的 315,320 个推理块中恢复出 367 件个人身份信息(PII)和 182 项凭据 [2]。论文称该研究包含负责任披露,并提出了密码学层面和系统层面的缓解措施 [2]。

对 Mac 用户的影响

该行动针对的是服务商的模型输出,而不是其用户的设备,消息来源也没有报告任何用户的对话在其中被暴露 [1]。这篇论文与使用 AI 代理的人相关,原因在于它的四种攻击之一是对代理式系统的隐形提示注入,并且它在已发布到公共仓库的推理块中发现了凭据和个人数据 [2]。

建议

  1. 不要把服务商的 API 密钥放进代码仓库和共享日志,已经公开过的密钥应立即吊销。
  2. 存储或分享 AI 会话日志时,删除推理块以及应用并不需要的其他服务商返回字段。
  3. 检查授予 AI 代理的权限,因为论文包含一种针对代理式系统的攻击。
  4. 关注服务商关于所用 API 中推理内容处理方式变更的公告。
  5. 对基于这些 API 开发产品的团队,在设计会话存储之前,请先阅读论文提出的缓解措施 [2]。

与 FireAI 的关系

FireAI 不运行也不保护模型 API。在 Mac 上,它通过代码签名识别 App,并对每个连接应用按 App 规则;代理配置文件会标出 Claude Code、Cursor 等代理类 App 首次访问的目标或上传量激增,所依据的仅是主机名和字节数。FireAI 自带的可选本机 AI 模型从 Hugging Face 下载一次,之后只在 Mac 本机运行。

FireAI 看不到加密连接的内部,因此无法读取推理块、提示或模型的回复。它不检测蒸馏,不控制服务商返回的内容,也不会阻止已获授权的账号向 API 发送请求。

局限

关于该行动的叙述基于 The Hacker News 对 OpenAI 声明的概述,本文无法直接获取该声明 [1]。把此事归因于 Moonshot AI 是 OpenAI 的判断,且没有公布技术证据。论文属于预印本;本文依据的是其摘要,并未独立验证其结果 [2]。除上文列出的 OpenAI 措施外,消息来源没有说明还有哪些服务商更改了其 API。

免费试用 HisnLabs 的 FireAI 17 天。

来源

  1. The Hacker News, 1 October 2026: OpenAI disrupts reasoning extraction campaign linked to Moonshot AI associates
  2. arXiv, 10 August 2026: Stealing Reasoning Traces from Proprietary LLM APIs (Panfilov et al.)