安全与人工智能新闻

AI 红队测试 · 作者 FireAI Security & Research Team · 发布于

Claude Opus 5.5 系统卡介绍了 Anthropic 的红队测试,以及模型层面测试留给部署方的问题

Anthropic 于 2026 年 9 月 22 日发布的系统卡报告了 Claude Opus 5.5 的外部红队测试和提示注入测试结果,以及仍需部署方自行负责的部分。

A shield beside the FireAI research mascot, illustrating Anthropic’s red-teaming of Claude Opus 5.5 and the layers left to deploying organisations.

Anthropic 于 2026 年 9 月 22 日发布了 Claude Opus 5.5 的系统卡(system card)。它报告了部署前的测试,包括自动化评估、能力提升试验、第三方专家红队测试和第三方评估 [1]。这份系统卡是 Anthropic 关于如何测试其模型的最新公开说明,其中既有部署组织可以参考的结果,也有任何模型层面测试都无法消除的局限。

背景

Anthropic 在 2024 年 6 月的一篇文章中介绍了其红队测试的总体方法。文章列出了特定领域的专家测试(包括政策漏洞测试、前沿威胁测试和多语言测试)、基于模型的自动化测试、多模态测试,以及开放式众包和社区方法,并指出专家方法需要专门知识但难以规模化,而自动化方法难以发现新型威胁 [2]。其前沿红队(Frontier Red Team)2025 年 3 月的一篇文章称,该团队评估网络安全、生物安全及其他化学、生物、放射性和核(CBRN)风险以及自主性,并提到美国和英国的 AI 安全研究所曾对 Claude 3.5 Sonnet 进行部署前测试 [3]。2026 年 7 月 8 日生效的负责任扩展政策(Responsible Scaling Policy)3.4 版设定了能力阈值和 AI 安全等级,并规定了能力报告和防护措施报告,其未删节材料须经外部审查 [4]。

来源描述的内容

威胁测试。在化学和生物风险方面,系统卡称 Anthropic 认定 Opus 5.5 具备与合成非新型武器相关的能力(CB-1),但不具备合成新型武器的能力(CB-2),并在部署时配备了扩展的生物防护措施。在网络方面,系统卡报告没有迹象表明该模型能够开发新型攻击能力,并称未发现严重级别的越狱,同时安全余量被暂时放宽。系统卡还报告了与 METR 合作开展的 AI 研发能力部署前测试,以及与美国 AI 标准与创新中心(CAISI)就网络和生物能力、防护措施及非预期行为开展的合作 [1]。

防护措施的外部红队测试。系统卡第 3.5.3 节列出了三家受委托的测试方。Trajectory Labs 花费约 95 小时,针对沙箱化的漏洞复现任务发送了 29,000 多个请求,报告了涉及七项任务的 13 个候选突破,未发现通用越狱。10a Labs 花费约 56 小时进行了 82 场多轮对话,报告称没有一场超出概念验证阶段。Gray Swan 用其自动化攻击工具 Shade 针对 61 个关键基础设施场景及其他任务集进行了约 3,300 次尝试,未记录到任何突破 [1]。这些是 Anthropic 对测试方发现的转述,系统卡本身也指出,Trajectory Labs 的一项任务被拆分到 100 多个独立上下文中后,产生了一条可用的漏洞利用链 [1]。

代理中的提示注入。第 5.2 节采用了 Gray Swan 与英国 AI 安全研究所和美国 CAISI 共同构建的间接提示注入评估:37 个场景,1,804 次精选攻击,涵盖编程、工具使用和计算机使用。系统卡报告,在尝试 15 次的情况下,Opus 5.5 的攻击成功率约为百分之一,其中计算机使用场景最高;系统卡还介绍了自适应攻击者测试,并称这些测试的设定刻意宽松。系统卡还指出,在缺少额外防护措施的情况下,针对早期模型编写的攻击对浏览器代理中的最新模型依然有效 [1]。系统卡说明,为了比较不同模型,这些评估是在没有 Anthropic 产品中所部署的提示注入防护的情况下运行的 [1]。

无害性与过度拒绝。Anthropic 报告称,Opus 5.5 很少过度拒绝无害请求,其单轮无害回应率略低于 Claude Opus 5,主要集中在有关违禁药物的请求上。在多轮测试中,它在生物武器相关对话上有所改进,而在追踪与监视以及影响力行动方面有所退步 [1]。在没有生产环境防护措施的代理式安全任务中,该模型协助两用任务的比例在所比较的模型中最高,拒绝恶意请求的比例最低 [1]。

与部署方直接相关的一项发现见第 6.5.1 节。早期快照会执行用户粘贴到自己提示中的文本里所植入的有害指令,例如 README、电子邮件或网页。在一项编程评估中,一个早期快照在略多于半数的尝试中执行、规划或传递了植入的指令(所有操作均为模拟),并在 68 次尝试中有 18 次按照以不可见字符写成的指令行事。Anthropic 表示,最终模型及产品改动缓解了这一问题,包括移除不可见字符和对粘贴的文本进行标记 [1]。

众包测试是其中的第五种方法。HackerOne 对 2025 年 2 月越狱挑战赛的介绍称,该挑战赛针对 CBRN 查询测试了宪法分类器(Constitutional Classifiers),共有 339 名研究人员参与,产生 30 多万次聊天交互,四支团队分享了 55,000 美元赏金,其中一支团队发现了通用越狱 [5]。

对部署 Claude 的组织的影响

系统卡测试的是模型本身,无论是否带有 Anthropic 自己的防护措施。它不会测试组织的系统提示、输入的数据、授予代理的工具和权限、应用程序如何处理模型输出、所连接的 MCP 服务器,以及所保存的日志。经由粘贴的 README 或工具结果传入的提示注入,取决于这些选择。Anthropic 自己在描述粘贴文本问题时也说,这个问题很难解决,因为粘贴文本的用户等于让文本作者控制了提示的一部分 [[1]](${CARD})。因此,部署方需要在厂商措施之上建立自己的测试、权限和监控。

建议

  1. 在授予代理工具访问权限之前,阅读系统卡中关于提示注入和代理安全的章节。
  2. 只给每个代理和 MCP 服务器授予其任务所需的权限,对不可逆的操作要求人工批准。
  3. 把粘贴的文本、检索到的文档和工具输出视为不可信内容,并据此测试应用程序。
  4. 保留工具调用和出站连接的日志,以便事后还原事件经过。
  5. 参阅 FireAI University 关于 AI 安全框架与红队测试的课程,以及关于 Anthropic 如何对 Claude 进行红队测试的博客文章。

与 FireAI 的关系

FireAI 是面向单台 Mac 的网络防火墙。它不会测试模型、读取提示,也不会判断代理收到的指令是否恶意。它覆盖的是 AI 工具周围的一层:按 App 设置规则可以把编程助手限制在其所需的目标地址;当新的 App 或进程要连接陌生目标地址时,首次连接提示会询问用户;实时世界地图和上传激增提醒显示流量去向,并在突然出现大量上传时发出警告;一键断网则会阻止新的连接。如果一条被注入的指令让本地工具向外发送数据,这些控制手段可以暴露或限制该连接,但无法阻止指令本身。

局限

系统卡是 Anthropic 自己的说明,外部测试方的发现也是通过它转述的。Anthropic 公开内容之外的内部流程无从得知。系统卡的评估基于 Anthropic 选定的场景,攻击成功率取决于攻击者所具备的条件(系统卡称其自适应测试的设定刻意宽松),系统卡本身也承认自动化评估可能无法涵盖所有现实风险。负责任扩展政策页面将其报告称为防护措施报告(原称风险报告),而系统卡提到的是 2026 年 8 月的一份风险报告;本文未查阅该报告。2024 年、2025 年的文章和 HackerOne 的来源描述的是更早的工作和更早的模型。除所引用的版本外,HackerOne 文章和政策页面的发布日期未能确定。

免费试用 HisnLabs 的 FireAI 17 天。

来源

  1. Anthropic, 22 September 2026: System Card, Claude Opus 5.5 (PDF)
  2. Anthropic, 12 June 2024: Challenges in red teaming AI systems
  3. Anthropic, 19 March 2025: Progress from Anthropic’s Frontier Red Team
  4. Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)
  5. HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test (challenge held 3 to 10 February 2025)