# Как Anthropic проводит red teaming Claude и что остаётся на вашей стороне

> Что Anthropic публикует о red teaming Claude, какие методы может перенять разработчик приложения, какие остаются за создателем модели и что лежит на вас.

FireAI Security & Research Team (HisnLabs) · Published 2026-09-30
Canonical: https://hisnlabs.com/ru/blog/kak-anthropic-provodit-red-teaming-claude

Anthropic публикует о тестировании Claude больше, чем большинство разработчиков моделей: статьи о red teaming, Responsible Scaling Policy и системные карты (system cards) для каждой модели. В этой заметке кратко изложены эти документы и выделены три группы работ: методы, которые применяют и разработчики моделей, и те, кто внедряет их в свои продукты; работа, которую может выполнить только разработчик модели; и работа, которая остаётся за организацией, строящей приложение на основе модели. Внутренние процессы, выходящие за рамки опубликованного Anthropic, внешнему читателю не видны и здесь не описываются. Заметка составляет вторую часть пары с материалом [Shared responsibility for LLMs: who secures what](https://hisnlabs.com/en/blog/shared-responsibility-for-llms).

## Контекст: два разных вопроса

Разработчик модели спрашивает, опасна ли модель: может ли она существенно помочь в создании оружия, проводить кибероперации или вести себя обманчиво. Тот, кто внедряет модель, спрашивает, безопасно ли его приложение: может ли специально составленный документ, результат инструмента или сообщение пользователя заставить приложение раскрыть данные или выполнить действие, которого оно выполнять не должно. Методы пересекаются, но вопросы и доказательства различаются, и положительный ответ на первый вопрос не отвечает на второй.

## Что описывает Anthropic

### Методы, совпадающие с практикой внедряющих организаций

В публикации от 12 июня 2024 года Anthropic разделяет свой red teaming на экспертное тестирование в отдельных предметных областях, тестирование с помощью языковых моделей, работу с новыми модальностями и открытые подходы. Автоматизированный red teaming строится на взаимодействии red team и blue team, в котором атаки генерирует модель. Мультимодальный red teaming до выпуска охватывал риски, связанные с изображениями и текстом, в моделях Claude 3. Многоязычное тестирование включало партнёрство с сингапурским Infocomm Media Development Authority на четырёх языках: английском, тамильском, китайском (мандаринском) и малайском. Anthropic также называет краудсорсинговый и общественный red teaming, в том числе мероприятия в AI Village на DEF CON. [[1]](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems)

Системная карта Claude Opus 5 от 24 июля 2026 года показывает те же методы применительно к одному выпуску. В главе о защитных мерах используются однократные вредоносные и безобидные запросы, подсказки с неоднозначным контекстом и многоходовые диалоги, в которых симулированный пользователь постепенно подводит разговор к вреду. Безвредность приводится вместе с избыточными отказами: по данным карты, модель сохранила высокую долю безвредных ответов на вредоносные запросы и при этом один из самых низких уровней избыточных отказов на безобидные. Глава об агентной безопасности охватывает злонамеренное использование агентов для программирования и управления компьютером, а также устойчивость к prompt injection при программировании, управлении компьютером и работе в браузере. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf)

Системная карта определяет prompt injection как вредоносную инструкцию, скрытую в результатах инструментов, которые обрабатывает агент, и отмечает, что риск наиболее высок, когда агент одновременно имеет доступ к частным данным и может действовать от имени пользователя. В ней также сообщается, что инструкции по безопасности в системном промпте claude.ai улучшили обработку моделью вредоносных запросов по сравнению с API без системного промпта. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) Второй вывод напрямую касается внедряющих организаций, поскольку системный промпт находится на их стороне.

Responsible Scaling Policy версии 3.4, действующая с 8 июля 2026 года, заранее устанавливает пороги возможностей, требует формальных оценок с интервалом в шесть месяцев и предусматривает внешних рецензентов отчётов о рисках. [[4]](https://www.anthropic.com/responsible-scaling-policy) Фиксация порогов до тестирования ограничивает соблазн переосмыслить результат задним числом, и эта практика переносится на любую организацию, определяющую критерии выпуска.

### Работа, которую может выполнить только разработчик модели

Red teaming пограничных угроз (frontier threats) направлен на химические, биологические, радиологические и ядерные (CBRN) риски, кибербезопасность и риски автономного ИИ. В публикации 2023 года описаны эксперты предметных областей с многолетним опытом, определявшие модели угроз, более 100 часов экспертного зондирования и шестимесячное исследование в области биобезопасности объёмом более 150 часов. [[3]](https://www.anthropic.com/news/frontier-threats-red-teaming-for-ai-safety) В публикации марта 2025 года описаны кибероценки на основе заданий формата capture-the-flag и симулированных сетевых сред; там же говорится, что Frontier Red Team работала с US AI Safety Institute, UK AI Security Institute и Национальным управлением ядерной безопасности США (NNSA), с последним — над засекреченными оценками знаний в ядерной и радиологической областях. [[2]](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team)

Transparency Hub компании Anthropic сообщает, что компания использует как внутренний, так и внешний red teaming и что UK AI Security Institute, US Center for AI Standards and Innovation и Model Evaluation and Threat Research (METR) провели дополнительное тестирование её моделей. Там же перечислены программы bug bounty на HackerOne. [[5]](https://www.anthropic.com/transparency/voluntary-commitments) Системная карта Opus 5 включает тестирование на киберполигоне от UK AI Security Institute и оценку согласованности (alignment) на основе автоматизированного поведенческого аудита, а также главу о благополучии модели. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) Страница Transparency Hub не указывает, какой институт тестировал конкретную модель до выпуска, поэтому роль каждого на этапе до развёртывания здесь не устанавливается сверх того, что сообщает системная карта.

Внешнее и краудсорсинговое тестирование — отдельная категория. По данным HackerOne, конкурс Anthropic по jailbreak проходил с 3 по 10 февраля 2025 года, в нём участвовали 339 человек, было более 300 000 диалоговых взаимодействий и восемь уровней сложности, а четыре команды разделили вознаграждения на 55 000 долларов США. Среди успешных техник были закодированные промпты и шифры, ролевая игра, замена вредоносных ключевых слов безобидными и prompt injection. [[6]](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test) Для Opus 5 системная карта называет трёх внешних тестировщиков по контракту: один потратил около 100 часов и выполнил одно задание с промптами под конкретную задачу, второй потратил около 16 часов без успешного jailbreak, третий запускал автоматизированного атакующего со 150 попытками на задание, также без успеха. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf)

## Что остаётся за внедряющей организацией

Ни одно из описанных выше тестирований разработчика не оценивает конкретное приложение. Следующее остаётся за организацией, развёртывающей модель, и сама системная карта указывает на несколько из этих пунктов, например показывая, что системные промпты меняют поведение модели и что агенты наиболее уязвимы, когда сочетают доступ к частным данным со способностью действовать. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf)

- Системный промпт и его ограничения, в том числе их поведение под многоходовым давлением.
- Данные RAG и косвенная prompt injection: любой документ, страница или письмо, попавшие в контекст, могут нести инструкции.
- Инструменты, полномочия агента и то, что внедрённая инструкция могла бы с ними сделать.
- Обработка вывода модели до того, как он попадёт в браузер, оболочку, базу данных или к человеку.
- Цепочка поставок, включая сторонние плагины и серверы Model Context Protocol (MCP).
- Злоупотребление затратами, например бесконечные циклы или запросы, расходующие платные токены.
- Изоляция выполнения кода и работы в браузере, а также контроль исходящего сетевого доступа.
- Журналирование, мониторинг и контрольные точки выпуска, определяющие, когда изменение можно выпускать.

> FireAI, файрвол для macOS, работающий на устройстве и разработанный HisnLabs, позволяет пользователю разрешать или блокировать выход приложений Mac в сеть. Для локального ИИ-инструмента контроль исходящего трафика относится к зоне ответственности внедряющей стороны. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Практики, которые стоит перенять

1. Привлекайте внешних специалистов по red teaming или проводите закрытую программу bug bounty перед крупными выпусками. Практика самой Anthropic включает и то и другое: внешних тестировщиков по контракту для каждого выпуска и публичный конкурс по jailbreak с вознаграждениями.
2. Проводите проверку поведения агентов в духе оценки согласованности: просматривайте выборку журналов использования инструментов и ищите попытки обойти ограничения, как это делал мониторинг Anthropic при внутреннем развёртывании.
3. Составляйте короткую внутреннюю системную карту для каждого выпуска: что тестировалось, какие тесты не прошли, избыточные отказы наряду с вредом и известные пробелы.
4. Устанавливайте пороги выпуска до тестирования, следуя подходу Responsible Scaling Policy.
5. Тестируйте prompt injection через каждый канал, который читает агент, а не только через пользовательский ввод.

Эти методы подробнее рассматриваются в [курсе FireAI University о фреймворках безопасности ИИ и red teaming](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming).

## Значение для FireAI

FireAI работает на Mac, ниже уровня любой модели. [Правила](https://hisnlabs.com/ru/docs/per-app-rules) разрешают или блокируют приложение либо отдельный адрес назначения для этого приложения, поэтому локальный ИИ-инструмент можно ограничить только нужными ему хостами. Это ограничивает, куда могут уйти данные, если приложение поведёт себя неправильно. FireAI не тестирует модели, не обнаруживает prompt injection, не читает промпты и не фильтрует вывод моделей.

## Ограничения

- Заметка опирается только на то, что опубликовали Anthropic и HackerOne. Внутренние процессы Anthropic за этими пределами не видны, а опубликованные сводки избирательны.
- Источники относятся к разным датам, с июля 2023 по июль 2026 года, и методы могли измениться со времени более ранних публикаций.
- Результаты, описанные в системной карте, сообщает сам разработчик, за исключением работы, приписанной названным внешним тестировщикам.
- Заметка описывает одного разработчика. Другие поставщики публикуют иные материалы, а сопоставление с практикой внедряющих организаций — это обобщение, а не вывод из источников.

## Какое место здесь занимают FireAI и HisnLabs

Тестирование модели заканчивается на уровне API. То, куда приложение или агент может обращаться с вашего Mac, — отдельный уровень контроля, и его обеспечивает FireAI.

FireAI — это собственный продукт HisnLabs: ИИ-файрвол, работающий прямо на вашем Mac. Он показывает простым языком каждое соединение, которое устанавливают ваши приложения, и позволяет вам решать, что покидает ваш Mac, — его ИИ работает локально, поэтому ваш трафик никогда не отправляется ни нам, ни кому-либо ещё. Команда исследователей безопасности HisnLabs — это те, кто поддерживает точность этих решений: они каталогизируют, какие домены являются обычной телеметрией, а какие — реальным сервисом, отслеживают страну и сеть, стоящие за соединением, и обучают локальную модель (функцию FireAI Pilot) на реальных шаблонах трафика — и ничего из этого не покидает ваш Mac.

Вы можете прочитать о технических решениях, лежащих в его основе, или попробовать FireAI в течение 17 дней на странице [FireAI от HisnLabs](https://hisnlabs.com/ru/download).

## Sources

- [Anthropic: Challenges in red teaming AI systems (12 June 2024)](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems)
- [Anthropic: Strategic warning for AI risk, progress and insights from our Frontier Red Team (19 March 2025)](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team)
- [Anthropic: Frontier threats red teaming for AI safety (26 July 2023)](https://www.anthropic.com/news/frontier-threats-red-teaming-for-ai-safety)
- [Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)](https://www.anthropic.com/responsible-scaling-policy)
- [Anthropic Transparency Hub: Voluntary commitments](https://www.anthropic.com/transparency/voluntary-commitments)
- [HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test)
- [Anthropic: System Card, Claude Opus 5 (24 July 2026)](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf)
- [FireAI docs: Rules: app, website, domain, IP or a range](https://hisnlabs.com/en/docs/per-app-rules)
- [FireAI University: AI security frameworks and red teaming](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming)
