# Как Anthropic проводит red teaming Claude и что остаётся на вашей стороне > Что Anthropic публикует о red teaming Claude, какие методы может перенять разработчик приложения, какие остаются за создателем модели и что лежит на вас. FireAI Security & Research Team (HisnLabs) · Published 2026-09-30 Canonical: https://hisnlabs.com/ru/blog/kak-anthropic-provodit-red-teaming-claude Anthropic публикует о тестировании Claude больше, чем большинство разработчиков моделей: статьи о red teaming, Responsible Scaling Policy и системные карты (system cards) для каждой модели. В этой заметке кратко изложены эти документы и выделены три группы работ: методы, которые применяют и разработчики моделей, и те, кто внедряет их в свои продукты; работа, которую может выполнить только разработчик модели; и работа, которая остаётся за организацией, строящей приложение на основе модели. Внутренние процессы, выходящие за рамки опубликованного Anthropic, внешнему читателю не видны и здесь не описываются. Заметка составляет вторую часть пары с материалом [Shared responsibility for LLMs: who secures what](https://hisnlabs.com/en/blog/shared-responsibility-for-llms). ## Контекст: два разных вопроса Разработчик модели спрашивает, опасна ли модель: может ли она существенно помочь в создании оружия, проводить кибероперации или вести себя обманчиво. Тот, кто внедряет модель, спрашивает, безопасно ли его приложение: может ли специально составленный документ, результат инструмента или сообщение пользователя заставить приложение раскрыть данные или выполнить действие, которого оно выполнять не должно. Методы пересекаются, но вопросы и доказательства различаются, и положительный ответ на первый вопрос не отвечает на второй. ## Что описывает Anthropic ### Методы, совпадающие с практикой внедряющих организаций В публикации от 12 июня 2024 года Anthropic разделяет свой red teaming на экспертное тестирование в отдельных предметных областях, тестирование с помощью языковых моделей, работу с новыми модальностями и открытые подходы. Автоматизированный red teaming строится на взаимодействии red team и blue team, в котором атаки генерирует модель. Мультимодальный red teaming до выпуска охватывал риски, связанные с изображениями и текстом, в моделях Claude 3. Многоязычное тестирование включало партнёрство с сингапурским Infocomm Media Development Authority на четырёх языках: английском, тамильском, китайском (мандаринском) и малайском. Anthropic также называет краудсорсинговый и общественный red teaming, в том числе мероприятия в AI Village на DEF CON. [[1]](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems) Системная карта Claude Opus 5 от 24 июля 2026 года показывает те же методы применительно к одному выпуску. В главе о защитных мерах используются однократные вредоносные и безобидные запросы, подсказки с неоднозначным контекстом и многоходовые диалоги, в которых симулированный пользователь постепенно подводит разговор к вреду. Безвредность приводится вместе с избыточными отказами: по данным карты, модель сохранила высокую долю безвредных ответов на вредоносные запросы и при этом один из самых низких уровней избыточных отказов на безобидные. Глава об агентной безопасности охватывает злонамеренное использование агентов для программирования и управления компьютером, а также устойчивость к prompt injection при программировании, управлении компьютером и работе в браузере. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) Системная карта определяет prompt injection как вредоносную инструкцию, скрытую в результатах инструментов, которые обрабатывает агент, и отмечает, что риск наиболее высок, когда агент одновременно имеет доступ к частным данным и может действовать от имени пользователя. В ней также сообщается, что инструкции по безопасности в системном промпте claude.ai улучшили обработку моделью вредоносных запросов по сравнению с API без системного промпта. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) Второй вывод напрямую касается внедряющих организаций, поскольку системный промпт находится на их стороне. Responsible Scaling Policy версии 3.4, действующая с 8 июля 2026 года, заранее устанавливает пороги возможностей, требует формальных оценок с интервалом в шесть месяцев и предусматривает внешних рецензентов отчётов о рисках. [[4]](https://www.anthropic.com/responsible-scaling-policy) Фиксация порогов до тестирования ограничивает соблазн переосмыслить результат задним числом, и эта практика переносится на любую организацию, определяющую критерии выпуска. ### Работа, которую может выполнить только разработчик модели Red teaming пограничных угроз (frontier threats) направлен на химические, биологические, радиологические и ядерные (CBRN) риски, кибербезопасность и риски автономного ИИ. В публикации 2023 года описаны эксперты предметных областей с многолетним опытом, определявшие модели угроз, более 100 часов экспертного зондирования и шестимесячное исследование в области биобезопасности объёмом более 150 часов. [[3]](https://www.anthropic.com/news/frontier-threats-red-teaming-for-ai-safety) В публикации марта 2025 года описаны кибероценки на основе заданий формата capture-the-flag и симулированных сетевых сред; там же говорится, что Frontier Red Team работала с US AI Safety Institute, UK AI Security Institute и Национальным управлением ядерной безопасности США (NNSA), с последним — над засекреченными оценками знаний в ядерной и радиологической областях. [[2]](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team) Transparency Hub компании Anthropic сообщает, что компания использует как внутренний, так и внешний red teaming и что UK AI Security Institute, US Center for AI Standards and Innovation и Model Evaluation and Threat Research (METR) провели дополнительное тестирование её моделей. Там же перечислены программы bug bounty на HackerOne. [[5]](https://www.anthropic.com/transparency/voluntary-commitments) Системная карта Opus 5 включает тестирование на киберполигоне от UK AI Security Institute и оценку согласованности (alignment) на основе автоматизированного поведенческого аудита, а также главу о благополучии модели. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) Страница Transparency Hub не указывает, какой институт тестировал конкретную модель до выпуска, поэтому роль каждого на этапе до развёртывания здесь не устанавливается сверх того, что сообщает системная карта. Внешнее и краудсорсинговое тестирование — отдельная категория. По данным HackerOne, конкурс Anthropic по jailbreak проходил с 3 по 10 февраля 2025 года, в нём участвовали 339 человек, было более 300 000 диалоговых взаимодействий и восемь уровней сложности, а четыре команды разделили вознаграждения на 55 000 долларов США. Среди успешных техник были закодированные промпты и шифры, ролевая игра, замена вредоносных ключевых слов безобидными и prompt injection. [[6]](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test) Для Opus 5 системная карта называет трёх внешних тестировщиков по контракту: один потратил около 100 часов и выполнил одно задание с промптами под конкретную задачу, второй потратил около 16 часов без успешного jailbreak, третий запускал автоматизированного атакующего со 150 попытками на задание, также без успеха. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) ## Что остаётся за внедряющей организацией Ни одно из описанных выше тестирований разработчика не оценивает конкретное приложение. Следующее остаётся за организацией, развёртывающей модель, и сама системная карта указывает на несколько из этих пунктов, например показывая, что системные промпты меняют поведение модели и что агенты наиболее уязвимы, когда сочетают доступ к частным данным со способностью действовать. [[7]](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) - Системный промпт и его ограничения, в том числе их поведение под многоходовым давлением. - Данные RAG и косвенная prompt injection: любой документ, страница или письмо, попавшие в контекст, могут нести инструкции. - Инструменты, полномочия агента и то, что внедрённая инструкция могла бы с ними сделать. - Обработка вывода модели до того, как он попадёт в браузер, оболочку, базу данных или к человеку. - Цепочка поставок, включая сторонние плагины и серверы Model Context Protocol (MCP). - Злоупотребление затратами, например бесконечные циклы или запросы, расходующие платные токены. - Изоляция выполнения кода и работы в браузере, а также контроль исходящего сетевого доступа. - Журналирование, мониторинг и контрольные точки выпуска, определяющие, когда изменение можно выпускать. > FireAI, файрвол для macOS, работающий на устройстве и разработанный HisnLabs, позволяет пользователю разрешать или блокировать выход приложений Mac в сеть. Для локального ИИ-инструмента контроль исходящего трафика относится к зоне ответственности внедряющей стороны. [Download FireAI for Mac](https://hisnlabs.com/en/download) ## Практики, которые стоит перенять 1. Привлекайте внешних специалистов по red teaming или проводите закрытую программу bug bounty перед крупными выпусками. Практика самой Anthropic включает и то и другое: внешних тестировщиков по контракту для каждого выпуска и публичный конкурс по jailbreak с вознаграждениями. 2. Проводите проверку поведения агентов в духе оценки согласованности: просматривайте выборку журналов использования инструментов и ищите попытки обойти ограничения, как это делал мониторинг Anthropic при внутреннем развёртывании. 3. Составляйте короткую внутреннюю системную карту для каждого выпуска: что тестировалось, какие тесты не прошли, избыточные отказы наряду с вредом и известные пробелы. 4. Устанавливайте пороги выпуска до тестирования, следуя подходу Responsible Scaling Policy. 5. Тестируйте prompt injection через каждый канал, который читает агент, а не только через пользовательский ввод. Эти методы подробнее рассматриваются в [курсе FireAI University о фреймворках безопасности ИИ и red teaming](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming). ## Значение для FireAI FireAI работает на Mac, ниже уровня любой модели. [Правила](https://hisnlabs.com/ru/docs/per-app-rules) разрешают или блокируют приложение либо отдельный адрес назначения для этого приложения, поэтому локальный ИИ-инструмент можно ограничить только нужными ему хостами. Это ограничивает, куда могут уйти данные, если приложение поведёт себя неправильно. FireAI не тестирует модели, не обнаруживает prompt injection, не читает промпты и не фильтрует вывод моделей. ## Ограничения - Заметка опирается только на то, что опубликовали Anthropic и HackerOne. Внутренние процессы Anthropic за этими пределами не видны, а опубликованные сводки избирательны. - Источники относятся к разным датам, с июля 2023 по июль 2026 года, и методы могли измениться со времени более ранних публикаций. - Результаты, описанные в системной карте, сообщает сам разработчик, за исключением работы, приписанной названным внешним тестировщикам. - Заметка описывает одного разработчика. Другие поставщики публикуют иные материалы, а сопоставление с практикой внедряющих организаций — это обобщение, а не вывод из источников. ## Какое место здесь занимают FireAI и HisnLabs Тестирование модели заканчивается на уровне API. То, куда приложение или агент может обращаться с вашего Mac, — отдельный уровень контроля, и его обеспечивает FireAI. FireAI — это собственный продукт HisnLabs: ИИ-файрвол, работающий прямо на вашем Mac. Он показывает простым языком каждое соединение, которое устанавливают ваши приложения, и позволяет вам решать, что покидает ваш Mac, — его ИИ работает локально, поэтому ваш трафик никогда не отправляется ни нам, ни кому-либо ещё. Команда исследователей безопасности HisnLabs — это те, кто поддерживает точность этих решений: они каталогизируют, какие домены являются обычной телеметрией, а какие — реальным сервисом, отслеживают страну и сеть, стоящие за соединением, и обучают локальную модель (функцию FireAI Pilot) на реальных шаблонах трафика — и ничего из этого не покидает ваш Mac. Вы можете прочитать о технических решениях, лежащих в его основе, или попробовать FireAI в течение 17 дней на странице [FireAI от HisnLabs](https://hisnlabs.com/ru/download). ## Sources - [Anthropic: Challenges in red teaming AI systems (12 June 2024)](https://www.anthropic.com/news/challenges-in-red-teaming-ai-systems) - [Anthropic: Strategic warning for AI risk, progress and insights from our Frontier Red Team (19 March 2025)](https://www.anthropic.com/news/strategic-warning-for-ai-risk-progress-and-insights-from-our-frontier-red-team) - [Anthropic: Frontier threats red teaming for AI safety (26 July 2023)](https://www.anthropic.com/news/frontier-threats-red-teaming-for-ai-safety) - [Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)](https://www.anthropic.com/responsible-scaling-policy) - [Anthropic Transparency Hub: Voluntary commitments](https://www.anthropic.com/transparency/voluntary-commitments) - [HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test](https://www.hackerone.com/blog/how-anthropics-jailbreak-challenge-put-ai-safety-defenses-test) - [Anthropic: System Card, Claude Opus 5 (24 July 2026)](https://www-cdn.anthropic.com/b514064af1408018e64b1ad24e7d5e75850b4ffd/Claude%20Opus%205%20System%20Card.pdf) - [FireAI docs: Rules: app, website, domain, IP or a range](https://hisnlabs.com/en/docs/per-app-rules) - [FireAI University: AI security frameworks and red teaming](https://hisnlabs.com/en/university/ai-security-frameworks-and-red-teaming)