Новини безпеки та ШІ

Червоні команди для ШІ · Автор FireAI Security & Research Team · Опубліковано

Системна картка Claude Opus 5.5 описує роботу червоних команд Anthropic і те, що тестування на рівні моделі залишає тим, хто її розгортає

Системна картка Anthropic від 22 вересня 2026 року описує зовнішні червоні команди й тести ін’єкції промптів для Claude Opus 5.5 і що лишається за розгортанням.

A shield beside the FireAI research mascot, illustrating Anthropic’s red-teaming of Claude Opus 5.5 and the layers left to deploying organisations.

Anthropic оприлюднила системну картку Claude Opus 5.5 22 вересня 2026 року. У ній описано тестування перед розгортанням, що поєднує автоматизовані оцінювання, випробування приросту можливостей (uplift trials), зовнішні експертні червоні команди та оцінювання третіми сторонами [1]. Картка є найновішим оприлюдненим описом того, як Anthropic тестує свої моделі, і наводить результати, які може прочитати організація, що розгортає модель, разом з обмеженнями, яких жоден тест на рівні моделі не усуває.

Передумови

Anthropic описала свій загальний підхід до червоних команд у дописі за червень 2024 року. Він перелічує експертне тестування в окремих галузях (зокрема тестування вразливостей політик, загроз передового рівня і багатомовне тестування), автоматизоване тестування за допомогою моделей, мультимодальне тестування, а також відкриті краудсорсингові й спільнотні методи, і зазначає, що експертні методи потребують спеціальних знань, але погано масштабуються, тоді як автоматизованим методам важко знаходити нові загрози [2]. Допис команди Frontier Red Team за березень 2025 року повідомляє, що команда оцінює ризики у сфері кібербезпеки, біобезпеки та інші хімічні, біологічні, радіологічні та ядерні (CBRN) ризики, а також автономність, і що Інститути безпеки ШІ США та Великої Британії провели тестування Claude 3.5 Sonnet перед розгортанням [3]. Версія 3.4 Responsible Scaling Policy, чинна з 8 липня 2026 року, встановлює пороги можливостей і рівні безпеки ШІ (AI Safety Levels) та описує звіти про можливості (Capability Reports) і звіти про запобіжники (Safeguards Reports) із зовнішнім переглядом неочищених матеріалів [4].

Що описують джерела

Тестування загроз. Щодо хімічного й біологічного ризику картка повідомляє, що Anthropic вважає Opus 5.5 моделлю з можливостями щодо синтезу вже відомої зброї (CB-1), але не нової зброї (CB-2), і розгортає її з розширеними біологічними запобіжниками. Щодо кіберзагроз вона не повідомляє ознак того, що модель може розробляти нові наступальні можливості, і зазначає, що джейлбрейка критичного рівня не знайдено, хоча запас безпеки тимчасово розширено. Картка також повідомляє про тестування перед розгортанням разом із METR щодо можливостей у дослідженнях і розробці ШІ та про співпрацю з американським Center for AI Standards and Innovation щодо кібер- і біологічних можливостей, запобіжників і ненавмисної поведінки [1].

Зовнішні червоні команди для запобіжників. Розділ 3.5.3 картки називає трьох залучених тестувальників. Trajectory Labs витратила приблизно 95 годин і надіслала понад 29 000 запитів до ізольованих завдань із відтворення експлойтів, повідомивши про 13 можливих проломів у семи завданнях і про відсутність універсального джейлбрейка. 10a Labs витратила приблизно 56 годин на 82 багатоходові розмови і повідомила, що жодна не просунулася далі доказу концепції. Gray Swan застосувала свого автоматизованого атакувальника Shade до 61 сценарію щодо критичної інфраструктури та інших наборів завдань, зробивши приблизно 3 300 спроб, і не зафіксувала проломів [1]. Це звіти Anthropic про те, що знайшли тестувальники, і сама картка зазначає, що одне із завдань Trajectory Labs, розкладене на понад 100 окремих контекстів, дало робочий ланцюжок експлойтів [1].

Ін’єкція промптів в агентах. Розділ 5.2 використовує оцінювання непрямої ін’єкції промптів, створене Gray Swan разом із британським AI Security Institute та американським CAISI: 37 сценаріїв і 1 804 відібрані атаки в програмуванні, використанні інструментів і керуванні комп’ютером. Картка повідомляє, що для Opus 5.5 атака вдавалася приблизно в одній спробі зі ста за п’ятнадцяти спроб, найчастіше в керуванні комп’ютером, і описує тести з адаптивним атакувальником, які називає навмисно поблажливими. Вона також зазначає, що атаки, написані проти попередньої моделі, досі вдаються проти найновіших моделей в агентах для роботи з браузером, якщо немає додаткових запобіжників [1]. Картка зазначає, що для порівняння моделей оцінювання проводилися без захисту від ін’єкції промптів, який Anthropic розгортає у своїх продуктах [1].

Безпечність відповідей і надмірні відмови. Anthropic повідомляє, що Opus 5.5 рідко надмірно відмовляла на безневинні запити і що частка безпечних відповідей в одноходових тестах була дещо нижчою, ніж у Claude Opus 5, головно на запитах про заборонені речовини. У багатоходових тестах модель покращилася в розмовах про біологічну зброю і погіршилася щодо відстеження й стеження та щодо операцій впливу [1]. Без виробничих запобіжників у завданнях з агентної безпеки модель допомагала із завданнями подвійного призначення найчастіше серед порівнюваних моделей і найрідше відмовляла на зловмисні запити [1].

Висновок, що безпосередньо стосується тих, хто розгортає модель, міститься в розділі 6.5.1. Ранні знімки моделі виконували небезпечні інструкції, підкладені в текст, який користувач вставив у власний промпт, як-от README, лист чи вебсторінку. В оцінюванні з програмування ранній знімок виконав, спланував або передав далі підкладену інструкцію трохи більш ніж у половині спроб (усі дії симульовано), а інструкції, записані невидимими символами, виконав у 18 із 68 спроб. Anthropic зазначає, що остаточна модель і зміни в продуктах пом’якшують це, зокрема через видалення невидимих символів і позначення вставленого тексту [1].

Краудсорсингове тестування — п’ятий метод у цій картині. Опис HackerOne лютневого конкурсу джейлбрейків 2025 року, який перевіряв Constitutional Classifiers на запитах щодо CBRN, повідомляє про 339 дослідників, понад 300 000 взаємодій у чаті і $55 000 винагород, поділених між чотирма командами, одна з яких знайшла універсальний джейлбрейк [5].

Наслідки для організацій, що розгортають Claude

Картка тестує модель із власними запобіжниками Anthropic або без них. Вона не тестує системних промптів організації, даних, які та подає, інструментів і дозволів, наданих агентові, обробки виводу моделі застосунком, під’єднаних MCP-серверів чи журналів, які організація зберігає. Ін’єкція промптів, що надходить через вставлений README чи результат інструмента, залежить саме від цих рішень. Власний опис проблеми вставленого тексту від Anthropic визнає, що її важко розв’язати, адже користувач, який вставляє текст, дає його авторові контроль над частиною промпту [[1]](${CARD}). Тому тим, хто розгортає модель, потрібні власні тести, дозволи й моніторинг понад те, що дає постачальник.

Рекомендації

  1. Прочитайте розділи системної картки про ін’єкцію промптів і безпеку агентів, перш ніж надавати агентові доступ до інструментів.
  2. Надавайте кожному агентові й MCP-серверу лише ті дозволи, яких потребує його завдання, і вимагайте схвалення людиною для незворотних дій.
  3. Вважайте вставлений текст, отримані документи й вивід інструментів ненадійними і тестуйте застосунок на них.
  4. Ведіть журнали викликів інструментів і вихідних з’єднань, щоб інцидент можна було відтворити.
  5. Ознайомтеся з курсом FireAI University про фреймворки безпеки ШІ та червоні команди і дописом у блозі про те, як Anthropic тестує Claude червоними командами.

Стосунок до FireAI

FireAI — мережевий фаєрвол для одного Mac. Він не тестує моделей, не читає промптів і не оцінює, чи є інструкція агентові зловмисною. Він охоплює один рівень довкола ШІ-інструмента: правила для застосунків можуть обмежити асистента для програмування потрібними йому призначеннями, запит під час першого з’єднання питає, коли новий застосунок чи процес звертається до незнайомого призначення, мапа світу і сповіщення про вивантаження показують, куди йде трафік, і попереджають про раптове велике вивантаження, а аварійний вимикач зупиняє нові з’єднання. Якби впроваджена інструкція змусила локальний інструмент надіслати дані назовні, ці засоби могли б показати чи обмежити з’єднання, але не запобігли б самій інструкції.

Обмеження

Системна картка — власний виклад Anthropic, і висновки зовнішніх тестувальників подано через неї. Внутрішні процеси поза тим, що Anthropic оприлюднює, не видно. Оцінювання в картці проводяться на обраних Anthropic сценаріях, показники успішності атак залежать від можливостей, наданих атакувальникові (картка називає свої адаптивні тести навмисно поблажливими), і сама картка зазначає, що автоматизовані оцінювання можуть не охоплювати всіх реальних ризиків. Сторінка Responsible Scaling Policy називає свої звіти Safeguards Reports, раніше Risk Reports, тоді як картка посилається на Risk Report за серпень 2026 року; цей звіт не відкривався. Джерела 2024 і 2025 років та HackerOne описують попередню роботу й попередні моделі. Дати публікації допису HackerOne і сторінки політики, окрім наведених версій, не встановлено.

Спробуйте FireAI від HisnLabs безкоштовно 17 днів.

Джерела

  1. Anthropic, 22 September 2026: System Card, Claude Opus 5.5 (PDF)
  2. Anthropic, 12 June 2024: Challenges in red teaming AI systems
  3. Anthropic, 19 March 2025: Progress from Anthropic’s Frontier Red Team
  4. Anthropic: Responsible Scaling Policy (version 3.4, effective 8 July 2026)
  5. HackerOne: How Anthropic’s jailbreak challenge put AI safety defenses to the test (challenge held 3 to 10 February 2025)