Wiadomości dotyczące bezpieczeństwa i sztucznej inteligencji

Bezpieczeństwo API modeli językowych · Autor FireAI Security & Research Team · Opublikowano

OpenAI przerywa kampanię wydobywania rozumowania, która wykorzystywała wymienne zaszyfrowane ślady rozumowania

OpenAI podaje, że 28 lipca 2026 r. przerwało kampanię destylacji, a praca badawcza wykazuje, że zaszyfrowane ślady rozumowania w API modeli są wymienne między użytkownikami.

A key icon and the FireAI research mascot, illustrating OpenAI disrupting a campaign that extracted protected reasoning from its models.

The Hacker News poinformował 1 października 2026 r., że OpenAI przerwało skoordynowaną kampanię destylacji wymierzoną w chronione rozumowanie jego modeli i przypisało główny trzon tej aktywności osobom związanym z Moonshot AI [1]. Praca badawcza przesłana do arXiv 10 sierpnia 2026 r. opisuje leżącą u podstaw słabość: zaszyfrowane ślady rozumowania, które są wymienne między sesjami, użytkownikami i modelami [2]. Sprawa dotyczy bezpieczeństwa API modeli językowych, z których wielu użytkowników Maca korzysta za pośrednictwem aplikacji i agentów.

Tło

Praca wyjaśnia, że główni dostawcy LLM zwracają rozumowanie modelu krok po kroku w postaci bloków zaszyfrowanego tekstu, które klient odsyła z każdym kolejnym żądaniem [2]. Destylacja, jak opisuje ją The Hacker News, to systematyczne pozyskiwanie wyników jednego modelu w celu wytrenowania lub ulepszenia innego modelu [1].

Ustalenia

Według artykułu aktywność rozpoczęła się 1 lipca 2026 r. przy niewielkiej skali, osiągnęła szczyt 24 i 25 lipca, gdy ponad 4000 odrębnych użytkowników podjęło 16 000 prób żądań z wykorzystaniem wzorca wydobywania, i została całkowicie przerwana 28 lipca 2026 r. [1]. Powiązaną aktywność o podobnym wzorcu promptów wykryto u ponad 15 000 odrębnych użytkowników [1].

Artykuł cytuje OpenAI, według którego operatorzy nie złamali szyfrowania, nie przejęli bazy danych ani nie uzyskali bezpośredniego dostępu do przechowywanych rozmów użytkowników, lecz manipulowali interakcjami z modelem tak, by chronione rozumowanie mogło zostać odtworzone w postaci widocznej dla żądającego [1]. OpenAI zablokowało zaangażowane fałszywe konta, zamknęło ścieżkę pozwalającą użytkownikom ponownie odtwarzać zaszyfrowane rozumowanie w celu odzyskania jego treści i dodało kontrole wykrywające i wstrzymujące przesyłane strumieniowo wyniki, które mogłyby ujawnić rozumowanie [1].

The Hacker News podaje, że OpenAI, powołując się na względy bezpieczeństwa, nie przedstawiło technicznych dowodów na przypisanie aktywności pekińskiej firmie Moonshot AI, a artykuł nie zawiera odpowiedzi Moonshot AI [1]. Przypomina też, że w poprzednim miesiącu Anthropic zarzucił Moonshot AI przekazywanie żądań klientów do Claude, aktywność śledzoną jako GTG-16002 [1].

Praca opublikowana w arXiv podaje, że zaszyfrowane bloki są w pełni zgodne i wymienne między różnymi sesjami, użytkownikami i modelami, i demonstruje cztery ataki: destylację modelu przez wstrzykiwanie zaszyfrowanych śladów do słabszych modeli, wydobywanie danych, ujawnianie ukrytych niebezpiecznych treści oraz niewidoczny prompt injection w systemach agentowych [2]. W przypadku wydobywania danych autorzy odzyskali 367 elementów danych osobowych i 182 poświadczenia z 315 320 bloków rozumowania zebranych z publicznych repozytoriów [2]. Praca stwierdza, że badania obejmowały odpowiedzialne ujawnienie, i proponuje zabezpieczenia kryptograficzne i systemowe [2].

Znaczenie dla użytkowników Maca

Kampania była wymierzona w wyniki modeli dostawcy, a nie w urządzenia jego użytkowników, a źródła nie informują, by w jej ramach ujawniono czyjąkolwiek rozmowę [1]. Praca ma znaczenie dla osób korzystających z agentów AI, ponieważ jeden z czterech ataków to niewidoczny prompt injection w systemach agentowych, a autorzy znaleźli poświadczenia i dane osobowe w blokach rozumowania opublikowanych w publicznych repozytoriach [2].

Zalecenia

  1. Nie umieszczaj kluczy API dostawców w repozytoriach ani udostępnianych logach i unieważnij każdy klucz, który został opublikowany.
  2. Przechowując lub udostępniając logi sesji AI, usuwaj bloki rozumowania i inne zwracane przez dostawcę pola, których aplikacja nie potrzebuje.
  3. Przejrzyj uprawnienia przyznane agentowi AI, ponieważ praca obejmuje atak na systemy agentowe.
  4. Śledź komunikaty dostawców o zmianach w obsłudze rozumowania w używanych API.
  5. Zespołom budującym na tych API: przeczytaj zabezpieczenia proponowane w pracy przed zaprojektowaniem przechowywania sesji [2].

Związek z FireAI

FireAI nie obsługuje ani nie chroni API modeli. Na Macu identyfikuje aplikację po jej podpisie kodu i stosuje do każdego połączenia reguły dla aplikacji, a Profil agenta oznacza pierwszy w historii cel lub skok wysyłania danych z aplikacji agentowych, takich jak Claude Code i Cursor, korzystając wyłącznie z nazw hostów i liczby bajtów. Własny opcjonalny model AI działający na urządzeniu FireAI jest pobierany jednorazowo z Hugging Face, a następnie działa wyłącznie na Macu.

FireAI nie widzi wnętrza szyfrowanego połączenia, więc nie może odczytać bloku rozumowania, promptu ani odpowiedzi modelu. Nie wykrywa destylacji, nie kontroluje tego, co zwraca dostawca, i nie powstrzymuje autoryzowanego konta przed wysyłaniem żądań do API.

Ograniczenia

Opis kampanii opiera się na streszczeniu oświadczenia OpenAI przygotowanym przez The Hacker News; samego oświadczenia nie udało się pobrać na potrzeby tego wpisu [1]. Przypisanie aktywności Moonshot AI to ocena OpenAI bez opublikowanych dowodów technicznych. Praca jest preprintem; ten wpis opiera się na jej streszczeniu i nie weryfikował niezależnie jej wyników [2]. Źródła nie podają, którzy dostawcy zmienili swoje API poza wymienionymi działaniami OpenAI.

Wypróbuj FireAI od HisnLabs za darmo przez 17 dni.

Źródła

  1. The Hacker News, 1 October 2026: OpenAI disrupts reasoning extraction campaign linked to Moonshot AI associates
  2. arXiv, 10 August 2026: Stealing Reasoning Traces from Proprietary LLM APIs (Panfilov et al.)