The Hacker News poinformował 1 października 2026 r., że OpenAI przerwało skoordynowaną kampanię destylacji wymierzoną w chronione rozumowanie jego modeli i przypisało główny trzon tej aktywności osobom związanym z Moonshot AI [1]. Praca badawcza przesłana do arXiv 10 sierpnia 2026 r. opisuje leżącą u podstaw słabość: zaszyfrowane ślady rozumowania, które są wymienne między sesjami, użytkownikami i modelami [2]. Sprawa dotyczy bezpieczeństwa API modeli językowych, z których wielu użytkowników Maca korzysta za pośrednictwem aplikacji i agentów.
Tło
Praca wyjaśnia, że główni dostawcy LLM zwracają rozumowanie modelu krok po kroku w postaci bloków zaszyfrowanego tekstu, które klient odsyła z każdym kolejnym żądaniem [2]. Destylacja, jak opisuje ją The Hacker News, to systematyczne pozyskiwanie wyników jednego modelu w celu wytrenowania lub ulepszenia innego modelu [1].
Ustalenia
Według artykułu aktywność rozpoczęła się 1 lipca 2026 r. przy niewielkiej skali, osiągnęła szczyt 24 i 25 lipca, gdy ponad 4000 odrębnych użytkowników podjęło 16 000 prób żądań z wykorzystaniem wzorca wydobywania, i została całkowicie przerwana 28 lipca 2026 r. [1]. Powiązaną aktywność o podobnym wzorcu promptów wykryto u ponad 15 000 odrębnych użytkowników [1].
Artykuł cytuje OpenAI, według którego operatorzy nie złamali szyfrowania, nie przejęli bazy danych ani nie uzyskali bezpośredniego dostępu do przechowywanych rozmów użytkowników, lecz manipulowali interakcjami z modelem tak, by chronione rozumowanie mogło zostać odtworzone w postaci widocznej dla żądającego [1]. OpenAI zablokowało zaangażowane fałszywe konta, zamknęło ścieżkę pozwalającą użytkownikom ponownie odtwarzać zaszyfrowane rozumowanie w celu odzyskania jego treści i dodało kontrole wykrywające i wstrzymujące przesyłane strumieniowo wyniki, które mogłyby ujawnić rozumowanie [1].
The Hacker News podaje, że OpenAI, powołując się na względy bezpieczeństwa, nie przedstawiło technicznych dowodów na przypisanie aktywności pekińskiej firmie Moonshot AI, a artykuł nie zawiera odpowiedzi Moonshot AI [1]. Przypomina też, że w poprzednim miesiącu Anthropic zarzucił Moonshot AI przekazywanie żądań klientów do Claude, aktywność śledzoną jako GTG-16002 [1].
Praca opublikowana w arXiv podaje, że zaszyfrowane bloki są w pełni zgodne i wymienne między różnymi sesjami, użytkownikami i modelami, i demonstruje cztery ataki: destylację modelu przez wstrzykiwanie zaszyfrowanych śladów do słabszych modeli, wydobywanie danych, ujawnianie ukrytych niebezpiecznych treści oraz niewidoczny prompt injection w systemach agentowych [2]. W przypadku wydobywania danych autorzy odzyskali 367 elementów danych osobowych i 182 poświadczenia z 315 320 bloków rozumowania zebranych z publicznych repozytoriów [2]. Praca stwierdza, że badania obejmowały odpowiedzialne ujawnienie, i proponuje zabezpieczenia kryptograficzne i systemowe [2].
Znaczenie dla użytkowników Maca
Kampania była wymierzona w wyniki modeli dostawcy, a nie w urządzenia jego użytkowników, a źródła nie informują, by w jej ramach ujawniono czyjąkolwiek rozmowę [1]. Praca ma znaczenie dla osób korzystających z agentów AI, ponieważ jeden z czterech ataków to niewidoczny prompt injection w systemach agentowych, a autorzy znaleźli poświadczenia i dane osobowe w blokach rozumowania opublikowanych w publicznych repozytoriach [2].
Zalecenia
- Nie umieszczaj kluczy API dostawców w repozytoriach ani udostępnianych logach i unieważnij każdy klucz, który został opublikowany.
- Przechowując lub udostępniając logi sesji AI, usuwaj bloki rozumowania i inne zwracane przez dostawcę pola, których aplikacja nie potrzebuje.
- Przejrzyj uprawnienia przyznane agentowi AI, ponieważ praca obejmuje atak na systemy agentowe.
- Śledź komunikaty dostawców o zmianach w obsłudze rozumowania w używanych API.
- Zespołom budującym na tych API: przeczytaj zabezpieczenia proponowane w pracy przed zaprojektowaniem przechowywania sesji [2].
Związek z FireAI
FireAI nie obsługuje ani nie chroni API modeli. Na Macu identyfikuje aplikację po jej podpisie kodu i stosuje do każdego połączenia reguły dla aplikacji, a Profil agenta oznacza pierwszy w historii cel lub skok wysyłania danych z aplikacji agentowych, takich jak Claude Code i Cursor, korzystając wyłącznie z nazw hostów i liczby bajtów. Własny opcjonalny model AI działający na urządzeniu FireAI jest pobierany jednorazowo z Hugging Face, a następnie działa wyłącznie na Macu.
FireAI nie widzi wnętrza szyfrowanego połączenia, więc nie może odczytać bloku rozumowania, promptu ani odpowiedzi modelu. Nie wykrywa destylacji, nie kontroluje tego, co zwraca dostawca, i nie powstrzymuje autoryzowanego konta przed wysyłaniem żądań do API.
Ograniczenia
Opis kampanii opiera się na streszczeniu oświadczenia OpenAI przygotowanym przez The Hacker News; samego oświadczenia nie udało się pobrać na potrzeby tego wpisu [1]. Przypisanie aktywności Moonshot AI to ocena OpenAI bez opublikowanych dowodów technicznych. Praca jest preprintem; ten wpis opiera się na jej streszczeniu i nie weryfikował niezależnie jej wyników [2]. Źródła nie podają, którzy dostawcy zmienili swoje API poza wymienionymi działaniami OpenAI.
Wypróbuj FireAI od HisnLabs za darmo przez 17 dni.