O The Hacker News noticiou em 1º de outubro de 2026 que a OpenAI havia interrompido uma campanha coordenada de destilação voltada ao raciocínio protegido de seus modelos, e que a OpenAI atribuiu um núcleo da atividade a pessoas associadas à Moonshot AI [1]. Um artigo de pesquisa enviado ao arXiv em 10 de agosto de 2026 descreve a fragilidade subjacente: rastros de raciocínio criptografados que são intercambiáveis entre sessões, usuários e modelos [2]. O item trata da segurança de APIs de modelos de linguagem, que muitos usuários de Mac acessam por meio de apps e agentes.
Contexto
O artigo explica que os principais provedores de LLM devolvem o raciocínio passo a passo de um modelo como blocos de texto criptografado, que o cliente reenvia a cada requisição seguinte [2]. A destilação, como o The Hacker News a descreve, é a extração sistemática das saídas de um modelo para treinar ou aprimorar outro modelo [1].
Constatações
Segundo a reportagem, a atividade começou em 1º de julho de 2026 em baixo volume, atingiu o pico em 24 e 25 de julho com 16.000 requisições tentadas usando um padrão de extração a partir de mais de 4.000 usuários distintos e foi totalmente interrompida em 28 de julho de 2026 [1]. Atividade relacionada de padrões de prompt foi detectada em mais de 15.000 usuários distintos [1].
A reportagem cita a OpenAI afirmando que os operadores não quebraram sua criptografia, não comprometeram um banco de dados nem obtiveram acesso direto a conversas armazenadas de usuários, e que, em vez disso, manipularam as interações com o modelo para que o raciocínio protegido pudesse ser reproduzido em formas visíveis a quem fazia a requisição [1]. A OpenAI baniu as contas fraudulentas envolvidas, fechou um caminho que permitia aos usuários reenviar raciocínio criptografado para recuperar seu conteúdo e acrescentou verificações para detectar e reter saídas em streaming que pudessem expor o raciocínio [1].
O The Hacker News afirma que a OpenAI não apresentou evidências técnicas para a atribuição à Moonshot AI, empresa sediada em Pequim, citando razões de segurança, e que o artigo não traz resposta da Moonshot AI [1]. Também lembra que a Anthropic acusou a Moonshot AI no mês anterior de retransmitir requisições de clientes ao Claude, atividade rastreada como GTG-16002 [1].
O artigo do arXiv relata que os blocos criptografados são totalmente compatíveis e intercambiáveis entre sessões, usuários e modelos diferentes, e demonstra quatro ataques: destilação de modelo pela injeção de rastros criptografados em modelos mais fracos, extração de dados, exposição de conteúdo perigoso oculto e injeção de prompt invisível em sistemas agênticos [2]. No caso da extração de dados, os autores recuperaram 367 artefatos de dados pessoais e 182 credenciais a partir de 315.320 blocos de raciocínio coletados de repositórios públicos [2]. O artigo afirma que a pesquisa incluiu divulgação responsável e propõe mitigações criptográficas e em nível de sistema [2].
Implicações para usuários de Mac
A campanha teve como alvo as saídas de modelo de um provedor, não os dispositivos de seus usuários, e as fontes não relatam que a conversa de algum usuário tenha sido exposta nela [1]. O artigo é relevante para quem usa agentes de IA porque um de seus quatro ataques é a injeção de prompt invisível em sistemas agênticos e porque ele encontrou credenciais e dados pessoais em blocos de raciocínio que haviam sido publicados em repositórios públicos [2].
Recomendações
- Mantenha as chaves de API de provedores fora de repositórios e de logs compartilhados, e revogue qualquer chave que tenha sido publicada.
- Ao armazenar ou compartilhar logs de sessões de IA, remova blocos de raciocínio e outros campos devolvidos pelo provedor de que o aplicativo não precisa.
- Revise as permissões dadas a um agente de IA, já que o artigo inclui um ataque contra sistemas agênticos.
- Acompanhe os comunicados dos provedores sobre mudanças no tratamento do raciocínio nas APIs em uso.
- Para uma equipe que desenvolve sobre essas APIs, leia as mitigações propostas no artigo antes de projetar o armazenamento de sessões [2].
Relevância para o FireAI
O FireAI não opera nem protege uma API de modelo. Em um Mac, ele identifica um app pela assinatura de código e aplica regras por app a cada conexão, e o perfil de agente sinaliza um destino inédito ou um pico de envio de apps de agentes como Claude Code e Cursor, usando apenas nomes de host e contagens de bytes. O próprio modelo de IA no dispositivo opcional do FireAI é baixado uma única vez da Hugging Face e depois roda apenas no Mac.
O FireAI não enxerga dentro de uma conexão criptografada, de modo que não consegue ler um bloco de raciocínio, um prompt nem uma resposta de modelo. Ele não detecta destilação, não controla o que um provedor devolve e não impede que uma conta autorizada envie requisições a uma API.
Limitações
O relato da campanha se apoia no resumo do The Hacker News sobre a declaração da OpenAI, que este item não conseguiu obter diretamente [1]. A atribuição à Moonshot AI é uma avaliação da OpenAI, sem evidências técnicas publicadas. O artigo é um preprint; este item se baseou em seu resumo e não verificou seus resultados de forma independente [2]. As fontes não informam quais provedores alteraram suas APIs além das medidas da OpenAI listadas.
Experimente o FireAI, da HisnLabs grátis por 17 dias.