O The Hacker News noticiou a 1 de outubro de 2026 que a OpenAI tinha interrompido uma campanha coordenada de destilação dirigida ao raciocínio protegido dos seus modelos, e que a OpenAI atribuiu um núcleo da atividade a pessoas associadas à Moonshot AI [1]. Um artigo de investigação submetido ao arXiv a 10 de agosto de 2026 descreve a fragilidade subjacente: rastos de raciocínio cifrados que são intercambiáveis entre sessões, utilizadores e modelos [2]. O tema é a segurança das APIs de modelos de linguagem, a que muitos utilizadores de Mac acedem através de apps e agentes.
Contexto
O artigo explica que os principais fornecedores de LLM devolvem o raciocínio passo a passo de um modelo sob a forma de blocos de texto cifrado, que o cliente reenvia a cada pedido subsequente [2]. A destilação, tal como o The Hacker News a descreve, é a extração sistemática das respostas de um modelo para treinar ou melhorar outro modelo [1].
Conclusões
Segundo o relato, a atividade começou a 1 de julho de 2026 com baixo volume, atingiu o pico a 24 e 25 de julho com 16 000 pedidos tentados que seguiam um padrão de extração, provenientes de mais de 4 000 utilizadores distintos, e foi totalmente interrompida a 28 de julho de 2026 [1]. Foi detetada atividade com padrões de prompt relacionados em mais de 15 000 utilizadores distintos [1].
O relato cita a OpenAI ao afirmar que os operadores não quebraram a sua cifragem, não comprometeram uma base de dados nem obtiveram acesso direto a conversas de utilizadores armazenadas, e que manipularam as interações com os modelos para que o raciocínio protegido pudesse ser reproduzido em formas visíveis para quem fazia o pedido [1]. A OpenAI baniu as contas fraudulentas envolvidas, fechou uma via que permitia aos utilizadores reenviar raciocínio cifrado para recuperar o seu conteúdo e acrescentou verificações para detetar e reter respostas em fluxo que possam expor raciocínio [1].
O The Hacker News indica que a OpenAI não apresentou provas técnicas da atribuição à Moonshot AI, uma empresa sediada em Pequim, invocando razões de segurança, e que o artigo não contém resposta da Moonshot AI [1]. Recorda também que a Anthropic acusou a Moonshot AI, no mês anterior, de retransmitir pedidos de clientes ao Claude, uma atividade identificada como GTG-16002 [1].
O artigo do arXiv relata que os blocos cifrados são totalmente compatíveis e intercambiáveis entre diferentes sessões, utilizadores e modelos, e demonstra quatro ataques: destilação de modelos através da injeção de rastos cifrados em modelos mais fracos, extração de dados, exposição de conteúdo perigoso oculto e injeção de prompt invisível em sistemas com agentes [2]. No caso da extração de dados, os autores recuperaram 367 artefactos com dados pessoais e 182 credenciais a partir de 315 320 blocos de raciocínio recolhidos em repositórios públicos [2]. O artigo afirma que a investigação incluiu divulgação responsável e propõe mitigações criptográficas e ao nível do sistema [2].
Implicações para os utilizadores de Mac
A campanha visou as respostas dos modelos de um fornecedor, não os dispositivos dos seus utilizadores, e as fontes não referem que a conversa de algum utilizador tenha sido exposta [1]. O artigo é relevante para quem usa agentes de IA porque um dos seus quatro ataques é a injeção de prompt invisível em sistemas com agentes, e porque encontrou credenciais e dados pessoais em blocos de raciocínio que tinham sido publicados em repositórios públicos [2].
Recomendações
- Manter as chaves de API dos fornecedores fora de repositórios e de registos partilhados, e revogar qualquer chave que tenha sido publicada.
- Ao guardar ou partilhar registos de sessões de IA, remover os blocos de raciocínio e outros campos devolvidos pelo fornecedor de que a aplicação não precisa.
- Rever as permissões atribuídas a um agente de IA, uma vez que o artigo inclui um ataque contra sistemas com agentes.
- Acompanhar os anúncios dos fornecedores sobre alterações ao tratamento do raciocínio nas APIs em uso.
- Para uma equipa que desenvolve sobre estas APIs, ler as mitigações propostas no artigo antes de definir o armazenamento de sessões [2].
Relevância para a FireAI
A FireAI não opera nem protege uma API de modelos. Num Mac, identifica uma app pela sua assinatura de código e aplica regras por app a cada ligação, e o perfil de agente assinala um primeiro destino nunca visto ou um pico de envio por parte de apps de agentes como o Claude Code e o Cursor, usando apenas nomes de anfitrião e contagens de bytes. O próprio modelo de IA no dispositivo da FireAI, opcional, é transferido uma só vez da Hugging Face e depois funciona apenas no Mac.
A FireAI não vê o interior de uma ligação cifrada, pelo que não consegue ler um bloco de raciocínio, um prompt ou uma resposta de um modelo. Não deteta destilação, não controla o que um fornecedor devolve e não impede uma conta autorizada de enviar pedidos a uma API.
Limitações
O relato da campanha assenta no resumo que o The Hacker News faz da declaração da OpenAI, que esta nota não conseguiu obter diretamente [1]. A atribuição à Moonshot AI é uma avaliação da OpenAI, sem provas técnicas publicadas. O artigo é uma pré-publicação; esta nota baseou-se no seu resumo e não verificou os resultados de forma independente [2]. As fontes não indicam que fornecedores alteraram as suas APIs para além das medidas da OpenAI listadas.
Experimente a FireAI, da HisnLabs gratuitamente durante 17 dias.