Notícias sobre segurança e IA

Segurança de agentes de IA · Por FireAI Security & Research Team · Publicado

A OpenAI descreve injeções de prompt autorreplicantes, um ataque em estilo de worm contra agentes de IA

A OpenAI relata injeções de prompt que fazem um agente de IA copiar o ataque para as próprias saídas, encontradas apenas em ambientes de treinamento. O que é relatado e o que isso significa para usuários de Mac.

Chat bubbles duplicating from one to the next, illustrating a self-replicating prompt injection spreading between AI agents.

A OpenAI relatou em 25 de setembro de 2026 que alguns de seus modelos podem ser manipulados por uma injeção de prompt que também faz o modelo copiar a injeção para as próprias saídas, o que a OpenAI compara a um worm. A empresa diz ter encontrado o comportamento em ambientes simulados de ferramentas e não ter visto nenhum incidente fora deles [1] [2].

Contexto

Uma injeção de prompt é um texto colocado em um conteúdo que um agente de IA lê, como um e-mail ou uma planilha, e que o agente passa a tratar como uma instrução. Um worm de computador é um programa que se copia de um sistema para o seguinte. A OpenAI usa o termo injeção de prompt autorreplicante para uma injeção cujo objetivo inclui fazer o modelo-alvo reproduzi-la, de modo que o próximo agente que ler a saída a receba também [2].

O que o relatório descreve

A página de pesquisa da OpenAI indica 27 de junho de 2026 como a data da descoberta e 25 de setembro de 2026 como a data da divulgação, e chama de GPT-Red o agente de red teaming da equipe. Ela diz que os modelos afetados eram checkpoints internos do GPT-5.4-mini e do GPT-5.5, que nenhum impacto externo foi observado e que os efeitos ficaram restritos a ambientes simulados de ferramentas [2]. O The Register, que noticiou a pesquisa em 29 de setembro de 2026, escreve que a OpenAI encontrou o comportamento ao usar o GPT-Red para treinar o GPT-5.6 de forma adversarial [1].

São dados três exemplos. No caso do e-mail, uma instrução injetada manda o modelo incluir o texto malicioso em todas as mensagens enviadas; a OpenAI diz que ela estava disfarçada de regra de arquivamento que pedia respostas em espanhol e a citação integral do e-mail [2]. Em um caso baseado em arquivos, um falso aviso de sistema convence o modelo a apagar arquivos e depois gravar o texto do ataque em arquivos do espaço de trabalho, para que ele persista [2]. O The Register descreve o segundo exemplo como um falso aviso dentro de dados do Excel [1]. No caso de múltiplos saltos, o modelo é conduzido por uma série de leituras de canais do Slack, todas aparentemente legítimas, rumo a ações não autorizadas, enquanto as instruções são repetidas entre plataformas [2].

Como resposta, a OpenAI afirma que está incluindo a autorreprodução entre os objetivos do atacante no treinamento do GPT-Red e espera que os modelos futuros a serem lançados sejam mais robustos contra esses ataques [2] [1]. O The Register cita a OpenAI dizendo ter encontrado casos em que seus modelos GPT eram suscetíveis a "uma versão de ataque de worm para a IA" [1].

Implicações para usuários de Mac

O relatório trata de agentes que leem conteúdo de várias fontes e podem agir com base nele, e o exemplo do e-mail mostra o caminho mais claro: um agente que pode ler e enviar e-mails recebe uma mensagem que o manda encaminhar a instrução [2]. Um usuário de Mac só é afetado se executar um agente desse tipo com acesso a e-mail, arquivos ou chat. O relatório afirma que nenhum incidente no mundo real foi observado; trata-se, portanto, de uma capacidade documentada em condições de teste, não de um ataque relatado [1] [2].

Recomendações

  1. Limite o que um agente que lê conteúdo não confiável pode fazer. Um agente que lê e-mails não deveria também poder enviá-los ou apagar arquivos sem uma etapa de confirmação.
  2. Trate o texto de e-mails, documentos compartilhados e canais de chat como não confiável, mesmo quando parecer um aviso do sistema ou uma regra da casa [2].
  3. Revise as mensagens enviadas e as alterações de arquivos feitas por um agente, sobretudo quando contêm texto que o usuário não escreveu.
  4. Mantenha o acesso do agente a contas e pastas restrito e retire-o quando deixar de ser necessário.

Relevância para o FireAI

O FireAI atua na camada de rede do Mac e não lê prompts, e-mails nem o conteúdo de conexões criptografadas; por isso, não reconhece uma injeção de prompt nem impede que um modelo a copie. Ele também não controla o que um serviço de IA faz em seus próprios servidores. Para um app de agente no Mac, o filtro de rede identifica o app pela assinatura de código e um app sem regra dispara um aviso, as regras por app podem restringir para onde ele pode se conectar, e o Investigar mostra para onde vai uma conexão.

Limitações

Os dois relatos se apoiam na pesquisa da própria OpenAI, e o artigo do arXiv para o qual o The Register aponta não foi obtido para este item. As fontes divergem em detalhes: a OpenAI cita checkpoints internos do GPT-5.4-mini e do GPT-5.5, enquanto o The Register menciona o treinamento do GPT-5.6, e o The Register descreve um conjunto de dados do Excel onde a página da OpenAI descreve um caso de sistema de arquivos [1] [2]. Nenhuma das fontes informa com que frequência os ataques tiveram êxito, se produtos já lançados são afetados ou se agentes baseados em outros modelos, que não os da OpenAI, se comportam da mesma forma.

Experimente o FireAI, da HisnLabs grátis por 17 dias.

Fontes

  1. The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections
  2. OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist