Actualités sécurité et IA

Sécurité des agents IA · Par FireAI Security & Research Team · Publié

OpenAI décrit les injections de prompt auto-réplicantes, une attaque de type ver contre les agents IA

OpenAI signale des injections de prompt qui poussent un agent IA à recopier l'attaque dans ses propres sorties, observées uniquement dans des environnements d'entraînement. Ce qui est rapporté et ce que cela signifie pour les utilisateurs de Mac.

Chat bubbles duplicating from one to the next, illustrating a self-replicating prompt injection spreading between AI agents.

OpenAI a rapporté le 25 septembre 2026 que certains de ses modèles peuvent être manipulés par une injection de prompt qui amène aussi le modèle à recopier l'injection dans ses propres sorties, ce qu'OpenAI compare à un ver. L'entreprise dit avoir constaté ce comportement dans des environnements d'outils simulés et n'avoir observé aucun incident en dehors d'eux [1] [2].

Contexte

Une injection de prompt est un texte placé dans un contenu qu'un agent IA lit, comme un e-mail ou une feuille de calcul, et que l'agent traite ensuite comme une instruction. Un ver informatique est un programme qui se copie lui-même d'un système à l'autre. OpenAI emploie l'expression injection de prompt auto-réplicante pour désigner une injection dont l'objectif consiste notamment à faire reproduire l'injection par le modèle ciblé, de sorte que l'agent suivant qui lit la sortie la reçoive à son tour [2].

Ce que décrit le rapport

La page de recherche d'OpenAI donne le 27 juin 2026 comme date de découverte et le 25 septembre 2026 comme date de divulgation, et nomme GPT-Red l'agent de red teaming de l'équipe. Elle indique que les modèles concernés étaient des checkpoints internes de GPT-5.4-mini et de GPT-5.5, qu'aucun impact externe n'a été observé et que les effets se sont limités à des environnements d'outils simulés [2]. The Register, qui a rapporté ces recherches le 29 septembre 2026, écrit qu'OpenAI a découvert ce comportement en utilisant GPT-Red pour entraîner GPT-5.6 de façon adversariale [1].

Trois exemples sont donnés. Dans le cas de l'e-mail, une instruction injectée dit au modèle d'inclure le texte malveillant dans tous les messages sortants ; OpenAI précise qu'elle était déguisée en règle de classement demandant des réponses en espagnol et la citation intégrale de l'e-mail [2]. Dans un cas fondé sur des fichiers, un faux avertissement système convainc le modèle de supprimer des fichiers puis d'écrire le texte de l'attaque dans des fichiers de l'espace de travail pour qu'il persiste [2]. The Register décrit le deuxième exemple comme un faux avertissement placé dans des données Excel [1]. Dans le cas à sauts multiples, le modèle est orienté, par une série de lectures de canaux dans Slack, chacune d'apparence légitime, vers des actions non autorisées, tandis que les instructions sont répétées d'une plateforme à l'autre [2].

En réponse, OpenAI indique qu'elle intègre l'auto-reproduction parmi les objectifs de l'attaquant dans l'entraînement de GPT-Red, et elle s'attend à ce que les futurs modèles publiés résistent mieux à de telles attaques [2] [1]. The Register cite OpenAI affirmant avoir trouvé des cas où ses modèles GPT étaient sensibles à « une version IA d'une attaque par ver » [1].

Conséquences pour les utilisateurs de Mac

Le rapport concerne des agents qui lisent du contenu provenant de plusieurs sources et peuvent agir en conséquence, l'exemple de l'e-mail montrant le chemin le plus net : un agent capable de lire et d'envoyer du courrier reçoit un message qui lui demande de transmettre l'instruction [2]. Un utilisateur de Mac n'est concerné que s'il fait tourner un tel agent avec un accès à sa messagerie, à ses fichiers ou à ses conversations. Le rapport indique qu'aucun incident réel n'a été observé : il s'agit donc d'une capacité documentée en conditions de test, et non d'une attaque signalée [1] [2].

Recommandations

  1. Limitez ce que peut faire un agent qui lit du contenu non fiable. Un agent qui lit le courrier ne devrait pas pouvoir aussi en envoyer ni supprimer des fichiers sans étape de confirmation.
  2. Considérez comme non fiable le texte des e-mails, des documents partagés et des canaux de discussion, même lorsqu'il ressemble à un avis système ou à une règle interne [2].
  3. Vérifiez les messages sortants et les modifications de fichiers produits par un agent, surtout lorsqu'ils contiennent un texte que l'utilisateur n'a pas écrit.
  4. Gardez l'accès d'un agent à des comptes et à des dossiers aussi étroit que possible, et retirez-le lorsqu'il n'est plus nécessaire.

Pertinence pour FireAI

FireAI agit au niveau réseau du Mac et ne lit ni les prompts, ni les e-mails, ni le contenu des connexions chiffrées : il ne peut donc pas reconnaître une injection de prompt ni empêcher un modèle d'en recopier une. Il ne contrôle pas non plus ce qu'un service d'IA fait sur ses propres serveurs. Pour une app d'agent sur le Mac, le filtre réseau identifie l'app par sa signature de code et une app sans règle déclenche une demande, les règles par app peuvent restreindre les destinations auxquelles elle peut se connecter, et Investiguer montre où mène une connexion.

Limites

Les deux comptes rendus reposent sur les propres recherches d'OpenAI, et l'article arXiv que The Register mentionne par un lien n'a pas été consulté pour cet article. Les sources diffèrent sur certains détails : OpenAI parle de checkpoints internes de GPT-5.4-mini et de GPT-5.5, tandis que The Register évoque l'entraînement de GPT-5.6, et The Register décrit un jeu de données Excel là où la page d'OpenAI décrit un cas de système de fichiers [1] [2]. Aucune des deux sources n'indique à quelle fréquence les attaques réussissaient, si des produits publiés sont concernés, ni si des agents reposant sur d'autres modèles que ceux d'OpenAI se comportent de la même façon.

Essayez FireAI, par HisnLabs gratuitement pendant 17 jours.

Sources

  1. The Register, 29 September 2026: Add one more AI worry to the nightmare scenario: self-replicating prompt injections
  2. OpenAI alignment research, 25 September 2026: Self-replicating prompt injections exist