The Hacker News a rapporté le 1er octobre 2026 qu'OpenAI avait neutralisé une campagne de distillation coordonnée visant le raisonnement protégé de ses modèles, et qu'OpenAI attribuait un noyau central de cette activité à des personnes associées à Moonshot AI [1]. Un article de recherche soumis à arXiv le 10 août 2026 décrit la faiblesse sous-jacente : des traces de raisonnement chiffrées interchangeables entre sessions, utilisateurs et modèles [2]. Cet article porte sur la sécurité des API de modèles de langage, que de nombreux utilisateurs de Mac atteignent par l'intermédiaire d'apps et d'agents.
Contexte
L'article de recherche explique que les principaux fournisseurs de LLM renvoient le raisonnement pas à pas d'un modèle sous forme de blocs de texte chiffré, que le client retransmet à chaque requête suivante [2]. La distillation, telle que la décrit The Hacker News, est l'extraction systématique des sorties d'un modèle pour entraîner ou améliorer un autre modèle [1].
Constatations
Selon le rapport, l'activité a débuté le 1er juillet 2026 à faible volume, a culminé les 24 et 25 juillet avec 16 000 requêtes tentées selon un schéma d'extraction, émanant de plus de 4 000 utilisateurs distincts, et a été entièrement neutralisée le 28 juillet 2026 [1]. Une activité apparentée, reposant sur des schémas de prompts, a été détectée chez plus de 15 000 utilisateurs distincts [1].
Le rapport cite OpenAI, qui déclare que les opérateurs n'ont pas brisé son chiffrement, compromis une base de données ni obtenu d'accès direct aux conversations d'utilisateurs stockées, et ont à la place manipulé les interactions avec le modèle afin que le raisonnement protégé puisse être reproduit sous des formes visibles du demandeur [1]. OpenAI a banni les comptes frauduleux concernés, fermé une voie permettant aux utilisateurs de rejouer un raisonnement chiffré pour en récupérer le contenu, et ajouté des contrôles pour détecter et retenir les sorties en flux susceptibles de révéler un raisonnement [1].
The Hacker News précise qu'OpenAI n'a fourni aucune preuve technique de l'attribution à Moonshot AI, société basée à Pékin, invoquant des raisons de sécurité, et que l'article ne contient aucune réponse de Moonshot AI [1]. Il rappelle aussi qu'Anthropic avait accusé Moonshot AI le mois précédent de relayer des requêtes de clients vers Claude, une activité suivie sous l'identifiant GTG-16002 [1].
L'article arXiv indique que les blocs chiffrés sont pleinement compatibles et interchangeables entre différentes sessions, différents utilisateurs et différents modèles, et démontre quatre attaques : la distillation de modèle par injection de traces chiffrées dans des modèles plus faibles, l'extraction de données, l'exposition de contenus dangereux cachés et l'injection de prompt invisible dans des systèmes agentiques [2]. Dans le cas de l'extraction de données, les auteurs ont récupéré 367 éléments de données personnelles et 182 identifiants à partir de 315 320 blocs de raisonnement collectés dans des dépôts publics [2]. L'article indique que la recherche comprenait une divulgation responsable et propose des mesures d'atténuation cryptographiques et au niveau du système [2].
Conséquences pour les utilisateurs de Mac
La campagne visait les sorties de modèles d'un fournisseur, non les appareils de ses utilisateurs, et les sources ne rapportent pas que la conversation d'un utilisateur ait été exposée à cette occasion [1]. L'article de recherche concerne les utilisateurs d'agents IA parce que l'une de ses quatre attaques est l'injection de prompt invisible dans des systèmes agentiques, et parce qu'il a trouvé des identifiants et des données personnelles dans des blocs de raisonnement publiés dans des dépôts publics [2].
Recommandations
- Gardez les clés d'API des fournisseurs hors des dépôts et des journaux partagés, et révoquez toute clé qui a été publiée.
- Lorsque vous stockez ou partagez des journaux de sessions d'IA, supprimez les blocs de raisonnement et les autres champs renvoyés par le fournisseur dont l'application n'a pas besoin.
- Passez en revue les permissions accordées à un agent IA, l'article incluant une attaque contre des systèmes agentiques.
- Suivez les annonces des fournisseurs sur les changements de traitement du raisonnement dans les API utilisées.
- Pour une équipe qui construit sur ces API, lisez les mesures d'atténuation proposées dans l'article avant de concevoir le stockage des sessions [2].
Pertinence pour FireAI
FireAI n'exploite ni ne protège aucune API de modèle. Sur un Mac, il identifie une app par sa signature de code et applique des règles par app à chaque connexion, et le profil Agent signale une première destination ou un pic d'envoi émanant d'apps d'agents telles que Claude Code et Cursor, en n'utilisant que des noms d'hôtes et des volumes d'octets. Le modèle d'IA embarqué facultatif de FireAI est téléchargé une seule fois depuis Hugging Face, puis s'exécute uniquement sur le Mac.
FireAI ne voit pas l'intérieur d'une connexion chiffrée ; il ne peut donc lire ni un bloc de raisonnement, ni un prompt, ni une réponse de modèle. Il ne détecte pas la distillation, ne contrôle pas ce qu'un fournisseur renvoie et n'empêche pas un compte autorisé d'envoyer des requêtes à une API.
Limites
Le récit de la campagne repose sur le résumé que The Hacker News donne de la déclaration d'OpenAI, que cet article n'a pas pu consulter directement [1]. L'attribution à Moonshot AI est l'évaluation d'OpenAI, sans preuve technique publiée. L'article de recherche est une prépublication ; cet article s'est appuyé sur son résumé et n'a pas vérifié ses résultats de façon indépendante [2]. Les sources ne précisent pas quels fournisseurs ont modifié leurs API au-delà des mesures d'OpenAI énumérées.
Essayez FireAI, par HisnLabs gratuitement pendant 17 jours.