# OpenAI desarticula una campaña de extracción de razonamiento que abusaba de trazas de razonamiento cifradas intercambiables

> OpenAI informa de que desarticuló una campaña de destilación el 28 de julio de 2026, y un artículo de investigación muestra que las trazas de razonamiento cifradas de las API de LLM son intercambiables entre usuarios.

FireAI Security & Research Team (HisnLabs) · Published 2026-10-03
Canonical: https://hisnlabs.com/es/news/openai-disrupts-reasoning-extraction-campaign-encrypted-traces

The Hacker News informó el 1 de octubre de 2026 de que OpenAI había desarticulado una campaña coordinada de destilación dirigida al razonamiento protegido de sus modelos, y de que OpenAI atribuyó un núcleo de la actividad a personas asociadas con Moonshot AI [[1]](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html). Un artículo de investigación enviado a arXiv el 10 de agosto de 2026 describe la debilidad de fondo: trazas de razonamiento cifradas que son intercambiables entre sesiones, usuarios y modelos [[2]](https://arxiv.org/abs/2608.09867). La noticia trata de la seguridad de las API de modelos de lenguaje, a las que muchos usuarios de Mac acceden mediante apps y agentes.

## Contexto

El artículo explica que los principales proveedores de LLM devuelven el razonamiento paso a paso de un modelo en bloques de texto cifrado, que el cliente reenvía con cada solicitud posterior [[2]](https://arxiv.org/abs/2608.09867). La destilación, tal como la describe The Hacker News, es la extracción sistemática de las salidas de un modelo para entrenar o mejorar otro [[1]](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html).

## Hallazgos

Según el reportaje, la actividad comenzó el 1 de julio de 2026 con un volumen bajo, alcanzó su máximo los días 24 y 25 de julio con 16.000 solicitudes intentadas con un patrón de extracción procedentes de más de 4.000 usuarios distintos, y quedó totalmente desarticulada el 28 de julio de 2026 [[1]](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html). Se detectó actividad con patrones de prompt relacionados en más de 15.000 usuarios distintos [[1]](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html).

El reportaje cita a OpenAI cuando afirma que los operadores no rompieron su cifrado, no comprometieron una base de datos ni obtuvieron acceso directo a conversaciones de usuarios almacenadas, sino que manipularon las interacciones con el modelo para que el razonamiento protegido pudiera reproducirse en formas visibles para quien lo solicitaba [[1]](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html). OpenAI bloqueó las cuentas fraudulentas implicadas, cerró una vía que permitía a los usuarios reproducir el razonamiento cifrado para recuperar su contenido y añadió comprobaciones para detectar y retener la salida en flujo que pudiera exponer razonamiento [[1]](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html).

The Hacker News indica que OpenAI no aportó pruebas técnicas de la atribución a Moonshot AI, una empresa con sede en Pekín, alegando motivos de seguridad, y que el artículo no contiene respuesta de Moonshot AI [[1]](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html). También recuerda que Anthropic acusó a Moonshot AI el mes anterior de reenviar solicitudes de clientes a Claude, una actividad registrada como GTG-16002 [[1]](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html).

El artículo de arXiv señala que los bloques cifrados son plenamente compatibles e intercambiables entre distintas sesiones, usuarios y modelos, y demuestra cuatro ataques: destilación de modelos mediante la inyección de trazas cifradas en modelos más débiles, extracción de datos, exposición de contenido peligroso oculto e inyección de prompt invisible en sistemas con agentes [[2]](https://arxiv.org/abs/2608.09867). En el caso de la extracción de datos, los autores recuperaron 367 elementos de información personal y 182 credenciales a partir de 315.320 bloques de razonamiento extraídos de repositorios públicos [[2]](https://arxiv.org/abs/2608.09867). El artículo indica que la investigación incluyó una divulgación responsable y propone mitigaciones criptográficas y a nivel de sistema [[2]](https://arxiv.org/abs/2608.09867).

> FireAI, el firewall en el dispositivo para macOS desarrollado por HisnLabs, incluye un modelo de IA opcional que se ejecuta solo en el Mac tras una descarga única. Hay una prueba de 17 días. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Implicaciones para los usuarios de Mac

La campaña tenía como objetivo las salidas de los modelos de un proveedor, no los dispositivos de sus usuarios, y las fuentes no informan de que la conversación de ningún usuario quedara expuesta en ella [[1]](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html). El artículo es relevante para quienes usan agentes de IA porque uno de sus cuatro ataques es la inyección de prompt invisible en sistemas con agentes, y porque halló credenciales y datos personales en bloques de razonamiento que se habían publicado en repositorios públicos [[2]](https://arxiv.org/abs/2608.09867).

## Recomendaciones

1. Mantenga las claves de API de los proveedores fuera de los repositorios y de los registros compartidos, y revoque cualquier clave que se haya publicado.
2. Al almacenar o compartir registros de sesiones de IA, elimine los bloques de razonamiento y otros campos devueltos por el proveedor que la aplicación no necesite.
3. Revise los permisos concedidos a un agente de IA, ya que el artículo incluye un ataque contra sistemas con agentes.
4. Siga los anuncios de los proveedores sobre cambios en el tratamiento del razonamiento en las API que use.
5. Si un equipo desarrolla sobre estas API, lea las mitigaciones propuestas en el artículo antes de diseñar el almacenamiento de sesiones [[2]](https://arxiv.org/abs/2608.09867).

## Relevancia para FireAI

FireAI no opera ni protege una API de modelos. En un Mac, identifica una app por su firma de código y aplica [reglas por app](https://hisnlabs.com/es/docs/per-app-rules) a cada conexión, y el [perfil de agente](https://hisnlabs.com/es/docs/agent-profile) señala un primer destino nunca visto o un pico de subida de apps de agente como Claude Code y Cursor, usando solo nombres de host y recuentos de bytes. El propio [modelo de IA en el dispositivo](https://hisnlabs.com/es/docs/on-device-ai-model) opcional de FireAI se descarga una vez desde Hugging Face y después se ejecuta solo en el Mac.

FireAI no ve el interior de una conexión cifrada, de modo que no puede leer un bloque de razonamiento, un prompt ni una respuesta del modelo. No detecta la destilación, no controla lo que devuelve un proveedor y no impide que una cuenta autorizada envíe solicitudes a una API.

> A una API de modelos se llega por la red como a cualquier otro servicio. FireAI pregunta antes de que una app contacte con un destino para el que no tiene regla y conserva la lista de lo que alcanzó cada app. Pruébelo gratis durante 17 días. [Download FireAI for Mac](https://hisnlabs.com/en/download)

## Limitaciones

El relato de la campaña se apoya en el resumen de The Hacker News de una declaración de OpenAI, que esta noticia no pudo consultar directamente [[1]](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html). La atribución a Moonshot AI es una valoración de OpenAI sin pruebas técnicas publicadas. El artículo es un preprint; esta noticia se basó en su resumen y no verificó sus resultados de forma independiente [[2]](https://arxiv.org/abs/2608.09867). Las fuentes no indican qué proveedores han cambiado sus API más allá de las medidas de OpenAI enumeradas.

Pruebe [FireAI, de HisnLabs](https://hisnlabs.com/es/download) gratis durante 17 días.

## Sources

- [The Hacker News, 1 October 2026: OpenAI disrupts reasoning extraction campaign linked to Moonshot AI associates](https://thehackernews.com/2026/10/openai-disrupts-reasoning-extraction.html)
- [arXiv, 10 August 2026: Stealing Reasoning Traces from Proprietary LLM APIs (Panfilov et al.)](https://arxiv.org/abs/2608.09867)
