The Hacker News informó el 1 de octubre de 2026 que OpenAI había desarticulado una campaña coordinada de destilación dirigida al razonamiento protegido de sus modelos, y que OpenAI atribuyó un núcleo de esa actividad a personas vinculadas con Moonshot AI [1]. Un artículo de investigación enviado a arXiv el 10 de agosto de 2026 describe la debilidad de fondo: trazas de razonamiento cifradas que son intercambiables entre sesiones, usuarios y modelos [2]. La nota trata sobre la seguridad de las API de modelos de lenguaje, a las que muchos usuarios de Mac llegan a través de apps y agentes.
Contexto
El artículo explica que los principales proveedores de LLM devuelven el razonamiento paso a paso de un modelo como bloques de texto cifrado, que el cliente reenvía con cada solicitud posterior [2]. La destilación, tal como la describe The Hacker News, es la extracción sistemática de las salidas de un modelo para entrenar o mejorar otro modelo [1].
Hallazgos
Según el reporte, la actividad empezó el 1 de julio de 2026 con un volumen bajo, alcanzó su punto máximo el 24 y 25 de julio con 16,000 solicitudes que usaban un patrón de extracción desde más de 4,000 usuarios distintos, y quedó desarticulada por completo el 28 de julio de 2026 [1]. Se detectó actividad relacionada con patrones de prompts en más de 15,000 usuarios distintos [1].
El reporte cita a OpenAI afirmando que los operadores no rompieron su cifrado, no comprometieron ninguna base de datos ni obtuvieron acceso directo a conversaciones guardadas de usuarios, sino que manipularon las interacciones con el modelo para que el razonamiento protegido pudiera reproducirse en formas visibles para quien lo solicitaba [1]. OpenAI suspendió las cuentas fraudulentas involucradas, cerró una vía que permitía a los usuarios reenviar razonamiento cifrado para recuperar su contenido y agregó comprobaciones para detectar y retener la salida transmitida que pudiera exponer razonamiento [1].
The Hacker News indica que OpenAI no aportó pruebas técnicas de la atribución a Moonshot AI, una empresa con sede en Pekín, por motivos de seguridad, y que el artículo no incluye una respuesta de Moonshot AI [1]. También recuerda que Anthropic acusó a Moonshot AI el mes anterior de retransmitir solicitudes de clientes a Claude, una actividad registrada como GTG-16002 [1].
El artículo de arXiv reporta que los bloques cifrados son totalmente compatibles e intercambiables entre distintas sesiones, usuarios y modelos, y demuestra cuatro ataques: destilación de modelos inyectando trazas cifradas en modelos más débiles, extracción de datos, exposición de contenido peligroso oculto e inyección de prompts invisible en sistemas agénticos [2]. En el caso de extracción de datos, los autores recuperaron 367 elementos de datos personales identificables y 182 credenciales a partir de 315,320 bloques de razonamiento extraídos de repositorios públicos [2]. El artículo indica que la investigación incluyó una divulgación responsable y propone mitigaciones criptográficas y a nivel de sistema [2].
Implicaciones para usuarios de Mac
La campaña tenía como objetivo las salidas de los modelos de un proveedor, no los dispositivos de sus usuarios, y las fuentes no reportan que se haya expuesto la conversación de ningún usuario [1]. El artículo es relevante para quienes usan agentes de IA porque uno de sus cuatro ataques es la inyección de prompts invisible en sistemas agénticos, y porque encontró credenciales y datos personales en bloques de razonamiento que se habían publicado en repositorios públicos [2].
Recomendaciones
- Mantén las claves de API de los proveedores fuera de los repositorios y de los registros compartidos, y revoca cualquier clave que se haya publicado.
- Al guardar o compartir registros de sesiones de IA, quita los bloques de razonamiento y otros campos devueltos por el proveedor que la aplicación no necesite.
- Revisa los permisos que le das a un agente de IA, ya que el artículo incluye un ataque contra sistemas agénticos.
- Sigue los anuncios de los proveedores sobre cambios en el manejo del razonamiento en las API que usas.
- Si tu equipo desarrolla sobre estas API, lee las mitigaciones que propone el artículo antes de diseñar el almacenamiento de sesiones [2].
Relevancia para FireAI
FireAI no opera ni protege una API de modelos. En una Mac, identifica una app por su firma de código y aplica reglas por app a cada conexión, y el Perfil de agente marca un destino nunca antes visto o un pico de subida en apps de agentes como Claude Code y Cursor, usando solo nombres de host y conteos de bytes. El modelo de IA en el dispositivo, opcional, de FireAI se descarga una sola vez de Hugging Face y después se ejecuta solo en la Mac.
FireAI no ve el interior de una conexión cifrada, así que no puede leer un bloque de razonamiento, un prompt ni una respuesta del modelo. No detecta la destilación, no controla lo que devuelve un proveedor y no impide que una cuenta autorizada envíe solicitudes a una API.
Limitaciones
El relato de la campaña se basa en el resumen de The Hacker News de la declaración de OpenAI, que esta nota no pudo consultar directamente [1]. La atribución a Moonshot AI es una evaluación de OpenAI sin pruebas técnicas publicadas. El artículo es un preprint; esta nota se basó en su resumen y no verificó sus resultados de forma independiente [2]. Las fuentes no indican qué proveedores han cambiado sus API además de las medidas de OpenAI mencionadas.
Prueba FireAI, de HisnLabs gratis durante 17 días.