Seguridad y privacidad

OpenAI desmantela campaña de extracción de razonamiento vinculada a Moonshot AI

OpenAI bloqueó un esfuerzo coordinado para extraer trazas de razonamiento protegidas de sus modelos, atribuyendo la actividad a asociados de la firma china Moonshot AI.

Traducido automáticamente del original en inglés.

OpenAI identificó y desmanteló una campaña a gran escala diseñada para extraer ilícitamente datos de razonamiento protegidos de sus modelos de inteligencia artificial. La empresa atribuyó el núcleo de esta actividad a individuos asociados con Moonshot AI, un competidor con sede en Pekín, y interrumpió por completo la operación a finales de julio de 2026.

Qué ocurrió

La campaña comenzó el 1 de julio de 2026, iniciando con intentos de bajo volumen que se fueron escalando gradualmente. Para el 24 y 25 de julio, la actividad aumentó significativamente, con más de 4.000 usuarios generando aproximadamente 16.000 solicitudes de intento utilizando patrones específicos de extracción. Una investigación posterior reveló que la actividad relacionada con patrones de prompts involucró a más de 15.000 usuarios en toda la plataforma. OpenAI interrumpió completamente la campaña el 28 de julio de 2026, prohibiendo las cuentas fraudulentas implicadas.

OpenAI declaró que los operadores no rompieron el cifrado, comprometieron bases de datos ni obtuvieron acceso directo a conversaciones de usuario almacenadas. En su lugar, manipularon las interacciones con el modelo para reproducir el razonamiento protegido en formas visibles para el solicitante. Este método violó los términos de servicio de la empresa y fue caracterizado como destilación adversarial, lo cual implica el uso sistemático y no autorizado de las salidas de un modelo para entrenar o mejorar otro modelo.

Este incidente sigue a acusaciones previas contra Moonshot AI. El mes pasado, Anthropic acusó a la empresa de retransmitir furtivamente solicitudes de clientes a su modelo Claude en lugar de procesarlos con su propio modelo Kimi, presuntamente reteniendo algunos intercambios para entrenar sus capacidades de cadena de pensamiento (chain-of-thought). La actividad actual ha sido rastreada bajo el nombre GTG-16002.

Cómo funciona

El ataque aprovechó una vulnerabilidad arquitectónica detallada en un estudio publicado en agosto de 2026 por investigadores de MATS Research, ELLIS Institute Tübingen y Synk. El estudio encontró que las trazas de razonamiento cifradas eran totalmente compatibles e intercambiables entre diferentes sesiones, usuarios y modelos dentro del ecosistema de un proveedor. Esta falla técnica permitió a los atacantes desarrollar un jailbreak de descifrado escalable.

Al inyectar una traza de razonamiento cifrada de un modelo potente en un modelo más débil y menos protegido del mismo proveedor, los atacantes podían forzar al modelo más débil a decodificar y emitir la traza en texto plano. Este proceso evitaba la necesidad de hacer un jailbreak directamente al modelo más capaz. La técnica también permitía la extracción de datos privados a gran escala y inyecciones de prompts invisibles mediante la incrustación de cargas útiles maliciosas dentro de bloques cifrados.

Detalles clave

  • La campaña se ejecutó del 1 al 28 de julio de 2026, con un pico importante los días 24-25 de julio que involucró 16.000 intentos de más de 4.000 usuarios.
  • OpenAI atribuyó la actividad principal a individuos asociados con Moonshot AI, pero no citó evidencia técnica específica para esta atribución.
  • El método de ataque implicó manipular las interacciones con el modelo en lugar de romper el cifrado o comprometer bases de datos.
  • Un estudio relacionado reveló que las trazas de razonamiento cifradas eran intercambiables entre modelos, permitiendo a los modelos más débiles decodificar trazas de los más fuertes.
  • OpenAI cerró la vía que permitía reproducir el razonamiento cifrado para recuperar contenidos y añadió comprobaciones para detectar razonamiento expuesto en la salida transmitida (streamed output).
  • La actividad está registrada como GTG-16002 y sigue a acusaciones previas de destilación contra Moonshot AI por parte de Anthropic.

Por qué importa

Para ingenieros de software y desarrolladores de IA, este incidente destaca la fragilidad de las salvaguardas actuales alrededor del razonamiento de los modelos. Las trazas de razonamiento protegidas ofrecen información sobre cómo un modelo procesa tareas, y extraerlas puede revelar datos sensibles o ayudar a reproducir capacidades sin las inversiones originales en seguridad. Como señaló OpenAI, la destilación adversarial plantea riesgos de seguridad y de seguridad nacional porque el razonamiento extraído puede usarse para entrenar otros modelos sin preservar las salvaguardas originales.

La vulnerabilidad también demuestra que la seguridad no se trata solo de prevenir el acceso directo, sino también de gestionar cómo interactúan los modelos dentro de un ecosistema. Si los datos cifrados son intercambiables entre modelos, una debilidad en un modelo menos protegido puede comprometer todo el sistema. Esto tiene implicaciones para cómo los proveedores diseñan las arquitecturas de los modelos y manejan los flujos de datos cifrados, especialmente a medida que los modelos ganan capacidades en dominios de doble uso.

Qué puedes hacer

  • Monitoriza patrones de solicitud anormales que puedan indicar intentos de extracción de razonamiento.
  • Revisa tus propios sistemas de defensa contra ataques de destilación adversarial si utilizas APIs de modelos avanzados.
  • Mantente informado sobre las actualizaciones de seguridad de los proveedores de IA respecto a la protección de trazas de razonamiento.
  • Considera implementar validaciones adicionales en tus integraciones para detectar anomalías en las respuestas de los modelos.
  • Evalúa tu exposición a riesgos de propiedad intelectual derivados de posibles filtraciones de lógica interna de los modelos.

Herramientas de la Tienda de Bytechap

Seguir leyendo

Todos los artículos