OpenAI déjoue une campagne d'extraction de raisonnement liée à Moonshot AI
OpenAI a bloqué une tentative coordonnée visant à extraire des traces de raisonnement protégées de ses modèles, attribuant cette activité à des associés de la société chinoise Moonshot AI.
Traduit automatiquement depuis l'original anglais.
OpenAI a identifié et démantelé une campagne à grande échelle conçue pour extraire illicitement des données de raisonnement protégées de ses modèles d'intelligence artificielle. L'entreprise a attribué le cœur de cette activité à des individus liés à Moonshot AI, un concurrent basé à Pékin, et a totalement neutralisé l'opération fin juillet 2026.
Ce qui s'est passé
La campagne a débuté le 1er juillet 2026 par des tentatives à faible volume qui ont progressivement augmenté en intensité. Les 24 et 25 juillet, l'activité a connu un pic significatif, avec plus de 4 000 utilisateurs générant environ 16 000 requêtes tentatives utilisant des motifs d'extraction spécifiques. Une enquête plus approfondie a révélé que les activités liées aux motifs de prompts impliquaient plus de 15 000 utilisateurs sur la plateforme. OpenAI a totalement perturbé la campagne le 28 juillet 2026, en bannissant les comptes frauduleux impliqués.
OpenAI a déclaré que les opérateurs n'avaient pas cassé le chiffrement, compromis les bases de données ou obtenu un accès direct aux conversations stockées des utilisateurs. Au lieu de cela, ils ont manipulé les interactions avec les modèles pour reproduire le raisonnement protégé sous des formes visibles par le demandeur. Cette méthode violait les conditions d'utilisation de l'entreprise et a été qualifiée de distillation adversariale, qui implique l'utilisation systématique et non autorisée des sorties d'un modèle pour entraîner ou améliorer un autre modèle.
Cet incident fait suite à des accusations précédentes contre Moonshot AI. Le mois dernier, Anthropic avait accusé l'entreprise de relayer discrètement les demandes clients vers son modèle Claude au lieu de les traiter avec son propre modèle Kimi, soupçonnant qu'elle conservait certains échanges pour entraîner ses capacités de chaîne de pensée (chain-of-thought). L'activité actuelle est suivie sous le nom de code GTG-16002.
Comment cela fonctionne
L'attaque exploitait une vulnérabilité architecturale détaillée dans une étude publiée en août 2026 par des chercheurs de MATS Research, de l'Institut ELLIS Tübingen et de Synk. L'étude a découvert que les traces de raisonnement chiffrées étaient entièrement compatibles et interchangeables entre différentes sessions, différents utilisateurs et différents modèles au sein de l'écosystème d'un fournisseur. Cette faille technique a permis aux attaquants de développer un jailbreak de déchiffrement évolutif.
En injectant une trace de raisonnement chiffrée provenant d'un modèle puissant dans un modèle plus faible et moins sécurisé du même fournisseur, les attaquants pouvaient forcer le modèle plus faible à décoder et à afficher la trace en clair. Ce processus contournait la nécessité de réaliser directement un jailbreak du modèle le plus performant. La technique permettait également l'extraction massive de données privées et des injections de prompts invisibles en intégrant des charges malveillantes dans des blocs chiffrés.
Détails clés
- La campagne s'est déroulée du 1er au 28 juillet 2026, avec un pic majeur les 24 et 25 juillet impliquant 16 000 tentatives provenant de plus de 4 000 utilisateurs.
- OpenAI a attribué l'activité principale à des individus liés à Moonshot AI, mais n'a pas cité de preuves techniques spécifiques pour cette attribution.
- La méthode d'attaque consistait à manipuler les interactions avec les modèles plutôt qu'à casser le chiffrement ou à compromettre les bases de données.
- Une étude connexe a révélé que les traces de raisonnement chiffrées étaient interchangeables entre les modèles, permettant aux modèles plus faibles de décoder les traces des modèles plus puissants.
- OpenAI a fermé la voie permettant de rejouer le raisonnement chiffré pour récupérer les contenus et a ajouté des vérifications pour détecter le raisonnement exposé dans les flux de sortie.
- L'activité est suivie sous le nom de GTG-16002 et fait suite aux accusations antérieures de distillation portées contre Moonshot AI par Anthropic.
Pourquoi c'est important
Pour les ingénieurs logiciels et les développeurs d'IA, cet incident met en lumière la fragilité des mesures de protection actuelles autour du raisonnement des modèles. Les traces de raisonnement protégées offrent des aperçus sur la manière dont un modèle traite les tâches, et leur extraction peut révéler des données sensibles ou aider à reproduire des capacités sans les investissements initiaux en matière de sécurité. Comme l'a noté OpenAI, la distillation adversariale pose des risques en matière de sécurité et de sécurité nationale, car le raisonnement extrait peut être utilisé pour entraîner d'autres modèles sans préserver les protections originales.
La vulnérabilité démontre également que la sécurité ne consiste pas seulement à empêcher l'accès direct, mais aussi à gérer la façon dont les modèles interagissent au sein d'un écosystème. Si les données chiffrées sont interchangeables entre les modèles, une faiblesse dans un modèle moins sécurisé peut compromettre l'ensemble du système. Cela a des implications sur la manière dont les fournisseurs conçoivent les architectures de modèles et gèrent les flux de données chiffrées, surtout à mesure que les modèles acquièrent des capacités dans des domaines à double usage.
Ce que vous pouvez faire
- Surveillez votre utilisation de l'API pour repérer les schémas inhabituels ou les pics de requêtes pouvant indiquer des tentatives d'extraction coordonnées.
- Examinez vos conditions d'utilisation et vos mécanismes d'application pour vous assurer qu'ils couvrent la distillation adversariale et la reproduction non autorisée de données.
- Mettez en œuvre des vérifications pour détecter et retenir les flux de sortie susceptibles d'exposer des processus de raisonnement internes ou des données protégées.
- Veillez à ce que les traces de données chiffrées ne soient pas interchangeables entre différents modèles ou sessions au sein de votre écosystème afin de prévenir les attaques de décodage inter-modèles.
- Restez informé des nouvelles vulnérabilités dans les architectures d'IA, comme celles mises en évidence dans les études académiques récentes, pour ajuster proactivement votre posture de sécurité.
- Tenez compte des implications en matière de sécurité lors de la distillation lors de l'entraînement ou du fine-tuning des modèles, en veillant à ce que les protections soient préservées dans les systèmes dérivés.



