OpenAI、Moonshot AI関連とされる推論抽出キャンペーンを阻止
OpenAIは、同社のモデルから保護された推論トレースを抽出しようとする組織的な試みをブロックし、この活動が中国企業Moonshot AIの関係者によるものだと特定しました。
英語の原文から自動翻訳されました。
OpenAIは、同社の人工知能モデルから保護された推論データを不正に抽出することを目的とした大規模なキャンペーンを特定し、これを解体しました。同社は、この活動の中心人物を北京を拠点とする競合企業であるMoonshot AIに関連する個人であると結論づけ、2026年7月下旬にこの作戦を完全に阻止しました。
何が起きたか
このキャンペーンは2026年7月1日に始まり、最初は低ボリュームの試みとして始まりましたが、徐々にエスカレートしていきました。7月24日と25日には活動が急増し、4,000人を超えるユーザーが特定の抽出パターンを用いて約16,000件のリクエストを試みました。さらなる調査により、関連するプロンプトパターンの活動にはプラットフォーム全体で15,000人以上のユーザーが関与していることが判明しました。OpenAIは2026年7月28日にこのキャンペーンを完全に阻止し、不正なアカウントを禁止しました。
OpenAIによれば、運営者は暗号化の解読やデータベースへの侵入、保存されたユーザー会話への直接アクセスを行ってはいません。代わりに、モデルとの対話を操作し、依頼者が視認できる形で保護された推論を再現していました。この手法は同社の利用規約に違反しており、「敵対的蒸留(adversarial distillation)」と特徴づけられています。これは、あるモデルの出力を体系的かつ無断で使用して、別のモデルを訓練したり改善したりする行為です。
今回の事件は、Moonshot AIに対する過去の告発に続くものです。先月、Anthropicは同社が自社のKimiモデルではなくClaudeモデルへ顧客のリクエストを密かに転送していたと非難しました。また、一部のやり取りを保持して思考連鎖(chain-of-thought)能力の訓練に利用していた alleged(疑いがある)とされています。現在の活動は「GTG-16002」というコードネームで追跡されています。
仕組み
この攻撃は、MATS Research、ELLIS Institute Tübingen、Synkの研究員によって2026年8月に発表された研究で詳細が記述されたアーキテクチャ上の脆弱性を利用したものでした。この研究では、暗号化された推論トレースが、プロバイダーのエコシステム内において異なるセッション、ユーザー、モデル間で完全に互換性があり、交換可能であることが明らかになりました。この技術的な欠陥により、攻撃者はスケーラブルな復号ジェイルブレイクを開発することができました。
強力なモデルからの暗号化された推論トレースを、同じプロバイダー内のより弱く、安全対策が不十分なモデルに注入することで、攻撃者は弱いモデルにトレースをデコードさせ、平文で出力させることができました。これにより、より高性能なモデルに対して直接ジェイルブレイクを行う必要がなくなりました。さらに、この手法は暗号化ブロック内に悪意のあるペイロードを組み込むことで、大規模なプライベートデータ抽出や不可視のプロンプトインジェクションも可能にしました。
主要な詳細
- キャンペーンは2026年7月1日から7月28日まで続き、7月24〜25日に4,000人超のユーザーによる16,000件の試みという大幅な急増が見られました。
- OpenAIはこの活動の核心をMoonshot AIに関連する個人に帰属しましたが、この帰属に関する具体的な技術的証拠は提示していません。
- 攻撃手法は、暗号化の破棄やデータベースの侵害ではなく、モデルとの対話操作を含んでいました。
- 関連する研究により、暗号化された推論トレースがモデル間で交換可能であり、弱いモデルが強いモデルのトレースをデコードできることが明らかになりました。
- OpenAIは、暗号化された推論の再生成を通じて内容を回復させることを可能にしていた経路を閉鎖し、ストリーミング出力における露出した推論を検出するためのチェックを追加しました。
- この活動はGTG-16002として追跡されており、AnthropicによるMoonshot AIへの以前の蒸留告発に続いています。
なぜ重要なのか
ソフトウェアエンジニアやAI開発者にとって、この事件はモデル推論を取り巻く現在の安全対策の脆さを浮き彫りにしています。保護された推論トレースは、モデルがタスクをどのように処理するかについての洞察を提供するため、それらを抽出すると機密データが漏洩したり、元の安全性投資なしに機能を再現されたりする可能性があります。OpenAIが指摘した通り、敵対的蒸留は、抽出された推論が元の安全対策を維持せずに他のモデルの訓練に使用される可能性があるため、安全性および国家安全保障上のリスクをもたらします。
この脆弱性は、セキュリティが単に直接アクセスを防ぐことだけでなく、エコシステム内でモデルがどのように相互作用するかを管理することでもあることを示しています。もし暗号化データがモデル間で交換可能であれば、安全対策が不十分なモデルの弱点がシステム全体を危険にさらすことになります。これは、特にモデルがデュアルユース(軍民両用)領域での能力を高めている中で、プロバイダーがモデルアーキテクチャを設計し、暗号化データストリームを扱う方法に影響を与えます。
対応策
- APIの使用状況を監視し、協調的な抽出試みを示唆するような異常なパターンやリクエストの急増がないか確認してください。
- 利用規約と執行メカニズムを見直し、敵対的蒸留や無許可のデータ複製が含まれていることを確認してください。
- 内部推論プロセスや保護されたデータを露呈させる可能性のあるストリーミング出力を検出し、保留するためのチェックを実装してください。
- クロスモデル・デコード攻撃を防ぐため、エコシステム内で異なるモデルやセッション間において暗号化データトレースが交換可能にならないようにしてください。
- 最近の学術研究で強調されているようなAIアーキテクチャにおける新たな脆弱性について情報を収集し、セキュリティ体制を積極的に調整してください。
- モデルの訓練やファインチューニングを行う際には、蒸留に伴う安全性への影響を検討し、導出されたシステムにおいても安全対策が維持されるようにしてください。



