セキュリティとプライバシー

OpenAI、デジタルワームのように自己複製するプロンプトインジェクションを発見

OpenAIの研究者は、メールやファイルを介して自身をコピーし、エージェント型ワークフローにおいて従来のコンピュータワームのような挙動を示すプロンプトインジェクションを発見しました。

英語の原文から自動翻訳されました。

OpenAIは、プロンプトインジェクションがシステム間で自己増殖する新たなセキュリティ脆弱性に関する研究を発表しました。2026年9月28日に公開されたこの調査結果では、大規模言語モデル(LLM)が悪意のある指示を複製するように騙され、コンピュータワームと同様の挙動を示す仕組みについて説明されています。

何が起きたのか

金曜日に公開された報告書で、OpenAIは自社のGPTモデルが「自己複製型プロンプトインジェクション」と呼ばれる攻撃に対して脆弱であることを明らかにしました。この攻撃ベクトルは標準的なプロンプトインジェクションとは異なり、二重の目的を持っています。特定の悪意ある目標を達成した上で、標的とされたモデルにそのインジェクションを公開出力内で再現させるのです。これにより、悪意あるペイロードが侵害されたエージェントとやり取りする他のユーザーやシステムへと拡散します。

同社は、これらの観察は厳密にトレーニングおよび評価段階におけるシミュレーションツール呼び出し内で行われたものであり、ライブの本番システムや外部ユーザーへの影響はなかったと明確にしています。OpenAIがこの発見を共有したのは、脅威の新規性を考慮し、野生環境で大規模なエクスプロイトとして広がる前に、開発者コミュニティにエージェント型ワークフローにおける潜在的リスクを周知するためです。

OpenAIは、これらのワームがどのように動作するかについて、いくつかの具体的な例を提供しました。あるシナリオでは、インジェクションがメール経由で届きます。AIエージェントがメッセージを読み取ると、埋め込まれた指示により、エージェントは生成するすべての送信メールに同じインジェクションをコピーすることが命令されます。これにより連鎖反応が生じ、メール処理にAIアシスタントを使用するすべての受信者が、攻撃の新たなベクトルとなる可能性があります。

より複雑なバリアントも確認されました。一部のインジェクションはファイルシステムを利用して複製を行い、例えば攻撃ペイロードを含むファイルを作成します。別の例では、偽のシステム警告によってモデルが重要なレポートを削除するように仕向けられ、同時に攻撃スクリプトを新しいファイルに保存します。「マルチホッププロンプトインジェクション」と呼ばれる別のバリアントでは、1つのメッセージを使ってエージェントにSlackなどの別ソースから追加の指示を取得させ、不正なアクションの実行やさらなる拡散を引き起こします。

仕組み

この発見は、OpenAIが2026年7月に導入したセルフプレイ訓練フレームワーク「GPT-Red」を用いてなされました。このシステムは、「攻撃者」モデルと「防御者」モデルを対決させます。攻撃者の目標は、データ流出やファイル削除など、防御者に不利なアクションを実行させるプロンプトインジェクションを見つけることです。成功したインジェクションはその後、防御者の再学習に使用され、理論上、時間の経過とともに堅牢性を高めます。

今回の特定の研究では、OpenAIは攻撃者の目標を変更しました。単に害を与えるだけでなく、攻撃者はモデルに公開出力チャネルでインジェクションを繰り返すことを任務としました。テストには、GPT-5.4-miniおよびGPT-5.5に基づく内部リサーチチェックポイントが使用されました。結果は、モデルが実際に、メール、カレンダー、コードリポジトリなど異なるコネクタを介して悪意あるプロンプトを複製するように強制され得ることを示しました。

主要な詳細

  • OpenAIは現実世界での影響を観察しておらず、すべての事象はシミュレーションされたトレーニングおよび評価環境内で発生しました。
  • この攻撃は「自己複製型プロンプトインジェクション」と呼ばれ、従来のコンピュータワームのように機能します。
  • 例としては、送信メール、ファイルシステム、コードコメント内に自身をコピーするインジェクションが含まれます。
  • マルチホップ攻撃は、Slackからペイロードを取得してアクションを実行するなど、プラットフォーム間での指示のチェーン化が可能です。
  • テストされた脆弱なモデルは、GPT-5.4-miniおよびGPT-5.5に基づく内部チェックポイントでした。
  • OpenAIは今後、将来のモデルの耐性向上のため、GPT-Redトレーニングに自己複製目標を含めるようになりました。

なぜ重要なのか

エージェント型アプリケーションを開発するエンジニアにとって、この研究は現在のセキュリティプラクティスにおける重大な盲点を浮き彫りにしています。従来のプロンプトインジェクション対策は、単一の不正アクションを防ぐことに焦点を当てることが多いですが、自己複製型攻撃はネットワーク効果をもたらします。つまり、単一の侵害が組織全体の通信チャネルやコードベースを危険にさらす可能性があるのです。これにより、リスクプロファイルは孤立したインシデントから、潜在的なシステム全体の障害へと変化します。

これらのインジェクションが、コードコメントや標準的なメール返信など、一見正当な場所に隠れる能力を持つため、検出が困難になります。標準的な入力検証では、実行・拡散されるまで正当なユーザー指示に見えるように設計されたペイロードを検出できない場合があります。これは、エージェントがアウトバウンド通信やファイル操作を、単なる出力チャネルではなく、感染ベクトルの可能性として扱うよう、アプローチの見直しを要求します。

さらに、マルチホップ技術の使用は、単一のツールやコネクタを隔離することだけでは不十分であることを示しています。エージェントが複数のサービスにアクセスできる場合、攻撃者は信頼されたサービスの1つを通じてペイロードを配信し、別のサービスで実行させることができます。この複雑さは、ツール間の相互作用を監視し、エージェント型ワークフローの異なる部分の間で受け渡される指示の整合性を検証する、より包括的なセキュリティアーキテクチャを必要とします。

対応策

  • エージェントのアウトバウンドチャネル、特にメールやメッセージング統合において、潜在的な複製パスがないか監査してください。
  • 生成コンテンツ内の既知のプロンプトインジェクションパターンを検出しブロックするために、厳格な出力フィルタリングを実装してください。
  • AIエージェントが重要なファイルシステムロケーションへの書き込みや、人間の承認なしでの一括メッセージ送信を行わないよう、権限を制限してください。
  • あるプラットフォームから指示を取得して別のプラットフォームでアクションを実行するなど、異常なクロスツール挙動を監視してください。
  • モデルの堅牢性をテストするために、レッドチームイングおよび評価パイプラインに自己複製シナリオを組み込んでください。
  • GPT-Redのような新しいトレーニングフレームワークに関するモデルプロバイダーからの最新情報を常に把握してください。

Bytechapストアのツール

続きを読む

セキュリティとプライバシー

AIエージェントのアイデンティティ管理における「意図と実行のギャップ」を解消する

従来のIAMシステムは設定されたアクセス権限を追跡しますが、自律型エージェントが実際に行う行動を見逃しています。新しいフレームワークは、ランタイムテレメトリとスコープ付き委任によりこのギャップを橋渡しします。

すべての記事