Anthropic、Sonnet 5.5からの高リスクなサイバー関連リクエストを旧モデルへルーティング
Anthropicの新しいSonnet 5.5モデルは、分類器によるルーティングを用いて、高リスクなサイバーセキュリティタスクではSonnet 5へフォールバックします。API開発者にはオプトインが必要です。
英語の原文から自動翻訳されました。
Anthropicは2026年9月29日(月)にClaude Sonnet 5.5をリリースし、これまでトップティアのモデルのみで提供されていたサイバーセーフガードと自動モデルフォールバックを導入しました。このアップデートは、特に攻撃的なセキュリティ機能を対象として、ミッドティアの本番ワークロードにおける安全性を同社がどのように処理するかという方針転換を示しています。
何が起きたか
Sonnet 5.5は、組み込みのサイバーセーフガードと分類器によるルーティングを搭載して発売されたSonnetティア初のモデルです。Anthropicは今回のリリースがモデル機能全体のフロンティアを進めるものではないと述べていますが、Sonnet 5.5のサイバーセキュリティスキルはOpus 5と同等であると評価しています。エージェント型コーディングベンチマーク「Terminal-Bench 4.0」において、より安価なこのモデルは70.6%のスコアを記録し、xhigh設定で66.4%を記録したOpus 5.5を上回りました。
これらのセーフガードを実装する決定は、モデルの攻撃的セキュリティ性能における大幅な向上に基づいています。テスト中にセーフガードを無効にした場合、Sonnet 5.5はExploitBenchの410回の試行のうち178回で完全な任意コード実行を達成しました。また、Irregular社のCyScenarioBenchでは課題の46.1%を完了し、Sonnet 5の完了率0.7%から急激な増加を見せています。さらに、GoogleのOSS-Fuzzコーパスに基づくバイナリエクスプロイトベンチマークでは、前世代モデルが3件だったのに対し、50件の制御フローハイジャックを成功させました。
Anthropicは、Sonnet 5.5のサイバーセキュリティ能力がOpus 5.5やMythos 5.1よりも低いと見なしていますが、能力の飛躍は上位モデルに適用されるのと同じサイバーポリシーを正当化するのに十分なものでした。同社は、これらの介入によりセーフガード有効時のベンチマークスコアが低下する可能性が高いことを認めていますが、エクスプロイト生成やペネトレーションテストに関連するリスクを軽減するために必要だと説明しています。
仕組み
強制メカニズムは3段階で動作します。まず、プローブがモデル内部のアクティベーションを読み取ります。次に、Sonnet 5.5上で動作する軽量な分類器がリクエストを評価します。最後に、別途訓練された大規模言語モデル分類器が、プローブの判定結果を考慮して会話をブロックすべきかどうかを決定します。Anthropicによれば、これらの分類器はOpus 5と同程度の割合で有害なサイバーリクエストを検出しますが、Sonnet 5.5はトップティアモデルほど高性能ではないため、ジェイルブレイク保護はより緩やかです。
ペネトレーションテスト、エクスプロイト生成、バイナリの脆弱性スキャンなどに関わるリクエストが高リスクとしてフラグ付けされると、システムはフォールバックをトリガーします。オプトインしているAPIユーザーの場合、リクエストはSonnet 5へ可視的にルーティングされます。Anthropic自身のアプリケーションでは、切り替えが発生した際にユーザーへ通知が表示され、使用されたモデルが応答内で識別されます。フォールバックが有効でない場合、リクエストは古いモデルへ渡されるのではなく、単に停止します。
重要なのは、生物学、従来兵器、および蒸留防止に関するブロックはフォールバックをトリガーせず、リクエストを完全に終了させる点です。これらのブロックは透明であり、応答を密かに変更することはありません。しかし、サイバーポリシーでは、安全なコーディングワークフローをサポートするためにソースコード内の脆弱性発見は許可されていますが、コンパイル済みバイナリ内での同様の発見はブロックされます。
主要な詳細
- Sonnet 5.5は2026年9月29日(月)に、サイバーセーフガードとモデルフォールバックを備えてリリースされました。
- API開発者が自動フォールバックにオプトインした場合、高リスクなサイバーセキュリティリクエストはSonnet 5へフォールバックすることが可能です。
- このモデルはTerminal-Bench 4.0で70.6%のスコアを記録し、xhigh設定でのOpus 5.5の66.6%を上回りました。
- セーフガードは、メモリ、コネクタコンテンツ、ウェブ検索結果、ファイルなど、すべての入力コンテンツをレビューします。
- プロンプトインジェクションテストでは、Sonnet 5へ再ルーティングされたリクエストの12.01%が正常に侵害されました。
- 検証済みの防御者は、拡大されたサイバー検証プログラムを通じて、将来的により少ない制限でモデルにアクセスできるようになる可能性があります。
なぜ重要なのか
ソフトウェアエンジニアや技術リードにとって、この変更はSonnet 5.5をSonnet 5の直接的なドロップイン代替品としてあらゆるシナリオで扱えないことを意味します。可視的なフォールバックの導入により、モデルの挙動とパフォーマンスに変動が生じます。開発者は、トリガーされると機密性の高いリクエストを処理する可能性があるSonnet 5.5とSonnet 5、両方のセキュリティ体制を考慮する必要があります。このデュアルモデル環境では、フォールバックによって予期せぬ脆弱性やワークフローの連続性の断絶が生じないよう、慎重なテストが求められます。
さらに、セーフガードをトリガーする範囲はユーザーのプロンプトにとどまりません。チェックはモデルが読み取るすべての内容、つまりリポジトリ、セキュリティアドバイザリー、またはウェブページからのコンテンツもレビューするため、外部データを取得するエージェントは意図せずフォールバックをトリガーする可能性があります。これにより、プロンプトインジェクション攻撃に対する潜在的な弱点が生じます。テストでは、ディスク消去やファイル削除を指示する注入命令がサイバーブロックをトリガーすることが多く、その結果として再ルーティングされたリクエストの12.01%が侵害されました。フォールバックを使用するチームは、より安全でないフォールバックモデルを悪用する可能性のある間接的なプロンプトインジェクションに対してシステムを強化する必要があります。
対応策
- API構成を確認し、自動フォールバックにオプトインするかどうかを決定してください。
- モデルの挙動とパフォーマンスの変動に対応できるよう、Sonnet 5.5とSonnet 5の両方のセキュリティ体制を考慮に入れてください。
- フォールバックが予期せぬ脆弱性やワークフローの断絶を引き起こさないことを確認するために、慎重なテストを実施してください。
- リポジトリ、セキュリティアドバイザリー、ウェブページなど、モデルが読み取るすべてのコンテンツがセーフガードをトリガーする可能性があることを理解してください。
- 間接的なプロンプトインジェクション攻撃に対抗するため、システムを強化してください。


