Red Hatのベンチマーク、プロンプトインジェクション検出では小規模分類器が大規模LLMに匹敵
Red Hatの新規ベンチマークによると、2億パラメータのモデルが350億パラメータのLLMジャッジと同等のプロンプトインジェクション精度を達成しつつ、実行速度は大幅に向上しました。
英語の原文から自動翻訳されました。
Red HatのAI Safetyチームは、AIガードレールに対する3つの異なるアプローチ(専用構築された分類器、大規模言語モデルによるジャッジ、ゼロショット決定モデル)を比較するベンチマーク結果を公開しました。2026年後半に行われたこのテストでは、わずか2億パラメータを持つコンパクトな分類器が、プロンプトインジェクション検出において350億パラメータの大規模モデルとほぼ同一の精度を達成し、かつレイテンシが劇的に低いことが明らかになりました。
何が起きたか
評価は、プロンプトインジェクションとコンテンツ安全性という2つの主要なリスクカテゴリーに対し、9つの異なるガードレール構成で実施されました。Red HatはNVIDIAのオープンソースツールキット「NeMo Guardrails」を使用し、テスト環境を標準化しました。参加したモデルには、LLMジャッジとして機能するQwen3.6-35B、TypeSafe社のJev決定モデル、そしてDeBERTaベースのモデルやRed Hat独自のGranite Guardianなどの小規模分類器が含まれていました。
プロンプトインジェクションカテゴリーでは、結果は驚くほど接戦でした。Qwen3.6-35Bは89.31%で最高精度を記録しましたが、DeBERTaベースの分類器は89.01%で僅差の2位となりました。精度の差は微小でしたが、パフォーマンスのギャップは非常に大きかったです。小規模分類器は中央値で54.1ミリ秒で判断を下した一方、Qwenは312.5ミリ秒を要しました。決定モデルであるJevは、精度86.35%、速度348.1ミリ秒で両方とも下回りました。
コンテンツ安全性チェックのカテゴリーでは順位が逆転しました。これは偏見、暴力、違法行為などより広範なリスクを対象としています。ここではJevが86.20%の精度で首位となり、オープンソースの代替案であるDiffusionGemmaが85.53%で僅差で続きました。Qwenは85.47%で3位です。Red HatのGranite Guardian分類器は80.27%の精度で6位となりましたが、33.2ミリ秒で最速のオプションであり続けました。これらの結果は、小規模分類器がインジェクション検出のような具体的かつ明確に定義されたタスクでは優れているものの、複雑なコンテンツモデレーションには柔軟性の高いモデルの方が依然として有利であることを示唆しています。
仕組み
3つのアプローチは、入力処理の方法が根本的に異なります。専用構築された分類器は、特定のパターンを認識するためにラベル付きデータセットで訓練されます。単純な確率スコアを出力するため、計算コストが低く高速です。対照的に、QwenのようなLLMジャッジは、プロンプトの安全性を推論するためにテキストを生成する必要があり、多大な計算リソースと時間を消費します。Jevのような決定モデルはその中間に位置します。アプリケーション状態に関する型付きの質問を受け入れ、確率などの型付き回答を返しますが、完全なテキストトークンは生成しません。このゼロショット能力により、再訓練なしで新しいポリシーに適応でき、構造化された出力形式を保ちながらLLMに近い柔軟性を提供します。
しかし、ベンチマークはデプロイメントアーキテクチャが知覚されるパフォーマンスに大きく影響することを強調しています。Red Hatの小規模分類器はMacBook Pro M1 CPU上でローカル実行されました。QwenやDiffusionGemmaなどの大規模モデルは、クラウドクラスタ内の96 GB VRAMを搭載したGPUノードで実行されました。テストは英国から発信されたため、ホスト型モデルへのすべてのリクエストで大西洋横断ネットワークホップが発生しました。Red Hatはこれによりリクエストあたり少なくとも56ミリ秒の遅延が加算されると推定しています。このネットワーク遅延を差し引いても、クラウドベースのモデルはローカル分類器よりも依然として著しく遅く、小規模モデルの速度優位性が単なるネットワーク近接性の産物ではないことを証明しています。
主要な詳細
- Qwen3.6-35Bはプロンプトインジェクションで89.31%の精度を達成しましたが、2億パラメータのDeBERTa分類器は89.01%に達しました。
- DeBERTa分類器の中央値レイテンシは54.1ミリ秒で、Qwenの312.5ミリ秒、Jevの348.1ミリ秒と比較して大幅に短縮されています。
- Jevはコンテンツ安全性ベンチマークで86.20%の精度を記録し、首位となりました。これはQwen(85.47%)およびGranite Guardian(80.27%)を上回る結果です。
- オープンソースの決定モデルであるDiffusionGemmaは、コンテンツ安全性で85.53%の精度を達成し、プロンプトインジェクションでは87.72%でJevを上回りました。
- プロンプトエンジニアリングは結果に大きな影響を与えました。Layaモデルのポリシーをチューニングすることで、コンテンツ安全性スコアが57.87%から75.20%へ向上しました。
- Red Hatは、OpenShift AI 3.6のデフォルトガードレール構成として、DeBERTaおよびGranite Guardian分類器を出荷する計画です。
なぜ重要なのか
本番環境のAIアプリケーションを構築するエンジニアにとって、これらの発見は「堅牢な安全性のためには常に大規模モデルが必要である」という前提を覆します。プロンプトインジェクションのような特定のリスクが、汎用ハードウェア上で動作する極小の分類器で対処できる場合、チームはすべてのリクエストに対して大規模GPUクラスタやサードパーティAPI依存関係を管理するコストと複雑さを回避できます。これにより、アプリケーションのインフラ内で直接動作する安全かつ低レイテンシのガードレールが可能になり、障害ポイントと運用オーバーヘッドを削減できます。
しかし、結果は「一つの解決策がすべての安全性ニーズに対応するわけではない」ことも浮き彫りにしています。小規模分類器は速度と特定タスクで圧倒的ですが、広範なコンテンツ安全性ポリシーに必要なニュアンスへの対応には苦戦します。決定モデルはゼロショットシナリオで魅力的な中間解を提供しますが、どちらの極端なケースでも一貫して上回るわけではありません。開発者は、基礎となるモデルアーキテクチャに関係なく、プロンプト設計とポリシーチューニングが重要な要素であることを認識し、ガードレールのタイプを具体的なリスクプロファイルに合わせて慎重に選択する必要があります。
推奨アクション
- ラベル付き訓練データが利用可能なプロンプトインジェクションなど、明確に定義されたリスクに対しては、専用構築された分類器の評価を検討してください。
- 柔軟性とゼロショット能力が必要な広範なコンテンツ安全性ポリシーには、決定モデルまたはLLMジャッジを使用してください。
- クラウドホスト型のガードレールをローカルモデルと比較するベンチマーク時には、ネットワーク遅延を考慮に入れてください。移動時間はパフォーマンス指標を歪める可能性があります。
- リスクの定義方法によって精度が大きく変動するため、決定モデルのポリシープロンプトのチューニングに時間を投資してください。
- 高トラフィック環境では、GPUリソースや外部APIへの依存を減らすために、小規模分類器をローカルCPUで実行することを検討してください。
- アプリケーションがグローバルなユーザー基盤を持つ場合は、複数の言語でガードレールのパフォーマンスをテストしてください。現在のベンチマークは英語のみを対象としています。



