SageMakerでのマルチターン強化学習による検索エージェントのファインチューニング
Amazonは、マルチターン強化学習を用いてQwen3.6-27B検索エージェントをファインチューニングし、失敗率を22%から1%未満に削減すると同時に、検索品質を向上させる方法を実証しました。
英語の原文から自動翻訳されました。
Amazon Web Services(AWS)は、Amazon SageMaker AIを使用して大規模言語モデル(LLM)ベースの検索エージェントをマルチターン強化学習でファインチューニングする技術的な詳細ガイドを公開しました。2026年10月にリリースされたこのガイドでは、エンジニアがフロンティアモデル特有の高い遅延やコストを避けながら、複雑な検索タスク向けに小規模モデルを最適化する方法について解説しています。本アプローチは、孤立したステップではなく、会話シーケンス全体を通じてエージェントがより良い意思決定を行えるように訓練することに焦点を当てています。
何が起きたか
LLMを搭載した検索エージェントは企業環境でますます一般的になっていますが、信頼性のギャップという課題に直面しています。大規模なフロンティアモデルは多段階推論に対応できますが、コストが高く処理速度も遅いです。一方、小規模モデルは高速で安価ですが、プロンプトを直接与えた場合、複雑なツール環境を効果的にナビゲートできず失敗することがよくあります。従来の教師ありファインチューニングには、特定の社内ツールでは存在しないことが多い高価な専門家によるデモンストレーションが必要であり、単一ターンの強化学習では連続的なアクション間の依存関係を捉え損ねます。
この課題に対処するため、AWSはAmazon SageMaker AIのマルチターン強化学習(MTRL)を利用したワークフローを導入しました。この手法では、エージェントタスクを意思決定のシーケンスとして扱い、マルチターンインタラクションの最終結果に基づいてモデルを最適化します。チームはQwen3.6-27Bモデルをファインチューニングし、このアプローチにより、環境固有の挙動を直接学習することで、小規模モデルが大規模モデル並みの信頼性を達成できることを実証しました。このプロセスはサーバーレスインフラストラクチャを使用しており、GPUクラスタを手動で管理する必要がありません。
その結果、検索品質と運用安定性の両方で大幅な改善が見られました。トラジェクトリレベルの報酬シグナルを最大化するようにエージェントを訓練することで、システムはトークン予算超過やループへの陥入といった一般的な失敗モードを回避する方法を学習しました。これにより、組織は巨大な汎用モデルに依存することなく、自社のデータランドスケープやツールセットを理解する効率的で専門的な検索エージェントを展開できるようになります。
仕組み
Amazon SageMaker AI MTRLは、エージェントのタスクを環境内の一連の意思決定としてフレームワーク化します。個々の応答を採点するのではなく、マルチターン全体のトラジェクトリを評価します。システムは、エージェントが語彙検索(BM25)やベクトル検索などのツールと対話するマルチターンロールアウトを通じて訓練データを生成します。その後、Proximal Policy Optimization(PPO)やClipped Importance Sampling Policy Optimization(CISPO)などのポリシー勾配アルゴリズムを使用してモデルを最適化します。
重要なコンポーネントは報酬関数です。この実装では、チームは主要な指標としてnDCG@10(Normalized Discounted Cumulative Gain at rank 10:ランク10における正規化割引累積利得)を使用しました。この標準的な情報検索スコアは、上位10件の取得ドキュメントが理想的なランキングにどれだけ合致しているかを測定します。エージェントが許可されたターン数またはトークン制限内でタスクを完了できなかった場合、-1のペナルティ報酬を受け取ります。この負のフィードバックにより、複雑な中間報酬シェイピングを必要とせずに、モデルは効率性を保ちエラー状態を避けることを明示的に学習します。
インフラストラクチャは重い処理を非同期で実行します。ロールアウト生成と勾配更新は並行して動作し、オフポリシーの陳腐化を制限内に保ちながら訓練の高速性を維持します。エンジニアはバッチサイズや同時実行制限などの最小限のハイパーパラメータでジョブを設定し、サービス側がアルゴリズム選択や優位性推定のデフォルト値を管理します。このローコードインターフェースにより、チームは分散訓練のロジスティクスを管理する代わりに、ツールと報酬の定義に集中できます。
主要な詳細
- 使用モデル: 実験ではQwen3.6-27Bモデルをファインチューニングしました。これは米国西部(オレゴン)リージョンでサポートされています。
- 性能向上: BrowseComp-Plusベンチマークにおいて、nDCG@10は23.7%向上し、0.5136から0.6354に上昇しました。
- 信頼性向上: ファインチューニング後、BrowseComp-Plusでの失敗率は22.89%からわずか0.68%へと劇的に低下しました。
- 報酬指標: システムはnDCG@10を直接最適化し、タイムアウトやトークン超過に対して-1の報酬でペナルティを課しました。
- インフラストラクチャ: 訓練実行はサーバーレスでトークン単位課金制を採用しており、時間制限に達した場合でも再開可能なジョブをサポートします。
- データセット: 訓練にはFRAMES、BRIGHT、Enterprise RAGデータセットが含まれ、テストにはFreshStack、WixQA、Wandsが使用されました。
なぜ重要なのか
検索拡張生成(RAG)システムを構築するソフトウェアエンジニアにとって、このアプローチは品質を犠牲にすることなくコストを削減するための道を提供します。多くのチームは現在、小規模なオープンウェイトモデルが多段階ツール使用に対応できないため、大きく高価なモデルに依存しています。MTRLを用いて270億パラメータのモデルをファインチューニングすることで、開発者は推論コストのごく一部で同等の信頼性を達成できます。これはクエリボリュームが多く、厳格なレイテンシ要件があるエンタープライズ検索アプリケーションにおいて特に価値があります。
失敗率の削減は本番システムにとっても同様に重要です。ターン制限やトークン予算を頻繁に超えるエージェントは、ユーザー体験を悪化させ、計算資源の無駄を増加させます。ペナルティベースの報酬設計は、モデルがこれらの境界を認識し回避することを教える上で有効であることが証明されました。これは、展開されたエージェントがより予測可能で監視しやすくなることを意味し、不安定なベースモデルの周りに複雑なガードレールを構築する必要があったエンジニアリングチームの運用負担を軽減します。
さらに、nDCG@10のような直接的なタスク指標に対して訓練できる能力は、モデル最適化をビジネス目標と整合させます。汎用的な言語尤度を最適化する代わりに、モデルは企業のデータ構造専用に適切なドキュメントを取得することを学習します。この特異性により、内部技術ドキュメントや製品カタログなど、汎用的なセマンティック類似性では重要なキーワードマッチや構造的なニュアンスを見逃す可能性のあるドメイン固有クエリに対するパフォーマンスが向上します。
実施できること
- まず、BM25やベクトル検索エンドポイントなど、エージェントが利用可能なツールを定義し、API経由でアクセス可能であることを確認してください。
- Amazon SageMaker AI MTRLが要求する形式で訓練データセットと検証データセットを準備し、検証用に5%を確保してください。
- nDCG@10や完全一致精度など、具体的な成功指標を反映したトラジェクトリレベルの報酬関数を定義してください。
- MultiTurnRLTrainer SDKをデフォルトのハイパーパラメータで設定し、必要に応じてのみバッチサイズと同時実行制限を調整してください。
- MLflow統合を使用して訓練進捗を監視し、トラジェクトリを検査してエージェントが効率的な検索パターンを学習していることを確認してください。
- 本番環境へ展開する前に、保持されたベンチマークでファインチューニング済みモデルを評価し、品質と失敗率の両方における改善を確認してください。

