AIエージェント

AWS、ローカルでのエージェント検証向けにStrands Decider 2Bをリリース

AWSは、AIエージェントのアクションをローカルで検証し、100ミリ秒未満の遅延を実現するダウンロード可能な意思決定モデル「Strands Decider 2B」を発表しました。

英語の原文から自動翻訳されました。

Amazon Web Services(AWS)は、ローカルで実行され、AIエージェントのアクションを実行前に検証するように設計されたコンパクトな意思決定モデル「Strands Decider 2B」を導入しました。2026年10月1日にリリースされたこのツールは、外部APIに依存したり、無効なテキストを生成したりすることなく、エージェントの出力を確認するための高速かつ信頼性の高いメカニズムを開発者に提供します。

何が起きたか

今回の発表により、AWSはTypeSafe社のJevなど、新興の意思決定モデルと直接競合する位置づけとなりました。Jevの登場以降、主要なAIベンダーからも同様のツールが続々とリリースされています。OpenAIは最近、Lunaモデルを使用したホスト型Decisions APIのプレビューを行いましたが、AWSは完全にダウンロード可能なモデルを提供するという異なるアプローチを取りました。このパッケージには重みだけでなく、トレーニングデータやスクリプトも含まれており、エンジニアが基礎となるレシピを検査・適応できるようにしています。

Strands Decider 2Bは、より広範なStrandsエコシステムの一部であり、AWSのエージェント型AI実験ハブであるStrands Labsでインキュベーションされました。これは、長寿命エージェントの実行基盤を提供するStrands Harnessの最近のリリースに続くものです。ホスト型サービスのオープンなローカル代替案を提供することで、AWSは開発者がエージェントワークフローにおける重要な検証ステップに対してより多くのコントロールを持てるようにすることを目指しています。

仕組み

意思決定モデルは、出力空間を制限することで標準的な大規模言語モデルとは異なります。自由形式のテキストを生成する代わりに、開発者が提供する選択肢から選択するか、数値スコアを返します。Strands DeciderはベースとしてQwen3.5-2Bを使用しており、「トルソ」と呼ばれています。チームはテキスト生成を担当する標準的な言語モデルヘッドを削除し、100万パラメータ強のみを含むポインターヘッドに置き換えました。このヘッドが提供された回答オプションにスコアを付けます。

バックボーンには、ランク16の低ランク適応(LoRA)アダプターが利用されています。可能な出力を開発者によって供給されたものだけに制限することで、モデルは存在しないオプションを作り出すことができません。このアーキテクチャにより、すべての出力が定義されたコンテキスト内で有効であることが保証されますが、すべてのインスタンスで正解であることは保証されません。このトレードオフにより、判断が速くなり、アプリケーションが次のステップを決定するために使用できるキャリブレーションされた信頼度スコアが得られます。

実際の運用では、これにより実行前チェックが可能になります。例えば、エージェントが都市名が指定されていない状態で天気ツールの呼び出しを提案した場合、Deciderは引数が会話に基づいているかどうかを評価します。情報が不足している場合、システムは欠陥のあるツールコールを実行するのではなく、ユーザーに確認を求めるためにエージェントをルーティングできます。このプロセスはStrandsの介入システムを通じて実行され、開発者は続行、拒否、または人間の確認を要求するためのポリシーを定義できます。

主要な詳細

  • モデルはQwen3.5-2Bをベースにしており、テキスト生成層の代わりにカスタムのポインターヘッドが組み込まれています。
  • Nvidia RTX 3090 GPU上で100ミリ秒未満の意思決定時間を達成します。
  • M3 MacBookでは、小規模タスクの中央値レスポンスタイムは約150ミリ秒です。
  • JevBenchにおいて、約20億パラメータを持つ公開モデルの中で第2位にランクされています。
  • 完全なトレーニングレシピとデータを提供する公開モデルの中では第1位にランクされています。
  • リリースには、透明性を確保するため、リポジトリ内のすべての過去のアーキテクチャ反復が含まれています。

なぜ重要なのか

自律型エージェントを構築するソフトウェアエンジニアにとって、信頼性はしばしば最大のハードルとなります。生成モデルはツール引数を幻覚したり、重要な制約を見逃したりすることがあり、デバッグが難しいエラーを引き起こす可能性があります。Strands Decider 2Bは、エージェントの推論とアクションの間に高速で決定的なチェックを挿入することで、この問題に対処します。この関心の分離により、生成モデルは複雑な会話や創造性を扱い、意思決定モデルはルーティングと検証を扱います。

モデルのローカル特性は、遅延に敏感なアプリケーションやデータプライバシーにとって重要です。デバイス上での検証実行により、ホスト型APIに関連するネットワーク往復時間が排除されます。さらに、トレーニングデータとスクリプトの包含は、特定のドメインへのファインチューニングをサポートします。開発者はベンダーの独自ロジックというブラックボックスに閉じ込められることはなくなり、独自の運用制約に合わせてモデルを適応させ、提供されたベンチマークを通じてその挙動を検証できるようになります。

あなたにとっての意味

  • このモデルは、Qwen3.5-2Bをベースに、テキスト生成層の代わりにカスタムのポインターヘッドを組み込んで構築されています。
  • Nvidia RTX 3090 GPU上で100ミリ秒未満の意思決定時間を達成します。
  • M3 MacBookでは、小規模タスクに対する中央値レスポンスタイムは約150ミリ秒です。
  • JevBenchにおいて、約20億パラメータを持つ公開モデルの中で第2位にランクされています。
  • 完全なトレーニングレシピとデータを提供する公開モデルの中では第1位にランクされています。
  • リリースには、透明性を確保するため、リポジトリ内のすべての過去のアーキテクチャ反復が含まれています。

Bytechapストアのツール

続きを読む

すべての記事