Microsoft、Qwenベースの「Decision-1」モデルを公開しOpenAIやTypeSafeに対抗
MicrosoftはFoundryで「Microsoft-Decision-1」をリリースしました。AlibabaのQwen3.5-9Bを基盤としており、競合と同じ価格設定ですが、画像サポートとオープンウェイトは省略されています。
英語の原文から自動翻訳されました。
Microsoftは2026年10月10日金曜日、同社のFoundryプラットフォームで「Microsoft-Decision-1」を発表し、急成長しているAI意思決定モデル市場に参入しました。このリリースは、OpenAIがDecisions APIのパブリックベータ版を提供開始してからわずか3日後、そしてスタートアップ企業TypeSafeがJevモデルを導入してから数週間後のタイミングで行われました。MicrosoftはOpenAIのアーキテクチャをスキップし、代わりにAlibabaのQwen3.5-9Bに基づくモデルをポストトレーニングすることで、エージェントロジックにおける独立したインフラへの移行を示唆しています。ただし、将来的には自社のMAIモデルやOpenAIのテクノロジーに基づいて再構築する計画も立てています。
何が起きたか
新モデルの入力トークン100万あたり0.042ドルという価格は、出力が無料であり、TypeSafeのJevモデルが請求しているレートと完全に一致しています。この価格戦略は、a16zが主導する8億7,000万ドルのシリーズA資金調達を発表し、評価額を75億ドルとしたTypeSafeの動きと同時期に行われました。TypeSafeは、Jevのローンチから3週間でフォーチュン500企業の約30%が試したと主張しており、このトラクション指標がMicrosoftに迅速な対応を迫った可能性があります。同じ期間中、Upstage、Perplexity、Cloudflare、AWSなどの競合他社も、意思決定に特化した自社モデルを出荷しています。
Microsoftの会長兼CEOであるSatya Nadella氏はX上で発表を行い、社内ですでにテストが進んでいることを明かしました。現在、4つの内部チームがDecision-1を使用しています。Xbox Researchでは1万件以上のプレイヤーフィードバックの分類に、Copilotチームではチャットおよびエージェント応答の評価に、オンコールエンジニアはライブ障害時のコンテキスト取得に、そしてMicrosoft Discoveryではエージェントが再計画を行う前に実験をスコアリングするために使用しています。内部ベンチマークによると、XboxタスクではGPT-6 Solよりも14倍以上高速であり、Discoveryワークフローでは一貫性が46倍向上していることが示唆されています。
仕組み
Decision-1は、一般的な生成コンテンツではなく、構造化された意思決定タスク向けに設計された専門モデルです。最大32,768トークンのテキスト入力を受け付け、JSON形式で出力を返すため、自動化されたエージェントやワークフローへの統合に適しています。一部の競合製品とは異なり、この初期バージョンはテキストのみに対応しており、画像入力はサポートされていません。MicrosoftはAlibabaのQwen3.5-9Bベースモデルに対してポストトレーニングを実施しました。これは、開発者がオープンソースモデルを移植してコスト効率の高い意思決定レイヤーを作成するという業界トレンドに沿った選択です。Cognitionのエンジニアリング担当副社長であるJared Palmer氏は、類似のモデルをQwen3.5へ移植するのに必要な計算リソースは最小限であったと指摘し、このアプローチの効率性を強調しました。
このモデルは校正された確率(calibrated probabilities)を提供するように設計されており、信頼度スコアが90%であれば、代表的なデータにおいて10回中9回は正しい判断が行われるはずです。しかし、Microsoftは顧客に対し、これらの校正スコアを独自の特化データセットで検証することを推奨しています。モデルは一貫性の高さを追求していますが、Jevなどの競合モデルに関する最近の研究では、敵対的な入力によって信頼度スコアが大きく歪められる可能性があることが示されています。Microsoftは並べ替えられた選択肢など8種類の摂動(perturbations)に対してDecision-1をテストし、平均して回答が変化したのはわずか1.3%であることを確認しましたが、独立した敵対的テストはまだ公表されていません。
主要な詳細
- ベースモデル: AlibabaのQwen3.5-9Bでポストトレーニング済み。将来Microsoft MAIおよびOpenAIモデルに基づいて再構築する予定。
- 価格: 入力トークン100万あたり0.042ドル、出力は無料。TypeSafeのJevの価格と一致。
- パフォーマンス: Xboxフィードバック分類ではGPT-6 Solより14倍高速、Microsoft Discoveryでは一貫性が46倍向上していると報告。
- 入力制限: テキストは最大32,768トークンまで受け付け。現時点では画像入力は非対応。
- 提供状況: Microsoft Foundryで公開。オープンウェイトはまだリリースされていない。
- 社内利用: Xbox Research、Copilot、オンコールエンジニアリング、Microsoft Discoveryチームにより現在テスト中。
なぜ重要なのか
AIエージェントを開発するソフトウェアエンジニアにとって、専用意思決定モデルの出現は、単純な論理ルーティングのために大規模で高価な言語モデルを使用することからの転換を表しています。Decision-1により、開発者はタスクをデバイス上で実行するかクラウド上で実行するかといった構造化された選択を、低遅延の専門モデルにオフロードできます。この関心の分離により、複雑なエージェントワークフローのコスト削減と応答時間の改善が可能になります。主要なクラウドプロバイダーやスタートアップ企業が同様のツールをリリースしているため、エージェントアーキテクチャの標準は、小規模で高速なモデルが論理を担当し、大規模なモデルが生成を担当する階層型システムへと固まりつつあります。
しかし、画像サポートとオープンウェイトの欠如により、ビジョンエンコーダーをサポートしApache 2.0ライセンスでリリースされているCloudflareのClefなどの競合製品に対し、Decision-1は遅れを取っています。さらに、MicrosoftのFoundryサンプルコードでは/systemoneエンドポイントが参照されていますが、AWS、Upstage、Ollamaが採用しているSystem One APIとの完全な互換性については会社側で確認されていません。この不確実性は、プロバイダー間を切り替えるために標準化されたインターフェースに依存している開発者の相互運用性に影響を与える可能性があります。また、校正された確率への依存は慎重な検証を必要とします。敵対的なプロンプトによって意思決定の結果が操作されるリスクがあり、これは類似モデルに関する最近の学術研究でも指摘されている点です。
できること
- 既存のエージェントワークフロー内のテキストベースのルーティングタスクについて、Microsoft FoundryでDecision-1を評価してください。
- 本番環境での信頼性を確保するため、独自の履歴データを使用してモデルの確率校正を検証してください。
- Jev、Kev、Clefなどの他の意思決定モデルと比較し、特定のユースケースにおける遅延とコストを確認してください。
- 言い換えられた入力や選択肢の並べ替えを導入することで、モデルの一貫性をチェックし堅牢性をテストしてください。
- 画像サポートやSystem One API互換性に関する今後のアップデートについて、Microsoftの発表を監視してください。
- フィードバックの分類やエージェント応答の評価など、社内トリアージタスクにモデルを使用することを検討し、その後顧客向け機能への展開を行ってください。



