AIニュース

Claude Sonnet 5.5、トークン効率を犠牲にしてエージェント性能を向上

Anthropic の新モデルは、出力トークンを大幅に増やすことで Intelligence Index で2位を獲得しました。ターミナルタスクではトップティアのエージェントと同等の性能を発揮していますが、事実知識の分野では遅れを取っています。

英語の原文から自動翻訳されました。

Anthropic は Claude Sonnet 5.5 をリリースしました。これはミッドティアのモデルであり、現在 Artificial Analysis Intelligence Index で2位にランクインしています。2026年9月28日に公開されたこのアップデートにより、同モデルはエージェントワークフローにおいてフラッグシップ競合他社との差を縮めていますが、これらの成果は純粋なアーキテクチャの効率性ではなく、異常なほど高いトークン消費によって達成されています。

何が起きたか

Claude Sonnet 5.5 は Intelligence Index で2位に上昇し、最大努力(max effort)設定の Opus 5.5 に次ぐ位置につけました。このモデルは前世代の Sonnet 5 から18ポイント向上しており、主にターミナル使用と複雑な知識労働における大幅な改善が要因です。コマンドラインインタラクションへの対応能力を評価する Terminal-Bench 4.0 において、Sonnet 5.5 は64パーセントのスコアを記録しました。これはそれぞれ60パーセントのスコアを出した Opus 5.5 と GPT-6 Astra よりもわずかに優れています。

こうした性能の飛躍にもかかわらず、すべてのカテゴリーでリードしているわけではありません。事実知識と科学的推論においては、依然として Opus 5.5 に劣っています。事実正確性を測る AA-Omniscience ベンチマークでは、Sonnet 5.5 は54パーセントのスコアとなり、Opus 5.5 の66パーセントと比較されています。しかし、幻覚率(ハルシネーション率)はより大きなモデルの59パーセントに対し、47パーセントと低い値を示しています。評価には構造化出力に影響を与えるバグを含むプレリリース版が使用されましたが、Anthropic はパブリックリリースでは修正済みであると述べています。

仕組み

Sonnet 5.5 のランキング向上を支える中核的なメカニズムは、「max effort」設定であり、これにより出力トークン使用量が極端に増加します。Intelligence Index のタスクを完了するために、モデルはタスクあたり約193,000個の出力トークンを生成します。これは Artificial Analysis が記録した中で最も高いトークン使用量であり、Opus 5.5 と Sonnet 5 を約60パーセント上回り、GPT-6 Astra を約7倍凌駕しています。このモデルは本質的に、広範な思考チェーンと検証ステップを生成することで複雑な問題を総当たりで解決しています。

Anthropic は low、medium、high、xhigh、max の5つの努力レベルを提供しています。Intelligence Index の評価は、デフォルトのフォールバックを有効にした状態でこれら5つのレベルすべてで実施されました。モデルが以前の Sonnet 5 バージョンにフォールバックしたのはタスク全体のわずか0.1パーセントであり、そのほとんどは Terminal-Bench 4.0 内で発生しました。max effort 設定が高いリーダーボード順位を生み出していますが、低い努力レベルでの競争力は劣ります。low、medium、high の努力レベルでは、GPT-6 Sol の構成がより少ない出力トークンで同等またはそれ以上の性能を提供します。

主要な詳細

  • ランキング: Artificial Analysis Intelligence Index で2位、Opus 5.5(max)に次ぐ。
  • トークン使用量: max effort 時にタスクあたり約193kの出力トークンを使用。これまでで最高。
  • 価格: キャッシュ入力/入力/出力トークン100万個あたり $0.2/$2/$10 で、Sonnet 5 と同一。
  • タスクあたりのコスト: タスクあたり約 $7.60。これは Sonnet 5 より50パーセント高い。
  • ターミナル性能: Terminal-Bench 4.0 で64%のスコアを記録し、Opus 5.5 と GPT-6 Astra を上回る。
  • コンテキストウィンドウ: テキストおよび画像入力に対して100万トークンのまま変更なし。

なぜ重要なのか

エージェントシステムを構築するエンジニアリングチームにとって、Sonnet 5.5 は機能性とコスト効率性の間のトレードオフを提示しています。このモデルは、実用的なターミナル使用や AA-Briefcase や AutomationBench-AA などの自動化ベンチマークにおいて、主要な競合他社と同等かそれ以上の性能を発揮します。そのため、開発環境との深いインタラクションや複雑なデータ処理パイプラインを必要とするワークフローに適した候補となります。しかし、この性能には相当な価格が付いています。タスクあたりのコストは約 $7.60 であり、同じ量の作業を実行する場合、前世代よりも大幅に高価になります。

Sonnet 5.5 のポジショニングは、ミッドティアモデルがどのように競合するかの変化も浮き彫りにしています。純粋な推論密度でフラッグシップモデルを上回ろうとするのではなく、Anthropic は類似の結果を得るために、Sonnet 5.5 がより多くの計算リソースとトークンを消費するように最適化しました。開発者にとって、これは Sonnet 5.5 と GPT-6 Sol などのモデルとの選択が、特定のタスクに大きく依存することを意味します。トークン予算が厳しい場合、GPT-6 Sol は低い努力レベルでより良い価値を提供する可能性があります。一方、ターミナル環境で最大限のエージェント持続性が必要なタスクの場合、max effort 時の Sonnet 5.5 は、Opus 5.5 の高コストながら実行可能な代替手段となります。

できること

  • 現在のエージェントワークフローを max effort 時の Sonnet 5.5 と比較してベンチマークし、Terminal-Bench スコアの64%が実際の信頼性につながるかを確認してください。
  • タスクあたり $7.60 のコストを、既存の Sonnet 5 または GPT-6 Sol の予算と比較し、経済的実現可能性を判断してください。
  • 5つの努力設定を個別にテストし、特定のユースケースにおけるトークン使用量と精度の最適なバランスを見つけてください。
  • 事実正確性が重要な場合は幻覚率を監視してください。Sonnet 5.5 は Opus 5.5 よりも幻覚率が低いですが、全体的な事実スコアも低くなっています。
  • アプリケーションでの構造化出力処理を検証し、プレリリース時のバグが修正されているパブリックリリースを実行していることを確認してください。
  • この仕様は前バージョンから変更されていないため、100万トークンのコンテキストウィンドウがニーズを満たすかどうかを評価してください。

Bytechapストアのツール

$89

DocBento

すべてのスキャンを読み取り、ページ出典を提示して回答するセルフホスト型ドキュメント管理システム。

ライブデモ

続きを読む

すべての記事