GoogleのGemini 4 Argonは知識ワークでリードするが、コーディングへのアクセスは制限
Googleは新フラッグシップモデル「Gemini 4 Argon」をリリースしました。このモデルは知識タスクや長文コンテキスト推論において競合を上回る性能を示していますが、コーディング結果にはばらつきがあり、利用範囲はまだ限定されています。
英語の原文から自動翻訳されました。
Googleは最新フラッグシップAIモデル「Gemini 4 Argon」を正式に発表し、OpenAIやAnthropicの現行製品に対する優れた代替手段として位置づけました。2026年9月30日に発表されたこのモデルは、知識ワークや長文コンテキスト処理において顕著な優位性を示す一方、コーディングベンチマークでのパフォーマンスは一貫していません。現在、システムへのアクセスは一部のテスターと政府パートナーに限定されており、Googleは段階的なロールアウト戦略を進めています。
何が起きたか
今回のリリースは、Googleの最近のAIタイムラインにおける転換点を示しており、以前発表されていたGemini 3.5 Pro計画を、より高度なこのイテレーションで事実上置き換えるものです。当初、同社は2026年6月に新しいProモデルを投入する予定でしたが、代わりに一連のFlashモデルを展開した後、Argonに至りました。この発表は、Google CEOのスンダル・ピチャイ氏とドナルド・トランプ大統領との会談に続くもので、ピチャイ氏はAnthropic、Meta、Nvidia、OpenAI、SpaceXのリーダーたちと共に、AI開発の自主規制に関する自発的コミットメントに署名しました。この協定には公式な執行メカニズムはありませんが、安全基準に関する業界間の連携強化を示唆しています。
OpenAIのGPT-6 Astra、AnthropicのClaude Opus 5.5およびFable 5.1と比較した場合、Gemini 4 Argonは18件のベンチマークのうち13件で最高または同等のスコアを記録しています。特に複雑な情報統合や自動化に関わるタスクで強みを発揮します。例えば、ZapierのAutomationBenchでは51.3%のスコアを記録し、Claude Opus 5.5より約9ポイント高くなっています。法務分野では、HarveyのLegal Agent Benchmarkで19.6%を達成しており、これはClaude Fable 5.1のスコアのほぼ3倍ですが、それでもタスク全体を完全に完了できるのは5回に1回程度であることを示しています。
これらの勝利にもかかわらず、特定の技術領域では競合他社に劣後しています。FrontierSWE v2コーディングベンチマークでは、Argonは55.0%を記録し、GPT-6 Astraより10.5ポイント、Claude Opus 5.5より9ポイント低くなっています。また、比較対象モデルの中でTerminal-Bench 4.0では最下位でした。これらの混在した結果は、Argonが一般的な知識やエージェント型ワークフロー向けに最適化されている一方で、すべてのソフトウェアエンジニアリングタスクにとっての決定版ではない可能性を示唆しています。Googleは、有料API顧客やAI Ultraサブスクライバーへのアクセス拡大前に、Fairwind Programの初期テスターからフィードバックを集める計画です。
仕組み
Gemini 4 Argonの特徴的な点は、出力容量の拡大です。フロンティアモデルでは入力トークン100万個が標準となっていますが、Argonは単一の応答で最大100万個の出力トークンを生成できます。以前のGeminiモデルは出力トークンが64,000個に制限されていました。この増加により、モデルはより深い推論プロセスに従事でき、複雑な問題を小さなステップに分割せずとも、単一のトラジェクトリで数十万トークンを生成して解決することが可能になります。
また、このモデルはサイバーセキュリティアプリケーション向けの専門訓練を組み込んでいます。GoogleはArgonに対し、ソフトウェアの脆弱性を自律的に特定、検証、パッチ適用できるように訓練しました。Fairwind Programの参加者や社内チーム向けには、この作業を促進するため、特定のサイバーガードレールを外した状態でモデルが提供されます。2026年3月にGoogleが320億ドルで買収したセキュリティ企業Wizは、すでに「Scan for Good」イニシアチブでArgonを使用しています。この用途において、同モデルは世界中で使用されているヘルスケアソフトウェア内の重大な脆弱性を発見したと報告されており、以前のフロンティアモデルでは検出できなかったものです。
主要な詳細
- Gemini 4 Argonは知識ワークのVals Indexで68.9%を記録し、GPT-6 Astra(63.1%)やClaude Opus 5.5(67.0%)を上回っています。
- モデルは最大100万個の出力トークンをサポートしており、以前のバージョンの64,000個という制限からの大幅な増加です。
- 導入価格は入力トークン100万個あたり2ドル、出力トークン100万個あたり10ドルに設定されており、その後それぞれ4ドルと20ドルに上昇する予定です。
- Argonは256K〜1Mトークンの入力に対するGraphWalksベンチマークで84.2%を達成し、GPT-6 Astraを12ポイント以上リードしています。
- サイバーセキュリティテストでは、Google内部の脆弱性発見ベンチマークで85.8%、Wizのペネトレーションテストベンチマークで70.9%を記録しています。
- アクセスは現在、Fairwind Programと米国政府パートナーに限定されており、より広い可用性は後日の予定になっています。
なぜ重要なのか
開発者や技術系創業者にとって、Gemini 4 Argonのコーディングパフォーマンスの混在は、モデル選択がタスク固有のまま維持される必要があることを示唆しています。DeepSWE v1.1での高いスコア(77.9%)は特定のソフトウェアエンジニアリングワークフローにおける強力な能力を示していますが、FrontierSWE v2やTerminal-Bench 4.0での低いスコアは、すべてのユースケースにおいて専門的なコーディングモデルを置き換えるものではない可能性を意味します。知識ワーク、法務分析、自動化のためのエージェント型ワークフローを構築しているチームは、即座に価値を見出すでしょうが、純粋にコード生成に焦点を当てているチームは、GPT-6 AstraやClaude Opus 5.5などの代替案の評価を続けるべきです。
出力トークンが100万個に拡張されたことは、エンジニアがプロンプトやエージェントループを設計する方法を変えます。コンテキストを維持したり大きなタスクを分解したりするために複数のAPI呼び出しをチェーン化する代わりに、開発者は単一の長い生成パスに依存できるようになる可能性があります。これにより複雑な推論タスクのアーキテクチャは簡素化されるかもしれませんが、レイテンシとリクエストあたりのコストが増加する恐れがあります。導入価格構造は一時的なコスト優位性を提供しますが、出力トークン100万個あたり20ドルへの計画的な値上げはプレミアム競合他社との整合性を図るものであり、本番アプリケーションでは慎重なコストモデリングが必要です。
できること
- 現在のワークフローを評価し、迅速なコード生成よりも長文コンテキスト推論から恩恵を受けるタスクを特定してください。
- あなたの組織が早期テスト機会に該当する場合は、Fairwind Programへのアクセスを申請してください。
- AutomationBenchやVals Indexで報告されているスコアに対して既存のエージェントをベンチマークし、潜在的なパフォーマンス向上を推定してください。
- より高い出力制限と関連コストへの移行に備えるため、トークン使用パターンを確認してください。
- 有料API顧客とAI Ultraサブスクライバー向けのロールアウトスケジュールを監視し、統合のタイムラインを計画してください。
- 脆弱性調査プログラムに参加する場合、サイバーガードレールなしでモデルを使用することのセキュリティ上の影響を検討してください。

