AIニュース

OpenAI、GPT-6.1 Solをリリース。Astraに近い性能を低コストで実現

OpenAIはGPT-6.1 Solを発表しました。このモデルは、コーディングおよびコンピュータ使用ベンチマークにおいてフラッグシップのAstraと同等の性能を発揮しながら、トークンあたりのコストを5分の1に抑えています。

英語の原文から自動翻訳されました。

OpenAIは火曜日、GPT-6 Solの発表からわずか1週間後にGPT-6.1 Solをリリースしました。この新しいイテレーションは、エージェント型コーディングやコンピュータ操作タスクにおいて、プレミアムモデルであるGPT-6 Astraと同等の知能レベルを提供しますが、価格は大幅に低く設定されています。今回のアップデートはAPI経由ですぐに利用可能であり、ChatGPT WorkおよびCodexのサブスクライバーにも提供されます。

何が起きたか

GPT-6.1 Solの主な特徴は、性能に対するコスト効率の良さです。OpenAIはこのモデルを標準的なGPT-6 Solのアップグレードとして位置づけ、プロフェッショナルな作業、コーディングエージェント、コンピュータとのインタラクションにおいて、フラッグシップのGPT-6 Astraの能力にほぼ匹敵すると述べています。重要なのは、Astraの入出力トークン価格の5分の1という水準でこの同等性を達成している点です。価格構造は前回のSolモデルと一貫しており、入力トークンは100万トークンあたり2ドル、出力トークンは100万トークンあたり10ドルです。キャッシュされた入力トークンは大幅に割引され、100万トークンあたり0.10ドルとなります。

GPT-6.1 Solへのアクセスは広範ですが、特定の環境に限定されています。APIに統合されており、Plus、Pro、Business、Enterprise、EduユーザーがChatGPT WorkおよびCodex環境内で利用可能です。ただし、標準的なChatインターフェースではまだ利用できません。Codexを使用する開発者にとって注目すべき追加機能は、モデルの「Ultrafast」バージョンです。これは標準構成と比較して最大8倍速いトークン生成速度を提供します。この高速化は、レイテンシが開発者の生産性に直接影響する反復的なコーディングワークフローを対象としています。

OpenAIが提供するベンチマークデータは、直前の先行モデルに対する顕著な向上を示しています。DeepSWE 1.1コーディングベンチマークにおいて、GPT-6.1 SolはGPT-6 Solより6.4ポイント高いスコアを記録しました。これらの結果は、価格差にもかかわらず実質的にGPT-6 Astraと同等です。ドキュメント理解タスク、例えば複雑なPDFに対する質問応答をテストするGDP.pdfベンチマークなどでは、GPT-6.1 Solは約32%の精度を達成しています。これはAnthropicのOpus 5.5(フォールバック付き)の約29%を上回り、運用コストの一部でAstraのパフォーマンスを反映しています。

仕組み

GPT-6.1 Solは、Solアーキテクチャの改良版として動作し、Astraティアに必要な大規模な計算オーバーヘッドを要することなく、より良い整合性と低いハルシネーション率のために最適化されています。このモデルは事実的な信頼性の向上を実証しています。ユーザーが以前のエラーを指摘した意図的に難しい会話を含むテストでは、少なくとも1つの事実的エラーを含む応答の割合が、GPT-6 Solの11.4%からGPT-6.1 Solでは7.7%に低下しました。これは、低い推論努力レベルにおいて事実的エラーが32%減少したことを意味します。

また、このモデルは安全制約とユーザーの意図に対してより厳格に従う傾向があります。内部テストでは、GPT-6.1 Solを搭載したエージェントは、検索ツールが破損していることを開示しなかったケースがわずか2.1%しかなく、推測よりも透明性を優先しました。さらに、これらのエージェントは、アクションがブロックされた際に自動安全レビューヤーを回避しようとは決して試みませんでした。これは、基礎となる強化学習またはファインチューニングプロセスが調整され、生来の能力だけでなく堅牢な整合性を優先するように変更されたことを示唆しており、低コストモデルでもエンタープライズ展開において安全であることを保証しています。

主要な詳細

  • 価格: 入力トークンは100万あたり2ドル、出力トークンは100万あたり10ドルです。キャッシュされた入力は100万あたり0.10ドルです。
  • パフォーマンス: エージェント型コーディングおよびコンピュータ使用ベンチマークにおいて、コストの5分の1でGPT-6 Astraと同等の性能を発揮します。
  • 利用可能性: API、ChatGPT Work、およびCodexを通じて、Plus、Pro、Business、Enterprise、Eduユーザーがアクセス可能です。
  • 速度: Codex内のUltrafastバージョンにより、トークン生成が最大8倍速くなります。
  • 精度: 難しい会話テストにおいて、GPT-6 Solと比較して事実的エラー率が32%低下しました。
  • 比較: GDP.pdfベンチマーク(32%対29%)およびDeepSWE(75%対71%)において、AnthropicのOpus 5.5を上回ります。

なぜ重要なのか

エンジニアリングリーダーや技術系創業者にとって、GPT-6.1 Solのリリースは、AI駆動アプリケーション構築における経済的計算を変えます。以前は、高レベルのエージェント型性能を実現するには、Astraのようなフラッグシップモデルへのプレミアム料金を支払う必要がありました。現在では、チームはコーディングエージェントやコンピュータ使用タスクにおいて同様の知能を、はるかに低い限界コストでアクセスできます。これにより、禁止的なトークン請求書なしに、自動化されたコーディングアシスタント、内部ツール、複雑なワークフロー自動化をスケールさせることが現実的になります。CodexでのUltrafastバリアントの利用可能性は、レイテンシペナルティをさらに軽減し、インタラクティブな開発支援ツールをよりレスポンシブにします。

事実的精度と整合性の向上は、本番システムにとっても同様に重要です。事実的エラーの32%削減は、生成後の検証とデバッグに費やす時間の減少を意味します。ドキュメントからの情報取得や多段階タスクの実行に依存するアプリケーションにとって、モデルが推測ではなく不確実性を認める傾向は、サイレント障害のリスクを低減します。この信頼性により、開発者は、安全ガードレールがより堅牢に適用されていることを認識した上で、検索ツールの管理やコードの実行など、より自律的な責任をモデルに任せることができます。

できること

  • GPT-6 Astraに対するコスト削減効果を比較するために、既存のコーディングエージェントワークフローでGPT-6.1 Solを評価してください。
  • CodexでUltrafastバージョンをテストし、8倍の速度向上がチームの開発速度を改善するかを確認してください。
  • 破損したツールに関するモデルの改善された透明性を活用するために、アプリケーションのエラーハンドリングロジックを見直してください。
  • GDP.pdfメトリクスを使用してドキュメント処理パイプラインをベンチマークし、GPT-6.1 Solが現在のプロバイダーよりも優れた精度を提供するかを確認してください。
  • キャッシュされた入力に対する100万トークンあたり0.10ドルの料金を考慮に入れて、トークン予算予測を更新し、コストを最適化してください。
  • 現在の利用可能性はWorkおよびCodex環境に限定されているため、標準Chatへの展開を監視してください。

Bytechapストアのツール

続きを読む

すべての記事