AIで開発する

Ember-1、Kimi K3の精度を維持しつつ大幅な低遅延を実現

独立したベンチマークにより、Fireworks ResearchのEmber-1がKimi K3と同等の精度を達成しながら、推論トークンの使用量を削減し、3.4倍高速に動作することが示されました。

英語の原文から自動翻訳されました。

Fireworks Researchは9月23日、Moonshotのオープンウェイトモデル「Kimi K3」を基盤とした研究プレビュー版として「Ember-1」をリリースしました。独立したテストの結果、Ember-1はベースモデルとほぼ同一の精度を維持しながら、推論トークンの使用量を削減し、推論速度を劇的に向上させることが明らかになりました。この結果は、ディープシンキングモデルに伴う極端な遅延なしに、高品質な推論を求める開発者にとって現実的な選択肢を示唆しています。

何が起きたか

Ember-1の中核となる主張は、複雑なタスクに必要な重要な思考プロセスを保持しつつ、不要な推論ステップを排除することを学習するという点にあります。推論トークンは出力として課金されるため、その削減はコスト低下につながります。Fireworksプラットフォームでは、Ember-1の入力トークン100万あたり3ドル、出力トークン100万あたり15ドルで提供されています。これはFireworksにおけるKimi K3の価格と一致しますが、他のプロバイダーではKimi K3を入力トークン100万あたり最低1ドル、出力トークン100万あたり9ドルで提供している場合があります。この価格差により、純粋なコスト削減効果は選択するプロバイダーに大きく依存するため、Ember-1の主な差別化要因はパフォーマンスと速度となります。

これらの主張を検証するために、独立したベンチマークでは、両モデルを段階的に難易度が上がる3つのタスク(論理パズル、デプロイメントスケジューリング、確率計算)でテストしました。各テストは整合性を確保するために、各モデルで5回実行されました。論理パズルでは、特定の制約に基づいてエンジニアにサーバーを割り当てる問題が含まれており、エンジニアの人数が4人から7人に増えるにつれて複雑さが増加しました。デプロイメントスケジューリングタスクでは、依存関係やブラックアウトウィンドウがある12サービスの最速ロールアウトを見つける必要がありました。確率テストでは、サーキットブレーカー付きのリトライシステムに関する正確な分数を求め、200万リクエストのシミュレーションで検証しました。

結果として、Ember-1は15回の試行のうち14回を完璧に解いた一方、Kimi K3は15回すべてを完璧に解きました。Ember-1の唯一のエラーは確率テストで発生し、軽微な算術ミスが subsequent answers(後続の回答)の不正確さにつながりました。このように精度ではほぼ同等のパリティを見せましたが、Ember-1は効率面で顕著な優位性を示しました。全体的に推論トークンを23%少なく使用し、Kimi K3と比較してテストスイートの完了時間が3.4倍短縮されました。Fireworksプラットフォーム上では、この効率性はEmber-1の総コスト2.48ドルに対し、Kimi K3は3.26ドルという結果に反映されました。

仕組み

Ember-1は、強力な推論能力で知られる一方で推論速度が遅いことで知られるMoonshotのKimi K3の上に直接構築されています。最適化技術は、推論フェーズ中のトークン生成に焦点を当てています。すべての問題に対して長い思考チェーンを生成する代わりに、Ember-1は冗長な論理ステップを識別しスキップしようとします。このプロセスにより生成される出力トークンの数が減少し、課金と遅延の両方に直接的な影響を与えます。

推論トークンは出力として課金されるため、思考長の短縮は、トークン単位で課金するプロバイダーを使用する場合のクエリごとの即時コストを下げます。しかし、アーキテクチャの変更は計算グラフも簡素化しており、実時間(wall-clock time)の短縮につながっています。ベンチマークでは、複雑な論理パズルに対するEmber-1の平均応答時間は4分未満でしたが、Kimi K3は12分以上かかりました。この速度差は、ユーザーの待ち時間を最小限にする必要があるインタラクティブなアプリケーションにおいて極めて重要です。

主要な詳細

  • Ember-1は、Kimi K3と比較してテストスイート全体を3.4倍速く完了しました。
  • モデルは、すべてのテストにおいて平均で23%少ない推論トークンを使用しました。
  • Ember-1は15回中14回の完璧な実行を達成し、確率セクションで1件の軽微な算術エラーが発生しました。
  • Kimi K3は15回中15回の完璧な実行を達成し、この特定のベンチマークにおいてやや一貫性が高いことを示しました。
  • Fireworks上では、Ember-1のテストスイートのコストは2.48ドルで、Kimi K3の3.26ドルと比較されます。
  • より安価なプロバイダー経由でルーティングした場合、Kimi K3は同じワークロードで最低1.96ドルまで下がり、Ember-1の価格を下回る可能性があります。

なぜ重要なのか

AI駆動製品を開発するエンジニアリングチームにとって、精度、コスト、遅延のトレードオフは常に存在します。Kimi K3のような深い推論モデルは、難しい問題に対して優れた精度を提供することが多いですが、膨大なトークン生成により高い遅延とコストに苦しみます。Ember-1は、精度の利点の大部分を維持しながら速度を大幅に向上させることが可能であることを示しています。3.4倍の高速化は、利用可能なインタラクティブ機能とバックグラウンドバッチ処理の間の違いを生み出し、深い推論モデルが有効なアプリケーションの範囲を広げます。

ただし、コストメリットは普遍的ではありません。速度よりも絶対的な最低コストを優先する開発者は、OpenRouterなどのプラットフォーム上の予算重視のプロバイダー経由でKimi K3をルーティングすることで、より良い価格を得ることができます。Ember-1の価値提案は、応答までの時間がクリティカルなユースケースで最も強くなります。アプリケーションがほぼ瞬時の推論応答を必要とする場合、Ember-1は、Kimi K3の最も安いオプションよりもトークン単位の価格が高かったとしても、より遅いベースモデルに対する魅力的な代替案を提供します。

できること

  • 5分未満の遅延が必要なインタラクティブ機能のためにEmber-1を評価してください。
  • 反復サイクルの高速化によって節約された開発者の時間を考慮に入れて、総所有コストを比較してください。
  • アプリケーションが低い請求額のために高い遅延を許容できる場合は、低コストのプロバイダーでKimi K3をテストしてください。
  • 高リスクな数学的計算のためにEmber-1を使用する場合は、リトライロジックまたは検証手順を実装してください。
  • 提供されたプロンプト構造を使用して、独自ドメイン特化型のベンチマークを実行し、精度を検証してください。
  • Ember-1が研究プレビューから一般公開に移行するにつれて、Fireworks Researchからの更新を監視してください。

Bytechapストアのツール

$89

DocBento

すべてのスキャンを読み取り、ページ出典を提示して回答するセルフホスト型ドキュメント管理システム。

ライブデモ

続きを読む

すべての記事