オープン&ローカルAI

Bespoke Labs、ローカル推論向け高速9B意思決定モデル「Nimble」をリリース

Bespoke Labsは、Qwen3.5-9Bからファインチューニングされたオープンウェイトの9B意思決定モデル「Nimble」をリリースしました。このモデルは、ローカルハードウェア上で100ミリ秒未満で構造化された質問に対する確率的な回答を提供します。

デスクの上で光る回路を持つ金属製の立方体で、Nimble AIモデルを表しています。
この記事用に生成されたイラスト

英語の原文から自動翻訳されました。

Bespoke Labsは、高速なローカル推論用に設計された新しいオープンウェイトの意思決定モデル「Nimble」をリリースしました。Qwen3.5-9Bアーキテクチャからファインチューニングされたこの90億パラメータのモデルにより、開発者はテキストと一連の構造化された質問を送信し、従来の推論ステップを経ることなく確率的な回答を受け取ることができます。今回のリリースには明確なAPIドキュメントとパフォーマンス指標が含まれており、効率的なエッジ処理機能を必要とするエンジニアをターゲットとしています。

何が起きたか

Nimbleは、生成創造性よりも速度と構造化出力を優先する専門的な意思決定モデルへの転換を表しています。推論プロセスを通じてトークンごとにテキストを生成する標準的な大規模言語モデルとは異なり、Nimbleは定義された選択肢セットから回答を選ぶように最適化されています。質問ごとにプロンプトを一度読み取り、回答トークンを直接スコアリングします。このアーキテクチャ上の選択により、思考連鎖(Chain-of-Thought)推論に伴うレイテンシが排除され、M5 Maxチップを搭載したMacBook Pro上で100ミリ秒未満での結果返却が可能になります。

本モデルはApache 2.0ライセンスの下で提供されており、商用プロジェクトおよびオープンソースプロジェクトの両方に適しています。Bespoke Labsは、正解を反転させる単一の具体的な事実のみが異なる2つの例を含むデータセット構築手法である対照ペア(contrastive pairs)を用いてNimbleを訓練しました。この訓練戦略により、モデルは一般的な言語パターンではなく、正確な事実的差異に焦点を当てることが可能になります。開発者はコマンド ollama pull nimble を使用してOllama経由でモデルを直接取得でき、最小限の設定で既存のローカルワークフローに統合できます。

仕組み

Nimbleは、TypeSafe社のJev API標準に準拠したOllamaの /v1/systemone エンドポイントを介して動作します。インタラクションモデルは通常のチャットインターフェースとは異なります。ユーザーは評価対象のテキストを state フィールドに入力します。これは単純な文字列でも構造化されたJSONオブジェクトでも可能です。stateとともに、ユーザーは1回のリクエストで最大64個の名前付き質問を送信します。モデルは提供されたテキストに対してこれらの質問を処理し、質問された順序と同じ順序で回答を返します。

システムは主に3種類の質問タイプをサポートしています:選択式、二値真偽検証、ルーブリック採点です。選択式の質問では、ユーザーが選択肢リストを定義し、モデルはすべての選択肢に対する確率とともに選択された選択肢を返します。API内で noul と呼ばれる二値質問は、関連付けられた確率付きで真または偽の判定を返します。スコア質問では、ユーザーが特定の基準を持つ順序付けられたレベルを定義し、確率加重スコアを返すことができます。どの場合においても、モデルは0から1の間で信頼度指標を提供し、確率がどれだけ集中しているかを示しますが、これは正しさの直接的な測定値ではありません。

主要な詳細

  • モデルサイズとベース: Nimbleは、Qwen3.5-9Bからファインチューニングされた90億パラメータのモデルです。
  • パフォーマンス: M5 Maxチップ搭載のMacBook Pro上で100ms未満で回答を提供します。
  • バッチ処理機能: 1回のAPI呼び出しで、同じテキストに関する最大64個の質問を処理できます。
  • 訓練データ: 単一の事実変更によって回答が反転する対照ペアでモデルを訓練しました。
  • ライセンス: Apache 2.0ライセンスの下でリリースされ、幅広い商用利用およびプライベート利用を許可しています。
  • 出力形式: 選択肢、スコア、確率、信頼度指標を含む構造化データを返します。

なぜ重要なのか

本番システムを構築するソフトウェアエンジニアにとって、推論ステップの排除はレイテンシとコストにおいて大きな利点をもたらします。従来の大規模言語モデルは一貫した構造化出力に苦労することが多く、信頼できる意思決定を抽出するために複雑なプロンプトエンジニアリングやポストプロセッシングが必要でした。Nimbleの設計により、すべての応答が事前定義されたスキーマに適合することが保証され、ダウンストリームアプリケーションにおける検証レイヤーやエラーハンドリングの必要性が軽減されます。この信頼性は、顧客サポートチケットのルーティング、コンプライアンスポリシーの適用、コンテンツ品質の評価など、創作的な生成よりも決定的な挙動が好まれるタスクにとって極めて重要です。

このモデルをローカルで高速実行できる能力は、データプライバシーと運用コストに関する懸念の高まりにも対応しています。機密テキストを外部APIに送信せずにデバイス上で処理することで、組織はデータのより厳格な管理を維持できます。さらに、低レイテンシにより、目に見える遅延を導入することなく、即時フォームバリデーションや動的コンテンツフィルタリングなどのユーザー向けアプリケーションでのリアルタイム意思決定が可能になります。モデルのオープンウェイト nature により、チームはその挙動を監査し、特定のドメイン要件向けにさらにファインチューニングを行うことができます。

できること

  • Ollamaをインストールし、コマンド ollama pull nimble を使用してNimbleモデルを取得し、ローカル推論速度をテストしてください。
  • 構造化されたJSON stateを送信し、リクエストごとに最大64個の質問を定義することで、/v1/systemone エンドポイントを実験的に使用してください。
  • Nimbleの選択タイプを使用し、確率スコアに基づいてユーザーリクエストを適切な部門へ振り分けるルーティングシステムを実装してください。
  • スコアタイプを使用し、許容レベルの定義済みルーブリックに対してユーザー生成コンテンツを評価するポリシー執行ツールを構築してください。
  • 二値 noul 質問タイプを使用して、ドキュメント内の特定の条件を検証する自動ファクトチェックパイプラインを作成してください。
  • モデルが返す信頼度指標を監視し、確実性の低い意思決定を人間のレビュー用にフラグ付けすることで、システム全体の信頼性を向上させてください。

Bytechapストアのツール

$89

DocBento

すべてのスキャンを読み取り、ページ出典を提示して回答するセルフホスト型ドキュメント管理システム。

ライブデモ

続きを読む

オープン&ローカルAI

Raspberry Pi 5でLiteRTを使いGemma LLMを実行する

Googleの2026年ガイドでは、LiteRTを使用してRaspberry Pi 5上でGemmaモデルを実行し、クラウド依存なしでロボティクスやエッジエージェント向けのリアルタイム推論を実現する方法が詳細に説明されています。

AIで開発する

Cloudflare Containers、AIエージェント用サンドボックスのオンデマンド実行向けに再アーキテクチャ

CloudflareはContainersインフラストラクチャを更新し、ランタイムでのイメージ選択とファイルシステムスナップショットに対応しました。これにより、AIエージェントワークロードの起動時間が6倍以上短縮されました。

すべての記事