オープン&ローカルAI

Magnitude: ハードウェアに合わせて自動チューニングするオープンソース推論エンジン

Magnitude はデバイス上でカーネルをコンパイルし調整することで、Apple Silicon、NVIDIA、AMD、CPU環境において llama.cpp より最大2倍高速にオープンモデルを実行します。

A microchip connected to a glass cube with a neural network inside
この記事用に生成されたイラスト

英語の原文から自動翻訳されました。

GitHub は、AIエージェント専用に設計されたオープンソース推論エンジン「Magnitude」を発表しました。2026年9月下旬にリリースされたこのツールは、実行されるハードウェアに最適化されるよう自己調整を行い、ユーザーのデバイス上で直接カーネルのコンパイルとチューニングを実施します。プロジェクト側によれば、厳格なローカルプライバシーを維持しつつ、llama.cpp の最大2倍のパフォーマンス向上を実現するとされています。

何が起きたか

Magnitude は macOS、Windows、Linux で利用可能なデスクトップアプリケーションとして提供されています。オープンウェイトモデルのスタンドアロンランナーとしても、人気のあるAIコーディングエージェントのバックエンドとしても機能します。インストールプロセスは簡素化されており、ユーザーはアプリをダウンロードし、内蔵の Discover セクションから推奨モデルを選択し、Connections タブを通じてお好みのエージェントを接続するだけです。デスクトップパッケージには magnitude コマンドラインインターフェースも含まれており、別途ツールをインストールする必要はありません。

Magnitude の核心的な違いは、カーネル最適化のアプローチにあります。広範なハードウェアクラス向けに事前コンパイルされたカーネルを提供する汎用エンジンとは異なり、Magnitude はユーザーのマシン内の特定のチップに対して JIT(ジャストインタイム)コンパイルとチューニングを実行します。この処理はモデルの実行開始前に行われ、数学的な演算がローカルハードウェアの正確な能力と制約に合わせてカスタマイズされることを保証します。これにより、ハイエンドの NVIDIA や AMD GPU から Apple Silicon、さらには固定の最小要件がない CPU のみの構成まで、幅広い設定をサポートできます。

仕組み

パフォーマンス上の利点は、人気のオープンウェイトモデルファミリー向けに手動で最適化されたカーネルに由来します。あらゆるモデル構造に対する万能な解決策を目指して汎用的にするのではなく、特定のアーキテクチャに焦点を当てることで、エンジンはオーバーヘッドを削減します。ユーザーがセッションを開始すると、Magnitude はこれらのカーネルをデバイス上でコンパイルします。つまり、ソフトウェアは M シリーズ Mac、CUDA対応 NVIDIA カード、AMD GPU など、ユーザーのプロセッサ固有の特徴に適応します。

メモリ管理も重要な機械的改善点です。このエンジンは従来の基準と比較して、エージェントあたり27%少ないメモリを使用します。これは、エージェントが動作を停止した際にリソースを解放し、同時進行するセッション間でプレフィックスキャッシュを共有することで達成されます。このキャッシュメカニズムにより、複数のタスクが同時に実行されている場合でも遅延が発生せず、システムは各新規リクエストごとに同一の初期プロンプトやコンテキストウィンドウを再処理する必要がなくなります。

主要な詳細

  • パフォーマンス: llama.cpp と比較して推論速度が最大2倍向上すると主張しており、具体的なベンチマークでは Metal でデコード速度が92%、CUDA で19%向上しています。
  • ハードウェアサポート: Apple Silicon、NVIDIA GPU、AMD GPU、または固定の最小スペックなしの CPU のみシステムで動作します。
  • エージェント統合: Pi、OpenCode、Hermes、Codex、Claude Code、Oh My Pi、Cline、OpenClaw へのワンクリック接続に対応しています。
  • 互換性: その他のエージェントは、提供されている OpenAI 互換 API エンドポイント経由で接続可能です。
  • プライバシー: すべてのプロンプト、ファイル、モデルはローカルマシン上に保持され、初回ダウンロード後はインターネット接続が必要ありません。
  • ライセンス: このプロジェクトは Apache 2.0 ライセンスの下でオープンソースとして公開されています。

なぜ重要なのか

ローカル AI ツールを開発するエンジニアにとって、ボトルネックはしばしば使いやすさとパフォーマンスのトレードオフでした。Ollama や LM Studio などの汎用エンジンは利便性を提供しますが、カーネルが平均的なハードウェアプロファイル向けにコンパイルされているため、パフォーマンス面で妥協が生じる可能性があります。Magnitude は、コンパイルステップをエンドユーザーのデバイスへ移行することでこの問題に対処します。これにより、チームはクラウドインフラストラクチャを必要とせずに、既存のワークステーションでより重いオープンウェイトモデルを展開でき、レイテンシとコストを削減できます。

メモリ効率の改善はマルチタスクにおいても実用的な影響を持ちます。エンジニアはコードレビュー、ドキュメント生成、単体テスト作成など、異なるタスクのために複数のエージェントインスタンスを実行することがよくあります。エージェントあたりのメモリ使用量を27%削減し、プレフィックスキャッシュを共有することで、Magnitude は同じマシン上でより多くの並列ワークフローを可能にします。これにより、ローカル開発環境はよりレスポンスが良くなり、リソース枯渇によるクラッシュや遅延なく、複雑な多段階のエージェントチェーンを処理できるようになります。

できること

  • Magnitude デスクトップアプリをダウンロードしてください。
  • 内蔵の Discover セクションから推奨モデルを選択し、接続したいエージェントを設定してください。

Bytechapストアのツール

$89

DocBento

すべてのスキャンを読み取り、ページ出典を提示して回答するセルフホスト型ドキュメント管理システム。

ライブデモ

続きを読む

オープン&ローカルAI

Bespoke Labs、ローカル推論向け高速9B意思決定モデル「Nimble」をリリース

Bespoke Labsは、Qwen3.5-9Bからファインチューニングされたオープンウェイトの9B意思決定モデル「Nimble」をリリースしました。このモデルは、ローカルハードウェア上で100ミリ秒未満で構造化された質問に対する確率的な回答を提供します。

オープン&ローカルAI

Raspberry Pi 5でLiteRTを使いGemma LLMを実行する

Googleの2026年ガイドでは、LiteRTを使用してRaspberry Pi 5上でGemmaモデルを実行し、クラウド依存なしでロボティクスやエッジエージェント向けのリアルタイム推論を実現する方法が詳細に説明されています。

AIで開発する

Cloudflare Containers、AIエージェント用サンドボックスのオンデマンド実行向けに再アーキテクチャ

CloudflareはContainersインフラストラクチャを更新し、ランタイムでのイメージ選択とファイルシステムスナップショットに対応しました。これにより、AIエージェントワークロードの起動時間が6倍以上短縮されました。

すべての記事