AIエージェント

Holo4:デスクトップ、Web、モバイルワークフローに対応する汎用エージェント

H Companyは、GUI、コード、APIを通じてソフトウェアと連携する一連のエージェント型モデル「Holo4」をリリースしました。27BモデルはOSWorldで85.2%のスコアを記録し、1タスクあたりのコストは0.08ドルです。

英語の原文から自動翻訳されました。

H Companyは2026年9月28日にHolo4を発表し、デスクトップ、Web、モバイル環境を横断して動作するように設計された新しいシリーズのエージェント型モデルを導入しました。今回のリリースには、主に2つのモデルサイズが含まれており、27Bの密結合(Dense)変種と35B-A3BのMixture of Experts変種があります。どちらもH Models API経由で利用可能です。

何が起きたか

この発表は、単一のインターフェースに限定されない汎用的なコンピュータ使用エージェントへの転換を示しています。既存のエージェント型モデルの多くは、グラフィカルユーザーインターフェース(GUI)専用、あるいはAPIを介したツール呼び出し専用に訓練されているのに対し、Holo4は必要に応じてこれらのモード間を切り替えるように構築されています。画面上でのクリックやタイピング、コードの作成と実行、そして同じワークフロー内でのModel Context Protocol(MCP)やAPIツールの呼び出しが可能です。この柔軟性により、レガシーなデスクトップアプリケーションを操作しながら同時に最新のWeb APIをクエリするなど、異なるインタラクション手法を組み合わせて処理する必要があるビジネスタスクに対応できます。

メインのHolo4モデルと同時に、H CompanyはHolotron4 Nanoもリリースしました。これはNemotron 3 Nano Omniモデルに適用された、同社のポストトレーニングスタックの更新版です。この小型モデルは、Holo4で使用された訓練レシピが他のベースモデルにも効果的に転移できることを示しており、GUIワークフローやコーディングサンドボックスにおけるパフォーマンスを大幅に向上させます。また、企業はベンチマークスコアの根拠となるすべての軌跡(トラジェクトリー)をオープンソース化しており、開発者はエージェントの意思決定プロセスの各ステップを再生して確認できます。

仕組み

Holo4は、H Companyの内部にあるAgentic Task Factoryによって生成された膨大なデータセットを用いて、教師ありファインチューニングと強化学習の組み合わせで訓練されました。このファクトリーは、ドキュメント、スクリーンショット、実際のソフトウェアからインタラクティブな環境と検証可能なタスクを自動的に構築します。これまでに約10,000件のタスクが生成されており、Webアプリ、MCPサーバー、デスクトップ環境をカバーしています。訓練プロセスでは、未変更のシードで失敗し、ゴールデンステートで成功するなどの厳格な検証ゲートを通過したタスクのみが保持されるよう保証されています。

訓練パイプラインには3つの主要な段階があります。まず、モデルは1270億トークンに対して教師ありファインチューニングを受けます。そのうち約75%は、タスクファクトリー由来の成功したエージェント軌跡で構成されています。次に、長期的な視野を持つタスクに対する非同期オンライン強化学習を使用して、2つの専門的なLoRAエキスパートが訓練されます。一方のエキスパートはデスクトップおよびWebインタラクションに焦点を当て、もう一方はターミナル、MCP、APIの使用を担当します。最後に、これらのエキスパートを等しい重みでファインチューニング済みモデルに統合し、汎用スキルと専門能力を組み合わせた単一のモデルを作成します。

主要な詳細

  • Holo4 27Bは、OSWorldで85.2%のスコアを達成し、1タスクあたり0.08ドルのコストがかかります。
  • 35B-A3B Mixture of Expertsモデルは、OSWorldで80.8%のスコアを記録し、1タスクあたり0.05ドルです。
  • 長いコンピュータワークフローをテストするOSWorld 2.0において、Holo4 27Bは61.7%のスコアと41.5%の成功率を記録しています。
  • このモデルは、入力256Kトークン、出力1Mトークンのコンテキストウィンドウをサポートしています。
  • モデルの重みは、BF16、FP8、NVFP4、4-bit GGUF形式でHugging Faceで入手可能です。
  • Holotron4 Nanoは、Nemotron 3 Nano OmniのOSWorld CUA GUIスコアを21.0%から76.3%へ向上させます。

なぜ重要なのか

AI駆動の自動化を構築するエンジニアにとって、あらゆるインターフェースと連携できる能力は極めて重要です。現実世界のビジネスワークフローは、APIだけ、またはGUIだけといった形で孤立することはめったにありません。あるタスクでは、PDFビューアからデータを抽出し、Webフォームに入力した後、APIを介してバックエンドプロセスをトリガーする必要が生じるかもしれません。Holo4の汎用的なアプローチにより、開発者はプラットフォームごとに個別のモデルや複雑なルーティングロジックを維持する必要がなくなります。これにより、エージェントシステムのアーキテクチャが簡素化され、堅牢なAPIを持たないレガシーシステムへのAI統合に伴う摩擦が軽減されます。

コスト効率も重要な要素です。Holo4は多くのベンチマークでフロンティアクラスのクローズドソースモデルと競合しますが、そのコストはわずかで済みます。例えば、Opus 5.5はOSWorld 2.0でより高いスコアを出しますが、1タスクあたり8.48ドルかかるのに対し、Holo4 27Bは1.22ドルです。このコスト差により、より広範な評価の実施や、マージン制約が厳しい本番環境でのエージェント展開が可能になります。また、モデルのオープンウェイト natureにより、ローカルデプロイやカスタマイズが可能となり、クラウドベースのAIサービスの企業導入を妨げることが多いデータプライバシーに関する懸念に対処できます。

できること

  • H Models API経由でHolo4 27Bおよび35B-A3Bモデルにアクセスし、特定のワークフローでのパフォーマンスをテストしてください。
  • ローカル推論やファインチューニングのために、お好みの精度形式でHugging Faceからモデルの重みをダウンロードしてください。
  • trajectories.hcompany.aiでオープンソース化された軌跡を確認し、モデルが複雑なマルチステップタスクにどのように対処するかを理解してください。
  • 標準的なツール呼び出しに加え、複雑なマルチステップタスクに対するモデルのアプローチを理解するために、提供されているデータを活用して実験を行ってください。

Bytechapストアのツール

続きを読む

すべての記事