Holo4: Ein Generalist-Agent für Desktop-, Web- und Mobile-Workflows
H Company hat Holo4 veröffentlicht, eine Reihe von Agenten-Modellen, die über GUIs, Code und APIs mit Software interagieren. Das 27B-Modell erzielt 85,2 % auf OSWorld bei Kosten von 0,08 USD pro Aufgabe.
Automatisch aus dem englischen Original übersetzt.
H Company hat am 28. September 2026 Holo4 eingeführt, eine neue Serie von Agenten-Modellen, die für den Einsatz in Desktop-, Web- und Mobilumgebungen konzipiert sind. Die Veröffentlichung umfasst zwei primäre Modellgrößen: eine dichte Variante mit 27B Parametern und eine Mixture-of-Experts-Variante mit 35B-A3B Parametern, beide verfügbar über die H Models API.
Was passiert ist
Der Start markiert einen Wandel hin zu generalistischen Computer-Nutzungs-Agenten, die nicht auf eine einzelne Schnittstelle beschränkt sind. Während viele bestehende Agenten-Modelle entweder ausschließlich für grafische Benutzeroberflächen oder strikt für Tool-Calls über APIs trainiert werden, ist Holo4 so aufgebaut, dass es je nach Bedarf zwischen diesen Modi wechseln kann. Es kann auf einem Bildschirm klicken und tippen, Code schreiben und ausführen sowie Model Context Protocol (MCP)- oder API-Tools innerhalb desselben Workflows aufrufen. Diese Flexibilität ermöglicht es ihm, Geschäftsaufgaben zu bewältigen, die die Kombination verschiedener Interaktionsmethoden erfordern, wie etwa die Navigation einer Legacy-Desktop-Anwendung bei gleichzeitiger Abfrage einer modernen Web-API.
Neben den Hauptmodellen von Holo4 hat H Company Holotron4 Nano veröffentlicht, eine aktualisierte Version seines Post-Training-Stacks, angewendet auf das Nemotron 3 Nano Omni Modell. Dieses kleinere Modell zeigt, dass das für Holo4 verwendete Trainingsrezept effektiv auf andere Basismodelle übertragen werden kann und deren Leistung bei GUI-Workflows und Coding-Sandboxes erheblich verbessert. Das Unternehmen hat zudem jede Trajektorie hinter seinen Benchmark-Ergebnissen als Open Source bereitgestellt, sodass Entwickler jeden Schritt des Entscheidungsprozesses des Agenten nachvollziehen können.
Wie es funktioniert
Holo4 wurde unter Verwendung einer Kombination aus Supervised Fine-Tuning und Reinforcement Learning auf einem umfangreichen Datensatz trainiert, der von H Companys interner Agentic Task Factory generiert wurde. Diese Fabrik erstellt automatisch interaktive Umgebungen und verifizierbare Aufgaben aus Dokumentationen, Screenshots und echter Software. Sie hat ungefähr 10.000 Aufgaben produziert, die Web-Apps, MCP-Server und Desktop-Umgebungen abdecken. Der Trainingsprozess stellt sicher, dass Aufgaben nur beibehalten werden, wenn sie strenge Verifikations-Gates bestehen, einschließlich des Scheiterns bei unberührten Seeds und des Bestehens bei Golden States.
Die Trainings-Pipeline umfasst drei Schlüsselphasen. Erstens wird das Modell mittels Supervised Fine-Tuning auf 127 Milliarden Tokens trainiert, wobei etwa 75 % aus erfolgreichen Agenten-Trajektorien aus der Task Factory bestehen. Zweitens werden zwei spezialisierte LoRA-Experten mittels asynchronem Online-Reinforcement-Learning auf Langzeit-Horizont-Aufgaben trainiert: Ein Experte konzentriert sich auf Desktop- und Web-Interaktionen, während der andere Terminal-, MCP- und API-Nutzung abdeckt. Schließlich werden diese Experten mit gleichem Gewicht wieder in das feinabgestimmte Modell integriert, wodurch ein einzelnes Modell entsteht, das allgemeine Fähigkeiten mit spezialisierten Kompetenzen kombiniert.
Wichtige Details
- Holo4 27B erreicht eine Punktzahl von 85,2 % auf OSWorld bei Kosten von 0,08 USD pro Aufgabe.
- Das 35B-A3B Mixture of Experts Modell erzielt 80,8 % auf OSWorld bei 0,05 USD pro Aufgabe.
- Auf OSWorld 2.0, das lange Computer-Workflows testet, erreicht Holo4 27B 61,7 % mit einer Erfolgsrate von 41,5 %.
- Das Modell unterstützt ein Kontextfenster von 256K Eingabe-Tokens und 1M Ausgabe-Tokens.
- Gewichte sind auf Hugging Face in den Formaten BF16, FP8, NVFP4 und 4-bit GGUF verfügbar.
- Holotron4 Nano verbessert den OSWorld CUA GUI Score von Nemotron 3 Nano Omni von 21,0 % auf 76,3 %.
Warum es wichtig ist
Für Ingenieure, die KI-gesteuerte Automatisierung entwickeln, ist die Fähigkeit, mit jeder beliebigen Schnittstelle zu interagieren, entscheidend. Reale Geschäftsworkflows sind selten nur auf APIs oder nur auf GUIs beschränkt. Eine Aufgabe könnte erfordern, Daten aus einem PDF-Viewer zu extrahieren, sie in ein Webformular einzugeben und dann einen Backend-Prozess über eine API auszulösen. Holo4s generalistischer Ansatz bedeutet, dass Entwickler keine separaten Modelle oder komplexe Routing-Logik für verschiedene Plattformen pflegen müssen. Dies vereinfacht die Architektur von Agenten-Systemen und reduziert die Reibungsverluste bei der Integration von KI in Legacy-Systeme, denen robuste APIs fehlen.
Kosteneffizienz ist ein weiterer wichtiger Faktor. Holo4 konkurriert auf vielen Benchmarks mit Frontier-Closed-Source-Modellen, jedoch zu einem Bruchteil der Kosten. Zum Beispiel erzielt Opus 5.5 zwar höhere Werte auf OSWorld 2.0, kostet aber 8,48 USD pro Aufgabe im Vergleich zu 1,22 USD für Holo4 27B. Dieser Kostenunterschied macht es machbar, umfangreichere Evaluierungen durchzuführen und Agenten in Produktionsumgebungen einzusetzen, in denen Margenbeschränkungen eng sind. Die Open-Weight-Natur der Modelle ermöglicht zudem lokale Bereitstellung und Anpassung, was Datenschutzbedenken adressiert, die oft die Einführung cloudbasierter KI-Dienste in Unternehmen behindern.
Was Sie tun können
- Greifen Sie über die H Models API auf die Modelle Holo4 27B und 35B-A3B zu, um ihre Leistung in Ihren spezifischen Workflows zu testen.
- Laden Sie die Modellgewichte von Hugging Face in Ihrem bevorzugten Präzisionsformat herunter, um lokale Inferenz oder Feinabstimmung durchzuführen.
- Prüfen Sie die als Open Source bereitgestellten Trajektorien auf trajectories.hcompany.ai, um zu verstehen, wie das Modell komplexe mehrstufige Aufgaben angeht.
- Experimentieren Sie mit Holotron4 Nano, um dessen Fähigkeiten in Ihrer Umgebung zu erkunden.
