Holo4: tác nhân đa năng cho quy trình làm việc trên máy tính để bàn, web và di động
H Company đã ra mắt Holo4, một loạt các mô hình tác nhân tương tác với phần mềm thông qua giao diện người dùng (GUI), mã nguồn và API. Mô hình 27B đạt điểm số 85,2% trên OSWorld với chi phí $0,08 mỗi tác vụ.
Được dịch tự động từ bản gốc tiếng Anh.
H Company đã ra mắt Holo4 vào ngày 28 tháng 9 năm 2026, giới thiệu một loạt mới các mô hình tác nhân được thiết kế để hoạt động trên môi trường máy tính để bàn, web và di động. Phiên bản phát hành bao gồm hai kích thước mô hình chính: biến thể dày đặc 27B và biến thể Mixture of Experts 35B-A3B, cả hai đều có sẵn qua H Models API.
Điều gì đã xảy ra
Việc ra mắt đánh dấu sự chuyển dịch hướng tới các tác nhân sử dụng máy tính đa năng, không bị giới hạn trong một giao diện duy nhất. Trong khi nhiều mô hình tác nhân hiện có chỉ được huấn luyện riêng cho giao diện người dùng đồ họa hoặc chỉ dành cho việc gọi công cụ qua API, Holo4 được xây dựng để chuyển đổi giữa các chế độ này khi cần thiết. Nó có thể nhấp chuột và gõ phím trên màn hình, viết và thực thi mã, cũng như gọi các công cụ Model Context Protocol (MCP) hoặc API trong cùng một quy trình làm việc. Sự linh hoạt này cho phép nó xử lý các tác vụ kinh doanh đòi hỏi kết hợp nhiều phương thức tương tác khác nhau, chẳng hạn như điều hướng một ứng dụng desktop cũ kỹ đồng thời truy vấn một API web hiện đại.
Cùng với các mô hình Holo4 chính, H Company đã phát hành Holotron4 Nano, một phiên bản cập nhật của ngăn xếp hậu huấn luyện (post-training stack) được áp dụng cho mô hình Nemotron 3 Nano Omni. Mô hình nhỏ hơn này chứng minh rằng công thức huấn luyện dùng cho Holo4 có thể chuyển giao hiệu quả sang các mô hình cơ sở khác, cải thiện đáng kể hiệu suất của chúng trên các quy trình GUI và sandbox lập trình. Công ty cũng đã mở mã nguồn mọi quỹ đạo (trajectory) đằng sau điểm số benchmark của mình, cho phép các nhà phát triển phát lại từng bước trong quá trình ra quyết định của tác nhân.
Cách thức hoạt động
Holo4 được huấn luyện bằng cách kết hợp tinh chỉnh có giám sát (supervised fine-tuning) và học tăng cường (reinforcement learning) trên một tập dữ liệu khổng lồ do Agentic Task Factory nội bộ của H Company tạo ra. Nhà máy này tự động xây dựng các môi trường tương tác và các tác vụ có thể xác minh từ tài liệu, ảnh chụp màn hình và phần mềm thực tế. Nó đã tạo ra khoảng 10.000 tác vụ bao gồm các ứng dụng web, máy chủ MCP và môi trường desktop. Quá trình huấn luyện đảm bảo rằng các tác vụ chỉ được giữ lại nếu chúng vượt qua các cổng kiểm tra nghiêm ngặt, bao gồm thất bại trên các seed chưa được chạm tới và thành công trên các trạng thái chuẩn (golden states).
Quy trình huấn luyện bao gồm ba giai đoạn chính. Đầu tiên, mô hình trải qua quá trình tinh chỉnh có giám sát trên 127 tỷ token, trong đó khoảng 75% là các quỹ đạo tác nhân thành công từ nhà máy tác vụ. Thứ hai, hai chuyên gia LoRA chuyên biệt được huấn luyện bằng phương pháp học tăng cường trực tuyến bất đồng bộ trên các tác vụ dài hạn: một chuyên gia tập trung vào tương tác desktop và web, trong khi chuyên gia kia xử lý việc sử dụng terminal, MCP và API. Cuối cùng, các chuyên gia này được hợp nhất trở lại vào mô hình đã tinh chỉnh với trọng số bằng nhau, tạo ra một mô hình đơn lẻ kết hợp các kỹ năng chung với các khả năng chuyên biệt.
Chi tiết quan trọng
- Holo4 27B đạt điểm số 85,2% trên OSWorld với chi phí $0,08 mỗi tác vụ.
- Mô hình Mixture of Experts 35B-A3B đạt điểm số 80,8% trên OSWorld với chi phí $0,05 mỗi tác vụ.
- Trên OSWorld 2.0, nơi thử nghiệm các quy trình máy tính dài, Holo4 27B đạt điểm 61,7% với tỷ lệ thành công 41,5%.
- Mô hình hỗ trợ cửa sổ ngữ cảnh gồm 256K token đầu vào và 1M token đầu ra.
- Trọng số mô hình có sẵn trên Hugging Face ở các định dạng BF16, FP8, NVFP4 và GGUF 4-bit.
- Holotron4 Nano cải thiện điểm số GUI CUA trên OSWorld của Nemotron 3 Nano Omni từ 21,0% lên 76,3%.
Tại sao điều này quan trọng
Đối với các kỹ sư xây dựng tự động hóa dựa trên AI, khả năng tương tác với bất kỳ giao diện nào là yếu tố then chốt. Các quy trình làm việc kinh doanh thực tế hiếm khi bị cô lập chỉ trong API hoặc chỉ trong GUI. Một tác vụ có thể yêu cầu trích xuất dữ liệu từ trình xem PDF, nhập vào một biểu mẫu web, sau đó kích hoạt một quy trình backend qua API. Cách tiếp cận đa năng của Holo4 có nghĩa là các nhà phát triển không cần phải duy trì các mô hình riêng biệt hoặc logic định tuyến phức tạp cho các nền tảng khác nhau. Điều này đơn giản hóa kiến trúc của các hệ thống tác nhân và giảm bớt ma sát khi tích hợp AI vào các hệ thống cũ thiếu API mạnh mẽ.
Hiệu quả chi phí là một yếu tố quan trọng khác. Holo4 cạnh tranh với các mô hình đóng nguồn hàng đầu (frontier closed-source models) trên nhiều benchmark nhưng với chi phí chỉ bằng một phần nhỏ. Ví dụ, mặc dù Opus 5.5 ghi điểm cao hơn trên OSWorld 2.0, nó tốn $8,48 mỗi tác vụ so với $1,22 của Holo4 27B. Sự chênh lệch chi phí này giúp việc chạy các đánh giá mở rộng và triển khai tác nhân trong môi trường sản xuất với ràng buộc biên lợi nhuận chặt chẽ trở nên khả thi. Bản chất mở trọng số (open-weight) của các mô hình cũng cho phép triển khai cục bộ và tùy chỉnh, giải quyết các lo ngại về quyền riêng tư dữ liệu thường cản trở việc áp dụng AI đám mây trong doanh nghiệp.
Bạn có thể làm gì
- Truy cập các mô hình Holo4 27B và 35B-A3B qua H Models API để kiểm tra hiệu suất của chúng trên các quy trình làm việc cụ thể của bạn.
- Tải xuống trọng số mô hình từ Hugging Face ở định dạng độ chính xác ưu tiên của bạn để suy luận hoặc tinh chỉnh cục bộ.
- Xem xét các quỹ đạo đã mở mã nguồn tại trajectories.hcompany.ai để hiểu cách mô hình tiếp cận các tác vụ đa bước phức tạp.
- Thử nghiệm với Holotron4 Nano để khám phá tiềm năng của các mô hình nhỏ hơn trong việc xử lý các luồng công việc GUI.
