Bốn mô hình kỹ thuật từ các bài dự án AI agent xuất sắc nhất
Google đã phân tích các bài dự thi chiến thắng trong Thử thách AI Agents 2026 để xác định bốn mô hình kỹ thuật có thể tái sử dụng nhằm xây dựng hệ thống đa tác nhân (multi-agent) vững chắc.
Được dịch tự động từ bản gốc tiếng Anh.
Trong một bài đăng trên Google Developers Blog vào tháng 9 năm 2026, các kỹ sư đã tóm tắt những quyết định kiến trúc then chốt từ cuộc thi Google for Startups AI Agents Challenge. Phân tích này tập trung vào hàng nghìn bài dự thi trên toàn cầu, tách biệt bốn mô hình cụ thể giúp phân loại các bài dự thi xếp hạng cao so với phần còn lại. Những thực hành này giải quyết các bẫy thường gặp về đồng thời hóa (concurrency), quản lý chi phí và tích hợp hệ thống cho các tác nhân tự động.
Điều gì đã xảy ra
Cuộc thi Google for Startups AI Agents Challenge vừa kết thúc gần đây, với hàng nghìn nhà phát triển gửi các tác nhân (agents) thuộc ba hạng mục khác nhau. Ban giám khảo đánh giá các dự án này, lưu ý rằng mặc dù nhiều bài dự thi tuyên bố sử dụng hệ thống đa tác nhân, chỉ một số ít triển khai kiến trúc thực sự tinh vi. Nhiều bài dự thi đơn thuần là các mô hình đơn lẻ thực hiện chuỗi câu lệnh (chained prompts) với các nhãn tác nhân khác nhau được gán thêm. Tuy nhiên, các bài dự thi xếp hạng cao nhất luôn thể hiện bốn mô hình kỹ thuật riêng biệt giúp cải thiện độ tin cậy và hiệu suất.
Những mô hình này xuất phát từ mã nguồn thực tế của các bài dự thi chứ không phải từ thiết kế lý thuyết. Báo cáo đã ẩn danh các đội ngũ để tập trung vào chính các quyết định kỹ thuật. Các chiến lược được xác định bao gồm việc sử dụng giao thức Model Context Protocol (MCP) hai chiều, đồng thời hóa dựa trên sự kiện (event-driven concurrency), kiểm tra nghiêm ngặt khi chuyển đổi phương án dự phòng (fallback validation) và định tuyến yêu cầu theo tầng (tiered request routing). Những cách tiếp cận này giúp các đội ngũ xây dựng hệ thống có thể xử lý tải trọng và độ phức tạp thực tế mà không chỉ phụ thuộc vào các mô hình lớn hơn hoặc mới hơn.
Cách hoạt động
Mô hình đầu tiên liên quan đến việc biến một tác nhân thành cả máy khách (client) và máy chủ (server) bằng cách sử dụng MCP. Thông thường, các tác nhân dùng MCP để gọi các công cụ bên ngoài nhằm lấy dữ liệu. Trong các bài dự thi chiến thắng, các tác nhân cũng công khai các công cụ suy luận nội bộ của chúng dưới dạng máy chủ MCP. Điều này cho phép các tác nhân khác truy vấn trực tiếp chúng mà không cần can thiệp của con người. Ví dụ, một tác nhân lập trình có thể hỏi một tác nhân hiệu suất về một công việc cụ thể thông qua MCP, tránh nhu cầu sử dụng giao diện trò chuyện. Cách tiếp cận này đòi hỏi kiểm soát truy cập nghiêm ngặt vì các bên gọi bên ngoài giờ đây có thể kích hoạt trực tiếp lớp suy luận. Nó cũng ngăn chặn tình trạng cạn kiệt ngân sách token bằng cách lọc dữ liệu theo chương trình trước khi dữ liệu đó đi vào ngữ cảnh của mô hình.

Mô hình thứ hai thay thế các chuỗi gọi tuyến tính bằng đồng thời hóa dựa trên sự kiện. Thay vì Tác nhân A gọi Tác nhân B và chờ phản hồi, các tác nhân công bố các sự kiện có kiểu dữ liệu rõ ràng lên một bus chung. Mỗi tác nhân đăng ký các chủ đề liên quan và xử lý các sự kiện song song bằng các coroutine worker riêng biệt. Điều này tách rời các tác nhân có nhịp độ xử lý khác nhau. Ví dụ, một bước kiểm tra tuân thủ có thể chạy đồng thời với một tác vụ nhắn tin nếu chúng không phụ thuộc vào đầu ra của nhau. Cách làm này giảm tổng độ trễ vì không có tác nhân chậm nào chặn toàn bộ quy trình.
Mô hình thứ ba đảm bảo các mô hình dự phòng đáp ứng cùng tiêu chuẩn chất lượng như các mô hình chính. Khi một mô hình cao cấp như Gemini 3.1 Pro trả về lỗi dưới tải nặng, các hệ thống thường chuyển sang một lựa chọn rẻ hơn như Gemini 3.6 Flash. Các bài dự thi hàng đầu đã sử dụng một hàm kiểm tra duy nhất cho cả hai đường dẫn. Hàm này kiểm tra các trích dẫn hoặc các chỉ số chất lượng khác trước khi chấp nhận bất kỳ phản hồi nào. Bằng cách tập trung hóa việc kiểm tra, các đội ngũ ngăn chặn tình trạng các phương án dự phòng âm thầm hạ thấp chất lượng đầu ra. Mô hình thứ tư sử dụng định tuyến theo tầng để giảm chi phí suy luận. Các truy vấn đơn giản được xử lý bởi regex cục bộ hoặc các mô hình rẻ tiền trước khi đi tới các mô hình biên giới đắt đỏ. Một đội ngũ báo cáo rằng bước xử lý đầu tiên này đã giải quyết hơn 40% tin nhắn, tiết kiệm đáng kể ngân sách.
Chi tiết chính
- MCP hai chiều cho phép các tác nhân công khai các công cụ nội bộ dưới dạng máy chủ để các tác nhân khác gọi trực tiếp.
- Kiến trúc dựa trên sự kiện sử dụng các bus tín hiệu chung để cho phép xử lý song song thay vì chặn tuần tự.
- Các mô hình dự phòng phải vượt qua cùng các hàm kiểm tra như các mô hình chính để duy trì tiêu chuẩn chất lượng.
- Định tuyến theo tầng lọc các yêu cầu đơn giản bằng regex hoặc các mô hình rẻ tiền trước khi kích hoạt các công cụ suy luận đắt đỏ.
- Các bài dự thi hàng đầu thường xuyên sử dụng Agent Development Kit (ADK) và Agents CLI để triển khai những mô hình này.
- Kiểm soát truy cập là yếu tố then chốt khi công khai các công cụ của tác nhân ra bên ngoài thông qua máy chủ MCP.
Tại sao điều này quan trọng
Đối với các kỹ sư phần mềm xây dựng sản phẩm AI, những mô hình này cung cấp các giải pháp thực tiễn cho vấn đề khả năng mở rộng và chi phí. Các chuỗi tác nhân tuyến tính thường thất bại trong điều kiện thực tế vì độ trễ cộng dồn qua mỗi bước. Chuyển sang mô hình dựa trên sự kiện cho phép các hệ thống mở rộng ngang và phản hồi nhanh hơn với các tín hiệu quan trọng. Điều này đặc biệt quan trọng trong các ứng dụng nhạy cảm về thời gian như giám sát y tế, nơi sự chậm trễ có thể gây ra hậu quả nghiêm trọng.

Quản lý chi phí là một mối lo ngại lớn khác khi giá suy luận vẫn còn cao. Định tuyến theo tầng đảm bảo rằng các mô hình đắt đỏ chỉ được sử dụng cho các tác vụ phức tạp thực sự đòi hỏi suy luận sâu. Tương tự, MCP hai chiều biến các tác nhân thành các thành phần cơ sở hạ tầng có thể tái sử dụng thay vì các chatbot cô lập. Điều này cho phép tính kết hợp (composability), nơi tác nhân của đội ngũ này có thể trở thành công cụ cho quy trình làm việc của đội ngũ khác mà không cần xây dựng các tích hợp tùy chỉnh. Những mô hình này nhấn mạnh vào kỹ thuật vững chắc hơn là kích thước mô hình, chứng minh rằng kiến trúc thường quan trọng hơn sức mạnh thô của mô hình.
Bạn có thể làm gì
- Kiểm toán quyền truy cập dữ liệu của tác nhân để xem liệu các công cụ MCP nội bộ có thể được công khai an toàn dưới dạng máy chủ bên ngoài hay không.
- Xác định các tác nhân đang chờ lẫn nhau và tái cấu trúc chúng để sử dụng một bus sự kiện cho việc thực thi song song.
- Tập trung hóa logic kiểm tra để các mô hình dự phòng không thể bỏ qua các bước kiểm tra chất lượng áp dụng cho các mô hình chính.
- Phân tích phân phối lưu lượng truy cập để xác định xem các truy vấn đơn giản có thể được xử lý bởi các mô hình rẻ tiền hoặc regex hay không.
- Triển khai các biện pháp kiểm soát truy cập nghiêm ngặt nếu bạn công khai các công cụ của tác nhân qua MCP để ngăn chặn việc sử dụng trái phép.
- Sử dụng các framework như ADK hỗ trợ đồng thời hóa và chia sẻ công cụ để đơn giản hóa việc triển khai những mô hình này.



