Google Gemini 4 Argon dẫn đầu về công việc tri thức nhưng hạn chế quyền truy cập vào mã hóa
Google đã ra mắt Gemini 4 Argon, một mô hình chủ lực mới vượt trội hơn các đối thủ trong các tác vụ tri thức và suy luận ngữ cảnh dài, mặc dù kết quả mã hóa không đồng nhất và khả năng tiếp cận vẫn còn bị giới hạn.
Được dịch tự động từ bản gốc tiếng Anh.
Google chính thức trình làng Gemini 4 Argon, mô hình trí tuệ nhân tạo chủ lực mới nhất của mình, định vị nó như một giải pháp thay thế ưu việt so với các sản phẩm hiện tại từ OpenAI và Anthropic. Được công bố vào ngày 30 tháng 9 năm 2026, mô hình này thể hiện những lợi thế đáng kể trong công việc tri thức và xử lý ngữ cảnh dài, mặc dù hiệu suất trên các bài kiểm tra chuẩn hóa (benchmark) về mã hóa lại không ổn định. Quyền truy cập vào hệ thống hiện chỉ dành cho một nhóm nhỏ người thử nghiệm và các đối tác chính phủ khi Google áp dụng chiến lược triển khai theo giai đoạn.
Điều gì đã xảy ra
Việc phát hành đánh dấu sự thay đổi trong dòng thời gian AI gần đây của Google, thực tế là thay thế kế hoạch Gemini 3.5 Pro đã được công bố trước đó bằng phiên bản tiên tiến hơn này. Mặc dù ban đầu công ty dự định ra mắt một mô hình Pro mới vào tháng 6 năm 2026, họ lại triển khai một loạt các mô hình Flash trước khi cho ra đời Argon. Thông báo này diễn ra sau cuộc gặp giữa CEO Google Sundar Pichai và Tổng thống Donald Trump, nơi Pichai cùng các lãnh đạo từ Anthropic, Meta, Nvidia, OpenAI và SpaceX ký kết cam kết tự nguyện về việc tự giám sát phát triển AI. Thỏa thuận này thiếu các cơ chế thực thi chính thức nhưng báo hiệu sự phối hợp ngành gia tăng về các tiêu chuẩn an toàn.
Gemini 4 Argon đạt điểm cao nhất hoặc đồng hạng ở 13 trong số 18 bài kiểm tra chuẩn hóa khi so sánh với GPT-6 Astra của OpenAI và Claude Opus 5.5 cũng như Fable 5.1 của Anthropic. Mô hình cho thấy sức mạnh đặc biệt trong các tác vụ liên quan đến tổng hợp thông tin phức tạp và tự động hóa. Ví dụ, nó đạt 51,3% trên AutomationBench của Zapier, cao hơn gần chín điểm so với Claude Opus 5.5. Trong bối cảnh pháp lý, Argon đạt 19,6% trên Legal Agent Benchmark của Harvey, gấp gần ba lần điểm số của Claude Fable 5.1, mặc dù điều này vẫn cho thấy nó chỉ hoàn thành đầy đủ khoảng một phần năm các tác vụ.
Bất chấp những chiến thắng này, mô hình tụt hậu so với các đối thủ trong một số lĩnh vực kỹ thuật cụ thể. Trên bài kiểm tra chuẩn hóa mã hóa FrontierSWE v2, Argon đạt 55,0%, thấp hơn GPT-6 Astra 10,5 điểm và Claude Opus 5.5 chín điểm. Nó cũng xếp cuối cùng trên Terminal-Bench 4.0 trong số các mô hình được so sánh. Những kết quả trái chiều này gợi ý rằng trong khi Argon được tối ưu hóa cho kiến thức chung và quy trình làm việc dựa trên tác nhân (agentic workflows), nó có thể chưa phải là lựa chọn quyết định cho mọi nhiệm vụ kỹ thuật phần mềm. Google dự kiến thu thập phản hồi từ những người thử nghiệm sớm trong Chương trình Fairwind trước khi mở rộng quyền truy cập cho khách hàng API trả phí và thuê bao AI Ultra.
Cách thức hoạt động
Một tính năng nổi bật của Gemini 4 Argon là khả năng xuất dữ liệu (output capacity) được mở rộng. Trong khi một triệu token đầu vào đã trở thành tiêu chuẩn cho các mô hình tiên phong, Argon có thể tạo ra tới một triệu token đầu tiên trong một phản hồi duy nhất. Các mô hình Gemini trước đây bị giới hạn ở 64.000 token đầu ra. Sự gia tăng này cho phép mô hình tham gia vào các quá trình suy luận sâu hơn, tạo ra hàng trăm nghìn token để giải quyết các vấn đề phức tạp trong một chuỗi hành động duy nhất mà không cần chia nhỏ chúng thành các bước nhỏ hơn.
Mô hình cũng tích hợp đào tạo chuyên biệt cho các ứng dụng an ninh mạng. Google đã huấn luyện Argon để tự động xác định, kiểm chứng và vá các lỗ hổng phần mềm. Đối với những người tham gia Chương trình Fairwind và các đội ngũ nội bộ, mô hình được phát hành mà không có một số rào chắn bảo vệ cyber (cyber guardrails) nhất định để tạo điều kiện cho công việc này. Wiz, một công ty an ninh mạng được Google mua lại với giá 32 tỷ USD vào tháng 3 năm 2026, đã sử dụng Argon trong sáng kiến Scan for Good. Với vai trò này, mô hình được cho là đã phát hiện ra một lỗ hổng nghiêm trọng trong phần mềm y tế được sử dụng toàn cầu, thứ mà các mô hình tiên phong trước đó đã bỏ sót.
Chi tiết chính
- Gemini 4 Argon đạt 68,9% trên Vals Index cho công việc tri thức, vượt qua GPT-6 Astra (63,1%) và Claude Opus 5.5 (67,0%).
- Mô hình hỗ trợ lên đến một triệu token đầu ra, một sự gia tăng đáng kể so với giới hạn 64.000 token trong các phiên bản trước.
- Giá khởi điểm được đặt ở mức $2 cho mỗi triệu token đầu vào và $10 cho mỗi triệu token đầu ra, sẽ tăng lên tương ứng $4 và $20 sau này.
- Argon đạt 84,2% trên bài kiểm tra chuẩn hóa GraphWalks cho các đầu vào từ 256K đến 1M token, dẫn trước GPT-6 Astra hơn 12 điểm.
- Trong các bài kiểm tra an ninh mạng, Argon đạt 85,8% trên bài kiểm tra chuẩn hóa nội bộ về phát hiện lỗ hổng của Google và 70,9% trên bài kiểm tra chuẩn hóa về kiểm thử xâm nhập (penetration testing) của Wiz.
- Quyền truy cập hiện bị giới hạn ở Chương trình Fairwind và các đối tác chính phủ Hoa Kỳ, với khả năng tiếp cận rộng rãi hơn dự kiến vào các ngày sau đó.
Tại sao điều này quan trọng
Đối với các nhà phát triển và nhà sáng lập kỹ thuật, hiệu suất mã hóa trái chiều của Gemini 4 Argon gợi ý rằng việc lựa chọn mô hình phải phụ thuộc vào từng tác vụ cụ thể. Mặc dù điểm số cao trên DeepSWE v1.1 (77,9%) cho thấy năng lực mạnh mẽ trong một số quy trình làm việc kỹ thuật phần mềm nhất định, các điểm số thấp hơn trên FrontierSWE v2 và Terminal-Bench 4.0 ngụ ý rằng nó có thể không thay thế các mô hình mã hóa chuyên dụng cho mọi trường hợp sử dụng. Các đội ngũ xây dựng quy trình làm việc dựa trên tác nhân cho công việc tri thức, phân tích pháp lý hoặc tự động hóa có thể tìm thấy giá trị ngay lập tức, nhưng những ai tập trung thuần túy vào việc tạo mã nên tiếp tục đánh giá các lựa chọn thay thế như GPT-6 Astra hoặc Claude Opus 5.5.
Việc mở rộng số lượng token đầu ra lên một triệu thay đổi cách các kỹ sư thiết kế prompt và vòng lặp tác nhân. Thay vì chuỗi nhiều lệnh gọi API để duy trì ngữ cảnh hoặc chia nhỏ các nhiệm vụ lớn, các nhà phát triển có thể tiềm năng dựa vào một lần tạo sinh đơn lẻ, kéo dài. Điều này có thể đơn giản hóa kiến trúc cho các nhiệm vụ suy luận phức tạp nhưng có thể làm tăng độ trễ và chi phí cho mỗi yêu cầu. Cấu trúc giá khởi điểm cung cấp một lợi thế chi phí tạm thời, nhưng mức tăng giá dự kiến lên $20 cho mỗi triệu token đầu ra đưa nó ngang hàng với các đối thủ cao cấp, đòi hỏi mô hình hóa chi phí cẩn thận cho các ứng dụng sản xuất.
Bạn có thể làm gì
- Đánh giá các quy trình làm việc hiện tại của bạn để xác định các tác vụ hưởng lợi từ suy luận ngữ cảnh dài thay vì tạo mã nhanh chóng.
- Đăng ký quyền truy cập vào Chương trình Fairwind nếu tổ chức của bạn đủ điều kiện cho các cơ hội thử nghiệm sớm.
- Kiểm tra chuẩn hóa (Benchmark) các tác nhân hiện có của bạn so với các điểm số được báo cáo trên AutomationBench và Vals Index để ước tính tiềm năng cải thiện hiệu suất.
- Xem xét lại các mẫu sử dụng token của bạn để chuẩn bị cho sự chuyển dịch sang các giới hạn đầu ra cao hơn và chi phí liên quan.
- Theo dõi lịch trình triển khai cho khách hàng API trả phí và thuê bao AI Ultra để lên kế hoạch cho các mốc thời gian tích hợp.
- Cân nhắc các hàm ý bảo mật khi sử dụng các mô hình không có rào chắn bảo vệ cyber nếu bạn tham gia vào các chương trình nghiên cứu lỗ hổng.

