Google Gemini 4 Argon sánh ngang các mô hình AI hàng đầu với chi phí chỉ bằng một nửa
Google DeepMind ra mắt Gemini 4 Argon, đạt hiệu suất tương đương GPT-6 Astra trên các bài kiểm tra trí tuệ trong khi mang lại lợi thế chi phí đáng kể nhờ ưu đãi ban đầu và cơ chế bộ nhớ đệm (caching) được cải thiện.
Được dịch tự động từ bản gốc tiếng Anh.
Google DeepMind đã trở lại vị trí dẫn đầu trong lĩnh vực phát triển trí tuệ nhân tạo với việc ra mắt Gemini 4 Argon, một mô hình độc quyền mới có hiệu suất sánh ngang với các đối thủ hàng đầu. Được trình làng vào cuối tháng 9 năm 2026, mô hình này đạt mức tương đương với GPT-6 Astra của OpenAI về các chỉ số trí tuệ chính, đồng thời hiện đang hoạt động với chi phí mỗi tác vụ thấp hơn đáng kể nhờ mức giá khuyến mãi.
Điều gì đã xảy ra
Gemini 4 Argon là mô hình độc quyền đầu tiên của Google vượt qua dòng Flash sau hơn bảy tháng. Trên Chỉ số Trí tuệ Artificial Analysis, mô hình này đạt điểm 53, bằng với điểm tối đa mà GPT-6 Astra đạt được và cao hơn một điểm so với GPT-6.1 Sol. Đây là một bước tiến lớn đối với Google, đưa công ty vững chắc nằm trong top ba phòng thí nghiệm AI về khả năng trí tuệ thuần túy. Mô hình không thuộc dòng Flash trước đó của Google, Gemini 3.1 Pro Preview, chỉ đạt 30 điểm trên cùng chỉ số này, cho thấy sự nhảy vọt rõ rệt về hiệu suất.
Khía cạnh kinh tế của bản phát hành này cũng đáng chú ý không kém. Hiện tại, Google đang áp dụng mức giảm giá 50%, giúp hạ chi phí mỗi tác vụ trên Chỉ số Trí tuệ xuống còn $1.99. Con số này xấp xỉ 60% so với chi phí cần thiết để chạy một tác vụ tương tự trên GPT-6 Astra, vốn tốn $3.26 mỗi tác vụ. Tuy nhiên, hiệu quả này đến từ giá token thấp hơn chứ không phải do giảm lượng tiêu thụ token. Thực tế, Gemini 4 Argon trung bình sử dụng 62.000 token đầu ra mỗi tác vụ, gấp đôi so với 27.000 token mà GPT-6 Astra sử dụng. Khi đợt giảm giá khuyến mãi kết thúc, chi phí mỗi tác vụ sẽ tăng lên $3.98, khiến nó đắt hơn một chút so với GPT-6 Astra nhưng vẫn cạnh tranh tốt so với các mô hình cao cấp khác.
Cách thức hoạt động
Kiến trúc kỹ thuật của Gemini 4 Argon hỗ trợ cửa sổ ngữ cảnh (context window) lên tới một triệu token và chấp nhận đầu vào đa phương thức bao gồm văn bản, hình ảnh, video và giọng nói, mặc dù chỉ xuất ra dưới dạng văn bản. Một đổi mới quan trọng trong quá trình triển khai là tính năng Long Decode Continuation (Tiếp tục giải mã dài). Tính năng API này cho phép tạm dừng và tiếp tục các phản hồi dài qua các lần gọi tiếp theo, giúp mở rộng quy trình suy luận lên tới một triệu token đầu ra mà không gây ra lỗi hết thời gian yêu cầu (request timeouts). Điều này đặc biệt hữu ích cho các quy trình làm việc phức tạp của agent (tác nhân tự động) đòi hỏi logic từng bước chuyên sâu.
Những cải thiện về hiệu suất cũng thể hiện rõ ở khả năng agent và độ tin cậy của mô hình. Trong lịch sử, các mô hình Gemini thường bị đánh giá thấp trong các tác vụ agent tự động, nhưng Argon xếp thứ nhất trên AutomationBench-AA với điểm số 78%, vượt qua Claude Sonnet 5.5. Nó cũng cho thấy sự cải thiện đột phá trên Terminal Bench 4, tăng 53 điểm so với phiên bản tiền nhiệm. Hơn nữa, mô hình này có tỷ lệ ảo giác (hallucination rate) thấp nhất trong số các mô hình hàng đầu đạt điểm trên 45 trên chỉ số trí tuệ. Với tỷ lệ ảo giác 15%, mô hình có xu hướng thừa nhận sự thiếu hiểu biết nhiều hơn là đoán sai, mặc dù điểm độ chính xác thô 50% của nó thấp hơn so với GPT-6 Astra.
Chi tiết chính
- Điểm trí tuệ: Đạt 53 điểm trên Chỉ số Trí tuệ Artificial Analysis, ngang bằng với GPT-6 Astra (mức tối đa) và vượt qua GPT-6.1 Sol (mức tối đa).
- Giá cả: Hiện đang giảm giá 50% xuống còn $2/$10 cho mỗi triệu token đầu vào/đầu ra, dẫn đến chi phí $1.99 mỗi tác vụ; giá tiêu chuẩn sẽ là $4/$20.
- Bộ nhớ đệm (Caching): Các token đầu vào được lưu trữ trong cache nhận mức giảm giá 95%, chỉ tốn $0.10 cho mỗi triệu token, tăng so với mức giảm giá 90% ở các phiên bản trước.
- Hiệu suất Agent: Xếp hạng #1 trên AutomationBench-AA với 78% và đạt điểm 57% trên Terminal Bench 4.
- Độ tin cậy: Có tỷ lệ ảo giác 15%, thấp nhất trong số các mô hình cao cấp, mặc dù độ chính xác tổng thể là 50%.
- Tính khả dụng: Hiện đang triển khai cho một số người dùng được chọn và chưa mở rộng công khai; ngày kết thúc đợt giảm giá 50% vẫn chưa được xác nhận.
Tại sao điều này quan trọng
Đối với các kỹ sư phần mềm và nhà sáng lập kỹ thuật, sự trở lại của Google như một đối thủ cạnh tranh hàng đầu tạo ra áp lực lành mạnh lên các tiêu chuẩn về giá cả và hiệu suất. Khả năng đạt điểm trí tuệ cao nhất trong khi cung cấp chi phí gia nhập thấp hơn trong giai đoạn khuyến mãi cho phép các nhóm thử nghiệm các mô hình suy luận cao mà không gặp ngay gánh nặng ngân sách. Sự cải thiện đáng kể về khả năng agent cho thấy Gemini 4 Argon có thể là ứng cử viên mạnh mẽ để xây dựng các tác nhân tự động đòi hỏi sử dụng công cụ bền vững và lập kế hoạch đa bước, những lĩnh vực mà các phiên bản Gemini trước đây còn yếu.
Tuy nhiên, các nhà phát triển cần đánh giá cẩn thận sự đánh đổi giữa chi phí và hiệu quả sử dụng token. Mặc dù chi phí mỗi tác vụ thấp hơn trong thời gian khuyến mãi, lượng tiêu thụ token cao có nghĩa là các ứng dụng nhạy cảm với độ trễ hoặc có ngân sách token nghiêm ngặt có thể cần được tối ưu hóa. Tỷ lệ ảo giác thấp là một lợi thế quan trọng cho các ứng dụng đòi hỏi độ tin cậy cao, chẳng hạn như trợ lý pháp lý hoặc y tế, nơi việc thừa nhận sự không chắc chắn tốt hơn là cung cấp thông tin sai lệch. Khi mô hình tiến tới khả năng sẵn sàng chung, việc hiểu rõ các đặc điểm vận hành này sẽ là điều thiết yếu để tích hợp hiệu quả.
Bạn có thể làm gì
- Đăng ký truy cập sớm nếu bạn là người dùng được chọn để thử nghiệm khả năng agent.
- Đánh giá kỹ lưỡng nhu cầu về độ trễ và ngân sách token của ứng dụng trước khi chuyển đổi sang mô hình này.
- Tận dụng cơ chế caching để giảm thiểu chi phí cho các luồng công việc lặp đi lặp lại.
- Theo dõi thông báo về ngày kết thúc đợt giảm giá để lập kế hoạch ngân sách phù hợp.

