Claude Sonnet 5.5 đánh đổi hiệu quả token để lấy hiệu suất tác tử
Mô hình mới của Anthropic vươn lên vị trí thứ hai trên Intelligence Index bằng cách sử dụng lượng token đầu ra lớn hơn đáng kể, sánh ngang với các tác tử hàng đầu trong các tác vụ terminal nhưng vẫn thua kém về kiến thức thực tế.
Được dịch tự động từ bản gốc tiếng Anh.
Anthropic đã phát hành Claude Sonnet 5.5, một mô hình tầm trung hiện xếp thứ hai trên Artificial Analysis Intelligence Index. Được công bố vào ngày 28 tháng 9 năm 2026, bản cập nhật này cho thấy mô hình đang thu hẹp khoảng cách với các đối thủ chủ lực trong quy trình làm việc của tác tử (agentic workflows), mặc dù đạt được những cải thiện này thông qua mức tiêu thụ token cao bất thường thay vì hiệu quả kiến trúc thuần túy.
Điều gì đã xảy ra
Claude Sonnet 5.5 vươn lên vị trí số hai trên Intelligence Index, chỉ đứng sau Opus 5.5 ở chế độ nỗ lực tối đa (max effort). Mô hình tăng 18 điểm so với phiên bản tiền nhiệm, Sonnet 5, chủ yếu nhờ vào những cải tiến vượt bậc trong việc sử dụng terminal và xử lý công việc tri thức phức tạp. Trong bài kiểm tra Terminal-Bench 4.0, đánh giá khả năng tương tác với dòng lệnh của các mô hình, Sonnet 5.5 ghi được 64%. Con số này giúp nó vượt nhẹ cả Opus 5.5 và GPT-6 Astra, mỗi model đều đạt 60%.
Bất chấp những bước nhảy vọt về hiệu suất, mô hình không dẫn đầu ở mọi hạng mục. Nó vẫn xếp sau Opus 5.5 về kiến thức thực tế và suy luận khoa học. Trên benchmark AA-Omniscience về độ chính xác thực tế, Sonnet 5.5 đạt 54% so với 66% của Opus 5.5. Tuy nhiên, nó thể hiện tỷ lệ ảo giác (hallucination) thấp hơn, ở mức 47% so với 59% của mô hình lớn hơn. Các đánh giá được thực hiện trên phiên bản trước khi phát hành chứa một lỗi ảnh hưởng đến đầu ra có cấu trúc (structured outputs), mà Anthropic tuyên bố đã được khắc phục trong bản phát hành công khai.
Cách thức hoạt động
Cơ chế cốt lõi đằng sau thứ hạng cải thiện của Sonnet 5.5 là cài đặt "max effort" (nỗ lực tối đa), kích hoạt sự gia tăng cực đoan trong việc sử dụng token đầu ra. Để hoàn thành các tác vụ trong Intelligence Index, mô hình tạo ra khoảng 193.000 token đầu ra cho mỗi tác vụ. Đây là mức sử dụng token cao nhất từng được Artificial Analysis ghi nhận, vượt qua Opus 5.5 và Sonnet 5 khoảng 60% và gấp khoảng bảy lần so với GPT-6 Astra. Về cơ bản, mô hình giải quyết các vấn đề phức tạp bằng cách brute-force (tấn công vũ bão) thông qua việc tạo ra các chuỗi suy nghĩ (chains of thought) và các bước xác minh dài dòng.
Anthropic cung cấp năm mức thiết lập nỗ lực: low (thấp), medium (trung bình), high (cao), xhigh (rất cao) và max (tối đa). Các đánh giá Intelligence Index được chạy trên cả năm mức với tính năng fallback mặc định được bật. Mô hình chỉ quay về phiên bản Sonnet 5 cũ trong 0,1% số tác vụ, phần lớn nằm trong Terminal-Bench 4.0. Mặc dù thiết lập max effort thúc đẩy vị trí cao trên bảng xếp hạng, các thiết lập nỗ lực thấp hơn lại kém cạnh tranh hơn. Ở các mức low, medium và high, các cấu hình GPT-6 Sol mang lại hiệu suất tương đương hoặc tốt hơn với ít token đầu ra hơn.
Chi tiết quan trọng
- Xếp hạng: Thứ hai trên Artificial Analysis Intelligence Index, sau Opus 5.5 (max).
- Sử dụng Token: Dùng ~193k token đầu ra cho mỗi tác vụ ở chế độ max effort, mức cao nhất từng được đo lường.
- Giá cả: Giống hệt Sonnet 5, ở mức $0.2/$2/$10 cho mỗi 1M token cache input/input/output.
- Chi phí Mỗi Tác vụ: Khoảng $7.60 mỗi tác vụ, cao hơn 50% so với Sonnet 5.
- Hiệu suất Terminal: Đạt 64% trên Terminal-Bench 4.0, vượt qua Opus 5.5 và GPT-6 Astra.
- Cửa sổ ngữ cảnh (Context Window): Không thay đổi, giữ nguyên ở mức 1 triệu token cho đầu vào văn bản và hình ảnh.
Tại sao điều này quan trọng
Đối với các nhóm kỹ sư xây dựng hệ thống tác tử, Sonnet 5.5 đặt ra một sự đánh đổi giữa năng lực và hiệu quả chi phí. Mô hình sánh ngang hoặc vượt qua các đối thủ hàng đầu trong việc sử dụng terminal thực tế và các benchmark tự động hóa như AA-Briefcase và AutomationBench-AA. Điều này biến nó thành một ứng cử viên mạnh mẽ cho các quy trình làm việc đòi hỏi tương tác sâu với môi trường phát triển hoặc các pipeline xử lý dữ liệu phức tạp. Tuy nhiên, hiệu suất này đi kèm với một cái giá đắt đỏ. Chi phí mỗi tác vụ là khoảng $7.60, khiến nó tốn kém hơn đáng kể để vận hành so với phiên bản tiền nhiệm cho cùng một khối lượng công việc.
Vị thế của Sonnet 5.5 cũng làm nổi bật sự chuyển dịch trong cách các mô hình tầm trung cạnh tranh. Thay vì cố gắng đánh bại các mô hình chủ lực dựa trên mật độ suy luận thuần túy, Anthropic đã tối ưu hóa Sonnet 5.5 để chi nhiều tài nguyên tính toán và token hơn nhằm đạt được kết quả tương tự. Đối với các nhà phát triển, điều này có nghĩa là lựa chọn giữa Sonnet 5.5 và các mô hình như GPT-6 Sol phụ thuộc rất nhiều vào tác vụ cụ thể. Nếu ngân sách token hạn hẹp, GPT-6 Sol có thể mang lại giá trị tốt hơn ở các mức nỗ lực thấp. Nếu tác vụ đòi hỏi sự bền bỉ tối đa của tác tử trong môi trường terminal, Sonnet 5.5 ở chế độ max effort trở thành một phương án thay thế khả thi, dù tốn kém, cho Opus 5.5.
Bạn có thể làm gì
- Benchmark các quy trình làm việc tác tử hiện tại của bạn với Sonnet 5.5 ở chế độ max effort để xem liệu điểm số 64% trên Terminal-Bench có chuyển hóa thành độ tin cậy thực tế hay không.
- So sánh chi phí mỗi tác vụ là $7.60 với ngân sách hiện tại dành cho Sonnet 5 hoặc GPT-6 Sol để xác định tính khả thi về mặt tài chính.
- Thử nghiệm riêng lẻ năm mức thiết lập nỗ lực để tìm ra sự cân bằng tối ưu giữa việc sử dụng token và độ chính xác cho trường hợp sử dụng cụ thể của bạn.
- Theo dõi tỷ lệ ảo giác nếu độ chính xác thực tế là yếu tố then chốt, lưu ý rằng Sonnet 5.5 có tỷ lệ ảo giác thấp hơn Opus 5.5 nhưng điểm số thực tế tổng thể lại thấp hơn.
- Kiểm tra cách xử lý đầu ra có cấu trúc trong các ứng dụng của bạn, đảm bảo rằng bạn đang chạy bản phát hành công khai nơi lỗi phiên bản trước đó đã được khắc phục.
- Đánh giá xem cửa sổ ngữ cảnh 1 triệu token có đáp ứng nhu cầu của bạn hay không, vì thông số kỹ thuật này không thay đổi so với phiên bản trước.
