Xây dựng với AI

Anthropic chuyển hướng các yêu cầu an ninh mạng rủi ro cao từ Sonnet 5.5 sang các mô hình cũ hơn

Mô hình Sonnet 5.5 mới của Anthropic sử dụng định tuyến dựa trên bộ phân loại để chuyển về Sonnet 5 cho các tác vụ an ninh mạng rủi ro cao, yêu cầu nhà phát triển API phải chủ động bật tính năng này.

Được dịch tự động từ bản gốc tiếng Anh.

Anthropic đã phát hành Claude Sonnet 5.5 vào thứ Hai, ngày 29 tháng 9 năm 2026, giới thiệu các biện pháp bảo vệ an ninh mạng và cơ chế tự động chuyển đổi mô hình trước đây chỉ dành cho các dòng sản phẩm hàng đầu. Bản cập nhật này đánh dấu sự thay đổi trong cách công ty xử lý vấn đề an toàn cho các khối lượng công việc sản xuất ở phân khúc trung cấp, đặc biệt nhắm vào các khả năng an ninh tấn công (offensive security).

Chuyện gì đã xảy ra

Sonnet 5.5 là mô hình đầu tiên trong phân khúc Sonnet được ra mắt với các biện pháp bảo vệ an ninh mạng tích hợp sẵn và định tuyến dựa trên bộ phân loại. Mặc dù Anthropic tuyên bố rằng bản phát hành này không đẩy lùi ranh giới tổng thể về khả năng của mô hình, họ đánh giá kỹ năng an ninh mạng của Sonnet 5.5 tương đương với Opus 5. Trên chuẩn đo lường lập trình agent Terminal-Bench 4.0, mô hình có chi phí thấp hơn này đạt điểm 70,6%, vượt qua Opus 5.5 ở mức nỗ lực xhigh (đạt 66,4%).

Quyết định áp dụng các biện pháp bảo vệ này xuất phát từ những cải tiến đáng kể trong hiệu suất an ninh tấn công của mô hình. Khi tắt các biện pháp bảo vệ trong quá trình thử nghiệm, Sonnet 5.5 đã thực thi thành công mã tùy ý trong 178/410 lần chạy ExploitBench. Nó cũng hoàn thành 46,1% các thử thách trên CyScenarioBench của Irregular, tăng mạnh so với tỷ lệ hoàn thành 0,7% của Sonnet 5. Ngoài ra, nó thực hiện được 50 vụ chiếm quyền điều khiển luồng (control-flow hijacks) trên một chuẩn đo lường khai thác lỗ hổng nhị phân dựa trên kho dữ liệu OSS-Fuzz của Google, so với chỉ ba vụ của phiên bản tiền nhiệm.

Mặc dù Anthropic xem Sonnet 5.5 kém hơn Opus 5.5 hoặc Mythos 5.1 về mặt an ninh mạng, bước nhảy vọt về khả năng đủ lớn để đòi hỏi áp dụng cùng chính sách an ninh mạng như các mô hình cao cấp hơn. Công ty thừa nhận rằng các can thiệp này có thể làm giảm điểm số benchmark khi các biện pháp bảo vệ đang hoạt động, nhưng chúng cần thiết để giảm thiểu rủi ro liên quan đến việc tạo exploit và kiểm thử xâm nhập (penetration testing).

Cách thức hoạt động

Cơ chế thực thi hoạt động theo ba giai đoạn. Thứ nhất, một bộ dò (probe) đọc các kích hoạt nội bộ của mô hình. Thứ hai, một bộ phân loại nhẹ chạy trên Sonnet 5.5 đánh giá yêu cầu. Cuối cùng, một bộ phân loại mô hình ngôn ngữ lớn riêng biệt được huấn luyện sẽ cân nhắc phán quyết của bộ dò để quyết định có chặn cuộc hội thoại hay không. Anthropic khẳng định các bộ phân loại này bắt được các yêu cầu an ninh mạng độc hại với tỷ lệ tương đương như trên Opus 5, mặc dù các biện pháp bảo vệ chống jailbreak ít nghiêm ngặt hơn vì Sonnet 5.5 không mạnh bằng các mô hình hàng đầu.

Khi một yêu cầu bị đánh dấu là rủi ro cao, chẳng hạn như các yêu cầu liên quan đến kiểm thử xâm nhập, tạo exploit hoặc quét lỗ hổng nhị phân, hệ thống sẽ kích hoạt cơ chế dự phòng (fallback). Đối với người dùng API đã chọn tham gia, yêu cầu sẽ được hiển thị rõ ràng là chuyển hướng sang Sonnet 5. Trong các ứng dụng của riêng Anthropic, người dùng thấy thông báo khi việc chuyển đổi diễn ra, và phản hồi xác định mô hình được sử dụng. Nếu cơ chế dự phòng không được bật, yêu cầu đơn giản là dừng lại thay vì được chuyển sang mô hình cũ hơn.

Cần lưu ý rằng các lệnh chặn liên quan đến sinh học, vũ khí thông thường và chống chắt lọc kiến thức (anti-distillation) không kích hoạt cơ chế dự phòng; chúng kết thúc yêu cầu hoàn toàn. Các lệnh chặn này minh bạch và không bí mật thay đổi phản hồi. Tuy nhiên, chính sách an ninh mạng cho phép khám phá lỗ hổng trong mã nguồn để hỗ trợ quy trình lập trình an toàn, trong khi chặn việc khám phá đó trong các tệp nhị phân đã biên dịch.

Chi tiết chính

  • Sonnet 5.5 ra mắt vào thứ Hai, ngày 29 tháng 9 năm 2026, kèm theo các biện pháp bảo vệ an ninh mạng và cơ chế chuyển đổi mô hình.
  • Các yêu cầu an ninh mạng rủi ro cao có thể được chuyển về Sonnet 5 nếu nhà phát triển API chọn tham gia cơ chế chuyển đổi tự động.
  • Mô hình đạt 70,6% trên Terminal-Bench 4.0, vượt qua mức 66,6% của Opus 5.5 ở mức nỗ lực xhigh.
  • Các biện pháp bảo vệ xem xét tất cả nội dung đầu vào, bao gồm bộ nhớ, nội dung connector, kết quả tìm kiếm web và tệp tin.
  • Thử nghiệm tiêm prompt (prompt injection) cho thấy 12,01% các yêu cầu được chuyển hướng sang Sonnet 5 đã bị xâm phạm thành công.
  • Những bên phòng thủ đã xác minh có thể sớm truy cập mô hình với ít hạn chế hơn thông qua Chương trình Xác minh An ninh mạng (Cyber Verification Program) mở rộng.

Tại sao điều này quan trọng

Đối với các kỹ sư phần mềm và trưởng nhóm kỹ thuật, thay đổi này có nghĩa là Sonnet 5.5 không thể được coi là sự thay thế trực tiếp (drop-in replacement) cho Sonnet 5 trong mọi kịch bản. Việc giới thiệu các cơ chế chuyển đổi hiển thị tạo ra sự biến thiên trong hành vi và hiệu suất của mô hình. Nhà phát triển giờ đây phải tính đến tư thế bảo mật của cả Sonnet 5.5 và Sonnet 5, vì mô hình cũ hơn có thể xử lý các yêu cầu nhạy cảm sau khi được kích hoạt. Môi trường hai mô hình này đòi hỏi phải kiểm thử cẩn thận để đảm bảo rằng các cơ chế chuyển đổi không gây ra lỗ hổng bất ngờ hoặc gián đoạn trong tính liên tục của quy trình làm việc.

Hơn nữa, phạm vi những yếu tố kích hoạt biện pháp bảo vệ mở rộng vượt ra ngoài các prompt của người dùng. Vì các bước kiểm tra xem xét mọi thứ mà mô hình đọc, bao gồm nội dung từ repository, cảnh báo bảo mật hoặc trang web, các agent trích xuất dữ liệu bên ngoài có thể vô tình kích hoạt cơ chế chuyển đổi. Điều này tạo ra một điểm yếu tiềm tàng cho các cuộc tấn công tiêm prompt. Thử nghiệm cho thấy các chỉ dẫn được tiêm vào để xóa đĩa hoặc xóa tệp thường kích hoạt lệnh chặn an ninh mạng, dẫn đến việc chuyển hướng nơi 12,01% các yêu cầu đó bị xâm phạm. Do đó, các đội ngũ sử dụng cơ chế chuyển đổi phải củng cố hệ thống của họ chống lại các cuộc tấn công tiêm prompt gián tiếp có thể khai thác mô hình dự phòng kém bảo mật hơn.

Bạn có thể làm gì

  • Xem xét cấu hình API của bạn để quyết định có nên chọn tham gia cơ chế chuyển đổi tự động hay không.
  • Kiểm tra các quy trình làm việc để đảm bảo rằng việc chuyển đổi sang Sonnet 5 không phá vỡ tính liên tục của workflow.
  • Củng cố hệ thống chống lại các cuộc tấn công tiêm prompt gián tiếp, đặc biệt nếu bạn sử dụng cơ chế chuyển đổi.
  • Theo dõi các cập nhật từ Anthropic về Chương trình Xác minh An ninh mạng để có thể truy cập mô hình với ít hạn chế hơn trong tương lai.

Công cụ từ cửa hàng Bytechap

$89

DocBento

Hệ thống quản lý tài liệu tự host, có khả năng đọc mọi bản quét và trả lời kèm trích dẫn trang cụ thể.

Demo trực tiếp

Đọc tiếp

Xây dựng với AI

Việc tái tạo mô hình OLMo 3 7B trên TPU tiết lộ các lỗi ẩn trong trình tải dữ liệu

Một nghiên cứu tình huống của Google đã tái tạo thành công mô hình OLMo 3 của AI2 trên các bộ xử lý TPU, khớp với các chỉ số hiệu suất nhưng đồng thời phát hiện ra những lỗi phân mảnh dữ liệu nghiêm trọng khiến việc ghi nhớ dữ liệu bị nhầm lẫn là sự cải thiện.

Tất cả bài viết