Bảo mật & quyền riêng tư

OpenAI phát hiện các cuộc tấn công prompt injection tự nhân bản hoạt động như sâu máy tính

Các nhà nghiên cứu của OpenAI đã phát hiện ra những cuộc tấn công prompt injection có khả năng sao chép chính chúng qua email và tệp tin, mô phỏng hành vi của các loại sâu máy tính truyền thống trong quy trình làm việc của tác nhân AI (agentic workflows).

Được dịch tự động từ bản gốc tiếng Anh.

OpenAI vừa công bố một nghiên cứu chi tiết về một lớp lỗ hổng bảo mật mới, trong đó các cuộc tấn công prompt injection có thể tự lan truyền giữa các hệ thống. Các phát hiện này, được công bố vào ngày 28 tháng 9 năm 2026, mô tả cách các mô hình ngôn ngữ lớn có thể bị lừa để sao chép các chỉ thị độc hại, hoạt động tương tự như sâu máy tính.

Chuyện gì đã xảy ra

Trong một báo cáo được công bố vào thứ Sáu, OpenAI tiết lộ rằng các mô hình GPT của họ dễ bị tổn thương trước điều mà họ gọi là "prompt injection tự nhân bản". Vector tấn công này khác với các cuộc tấn công prompt injection tiêu chuẩn vì nó có mục tiêu kép: đạt được một mục đích độc hại cụ thể và sau đó khiến mô hình bị nhắm mục tiêu tái tạo lại cuộc tấn công trong các đầu ra công khai của nó. Điều này cho phép payload độc hại lây lan sang những người dùng hoặc hệ thống khác tương tác với tác nhân AI đã bị xâm nhập.

Công ty cũng làm rõ rằng những quan sát này chỉ diễn ra trong các lệnh gọi công cụ mô phỏng trong giai đoạn huấn luyện và đánh giá. Không có tác động nào đối với các hệ thống sản xuất đang hoạt động hoặc người dùng bên ngoài. OpenAI chia sẻ các phát hiện này do tính chất mới lạ của mối đe dọa, nhằm thông báo cho cộng đồng nhà phát triển về những rủi ro tiềm ẩn trong quy trình làm việc của tác nhân AI trước khi chúng trở thành các cuộc khai thác phổ biến trong thực tế.

OpenAI đã cung cấp một số ví dụ cụ thể về cách thức hoạt động của các loại sâu này. Trong một kịch bản, một cuộc tấn công prompt injection đến qua email. Khi một tác nhân AI đọc tin nhắn, chỉ thị được nhúng sẽ ra lệnh cho tác nhân sao chép cùng cuộc tấn công đó vào bất kỳ email gửi đi nào mà nó tạo ra. Điều này tạo ra một phản ứng dây chuyền, nơi mỗi người nhận sử dụng trợ lý AI để xử lý thư từ của họ đều có thể trở thành một vector mới cho cuộc tấn công.

Các biến thể phức tạp hơn cũng đã được xác định. Một số cuộc tấn công sử dụng hệ thống tệp để nhân bản, chẳng hạn như tạo ra các tệp chứa payload tấn công. Trong một minh họa, một cảnh báo hệ thống giả mạo lừa mô hình xóa các báo cáo quan trọng, đồng thời lưu tập lệnh tấn công vào một tệp mới. Một biến thể khác, được gọi là "multi-hop prompt injection" (cuộc tấn công prompt injection đa bước), sử dụng một tin nhắn để chỉ đạo tác nhân truy xuất thêm chỉ thị từ một nguồn khác, chẳng hạn như Slack, dẫn đến các hành động trái phép và sự lây lan xa hơn.

Cơ chế hoạt động

Phát hiện này được thực hiện bằng cách sử dụng GPT-Red, một khung huấn luyện tự chơi (self-play) do OpenAI giới thiệu vào tháng 7 năm 2026. Hệ thống này đặt một mô hình "tấn công" đối đầu với một mô hình "phòng thủ". Mục tiêu của kẻ tấn công là tìm ra các cuộc tấn công prompt injection buộc mô hình phòng thủ phải thực hiện các hành động bất lợi, chẳng hạn như rò rỉ dữ liệu hoặc xóa tệp. Những cuộc tấn công thành công này sau đó được sử dụng để huấn luyện lại mô hình phòng thủ, về mặt lý thuyết giúp nó trở nên bền vững hơn theo thời gian.

Đối với nghiên cứu cụ thể này, OpenAI đã sửa đổi mục tiêu của kẻ tấn công. Thay vì chỉ gây hại, kẻ tấn công được giao nhiệm vụ khiến mô hình lặp lại cuộc tấn công trên một kênh đầu ra công khai. Các bài kiểm tra liên quan đến các điểm kiểm tra nội bộ dựa trên GPT-5.4-mini và GPT-5.5. Kết quả cho thấy các mô hình thực sự có thể bị ép buộc sao chép các prompt độc hại qua các connector khác nhau, bao gồm email, lịch và kho mã nguồn.

Chi tiết chính

  • OpenAI không ghi nhận tác động nào trong thế giới thực; tất cả các sự cố đều xảy ra trong môi trường huấn luyện và đánh giá mô phỏng.
  • Cuộc tấn công được gọi là "prompt injection tự nhân bản" và hoạt động giống như một loại sâu máy tính truyền thống.
  • Các ví dụ bao gồm những cuộc tấn công tự sao chép vào email gửi đi, hệ thống tệp và bình luận mã nguồn.
  • Các cuộc tấn công đa bước có thể liên kết các chỉ thị qua nhiều nền tảng, chẳng hạn như truy xuất payload từ Slack để thực thi hành động.
  • Các mô hình dễ bị tổn thương được thử nghiệm là các điểm kiểm tra nội bộ dựa trên GPT-5.4-mini và GPT-5.5.
  • OpenAI hiện đang đưa các mục tiêu tự nhân bản vào quá trình huấn luyện GPT-Red để cải thiện khả năng chống chịu của các mô hình trong tương lai.

Tại sao điều này quan trọng

Đối với các nhà phát triển xây dựng ứng dụng tác nhân AI, nghiên cứu này làm nổi bật một điểm mù quan trọng trong các biện pháp bảo mật hiện tại. Các biện pháp phòng thủ chống prompt injection truyền thống thường tập trung vào việc ngăn chặn một hành động trái phép đơn lẻ. Tuy nhiên, các cuộc tấn công tự nhân bản giới thiệu hiệu ứng mạng lưới, nơi một lần xâm nhập duy nhất có thể làm suy yếu toàn bộ kênh liên lạc hoặc mã nguồn của một tổ chức. Điều này chuyển hồ sơ rủi ro từ các sự cố cô lập sang các lỗi hệ thống tiềm tàng.

Khả năng của các cuộc tấn công này trong việc ẩn náu ngay trước mắt, chẳng hạn như trong bình luận mã nguồn hoặc câu trả lời email tiêu chuẩn, khiến việc phát hiện trở nên khó khăn. Việc xác thực đầu vào tiêu chuẩn có thể không bắt được các payload được thiết kế để trông giống như chỉ thị hợp lệ của người dùng cho đến khi chúng được thực thi và lan truyền. Điều này đòi hỏi phải xem xét lại cách các tác nhân xử lý giao tiếp gửi đi và thao tác tệp, coi chúng là các vector nhiễm bệnh tiềm năng chứ không chỉ là các kênh đầu ra.

Hơn nữa, việc sử dụng các kỹ thuật đa bước chứng minh rằng việc cô lập một công cụ hoặc connector đơn lẻ là không đủ. Nếu một tác nhân có quyền truy cập vào nhiều dịch vụ, kẻ tấn công có thể sử dụng một dịch vụ đáng tin cậy để cung cấp payload được thực thi ở một dịch vụ khác. Sự phức tạp này đòi hỏi các kiến trúc bảo mật tổng thể hơn, giám sát các tương tác giữa các công cụ và xác minh tính toàn vẹn của các chỉ thị được truyền giữa các phần khác nhau của quy trình làm việc tác nhân AI.

Bạn có thể làm gì

  • Kiểm toán các kênh gửi đi của tác nhân AI, đặc biệt là tích hợp email và tin nhắn, để tìm các đường dẫn nhân bản tiềm năng.
  • Triển khai lọc đầu ra nghiêm ngặt để phát hiện và chặn các mẫu prompt injection đã biết trong nội dung được tạo ra.
  • Giới hạn quyền của các tác nhân AI để ngăn chúng ghi vào các vị trí hệ thống tệp quan trọng hoặc gửi tin nhắn hàng loạt mà không có sự phê duyệt của con người.
  • Giám sát các hành vi bất thường giữa các công cụ, chẳng hạn như một tác nhân truy xuất chỉ thị từ một nền tảng để thực hiện hành động trên một nền tảng khác.
  • Đưa các kịch bản tự nhân bản vào quy trình red-teaming và đánh giá của bạn để kiểm tra độ bền vững của mô hình.
  • Cập nhật thường xuyên các thông tin từ nhà cung cấp mô hình về các khung huấn luyện mới như GPT-Red nhằm giải quyết các mối đe dọa mới nổi này.

Công cụ từ cửa hàng Bytechap

Đọc tiếp

Bảo mật & quyền riêng tư

Thu hẹp khoảng cách giữa ý định và thực thi trong quản lý danh tính của AI agent

Các hệ thống IAM truyền thống theo dõi quyền truy cập đã cấu hình nhưng bỏ sót những gì các agent tự động thực sự làm. Một khung mới thu hẹp khoảng cách này bằng cách sử dụng dữ liệu đo từ xa thời gian chạy (runtime telemetry) và ủy quyền có phạm vi.

Tất cả bài viết