Việc định tuyến cục bộ mới của GitHub Copilot để ngỏ các câu hỏi về quyền riêng tư dữ liệu
Microsoft có kế hoạch định tuyến các tác vụ GitHub Copilot giữa mô hình cục bộ và đám mây vào cuối tháng 10, nhưng chưa làm rõ những dữ liệu nào rời khỏi thiết bị hoặc cách hạn chế chúng.
Được dịch tự động từ bản gốc tiếng Anh.
GitHub đang chuẩn bị tự động định tuyến các tác vụ lập trình giữa các mô hình cục bộ và đám mây cho người dùng Copilot, với tính năng dự kiến ra mắt vào cuối tháng 10 năm 2026. Mặc dù Microsoft mô tả đây là một tối ưu hóa hiệu suất, công ty vẫn chưa tiết lộ chính xác dữ liệu ngữ cảnh nào được gửi lên đám mây hoặc cung cấp cách để các nhà phát triển buộc suy luận chỉ diễn ra ở cục bộ.
Chuyện gì đã xảy ra
Microsoft đã phác thảo kế hoạch này trong một bài viết đồng sáng tác bởi Patrick Nikoletich, quản lý sản phẩm GitHub, và Stuart Schaefer, kiến trúc sư đối tác nền tảng Windows. Thông báo trùng thời điểm với việc phát hành rộng rãi các điều khiển sandboxing mới cho Copilot, mặc dù mức độ bảo vệ khác nhau tùy thuộc vào các công cụ cụ thể được sử dụng. Thay đổi cốt lõi liên quan đến việc mở rộng Project HydraFusion, một hệ thống vốn đã chọn mô hình nào sẽ được sử dụng, nay còn quyết định nơi mô hình đó chạy.
Tính năng định tuyến Auto mới sẽ cân nhắc ngữ cảnh tác vụ và trạng thái bộ nhớ đệm để chuyển đổi giữa suy luận cục bộ và trên đám mây, ngay cả trong các phiên hội thoại nhiều lượt. Chức năng này sẽ khả dụng trong Copilot CLI, ứng dụng Copilot và VS Code. Các nhà phát triển có thể chọn định tuyến Auto hoặc thủ công chọn một mô hình cục bộ, chẳng hạn như MAI Code 1.1 Flash thông qua nhà cung cấp Windows ML hoặc các endpoint cục bộ tương thích OpenAI khác. Tuy nhiên, Microsoft thừa nhận rõ ràng rằng suy luận cục bộ không làm cho phiên hoạt động hoàn toàn ngoại tuyến.
Sự mơ hồ này đã dấy lên lo ngại trong các nhóm có chính sách xử lý dữ liệu nghiêm ngặt. Những vấn đề tương tự gần đây đã nảy sinh khi Anthropic thừa nhận định tuyến các yêu cầu Claude Sonnet 5.5 tới một phiên bản mô hình cũ hơn cho các hoạt động rủi ro cao. Đối với người dùng GitHub, sự thiếu minh bạch nghĩa là họ không biết Auto gửi bao nhiêu ngữ cảnh kho lưu trữ hoặc lịch sử hội thoại lên đám mây, cũng như hiện tại họ không thể kiểm tra các quyết định định tuyến này.
Cách thức hoạt động
Để làm cho suy luận cục bộ khả thi, Microsoft đã áp dụng kỹ thuật lượng tử hóa (quantization) mạnh mẽ và giải mã suy đoán (speculative decoding). Mô hình MAI Code 1.1 Flash có kiến trúc hỗn hợp chuyên gia (mixture-of-experts) với tổng cộng 137 tỷ tham số, nhưng chỉ có 6,8 tỷ tham số hoạt động tại bất kỳ thời điểm nào. Microsoft đã sử dụng lượng tử hóa độ chính xác hỗn hợp ở khoảng 3,3 bit mỗi trọng số để giảm kích thước mô hình từ phiên bản đám mây bfloat16 ban đầu xuống còn 53GB, tức giảm 80%. Giải mã suy đoán giúp tăng tốc quá trình hơn nữa bằng cách để một mô hình drafter nhỏ hơn đề xuất các khối token để mô hình chính xác minh.
Bất chấp những tối ưu hóa này, yêu cầu phần cứng vẫn rất khắt khe. Giai đoạn triển khai ban đầu nhắm mục tiêu vào các PC Windows NVIDIA RTX Spark, chẳng hạn như Surface Laptop Ultra, cung cấp bộ nhớ hợp nhất lên tới 128GB. Microsoft đo lường mức sử dụng bộ nhớ đỉnh điểm là 75,5GB với ngữ cảnh 256K-token. Con số này loại trừ bộ nhớ cần thiết cho hệ điều hành, ứng dụng, runtime suy luận và bộ nhớ đệm key-value, thứ sẽ tăng lên khi agent đọc các tệp. Do đó, hầu hết laptop dành cho nhà phát triển với RAM 16GB hoặc 32GB không thể hỗ trợ chế độ cục bộ này.
Việc thực thi bảo mật dựa trên thư viện Execution Containers (MXC) mã nguồn mở của Microsoft. Trên Windows, nó sử dụng tầng BaseContainer của backend ProcessContainer; trên macOS, nó sử dụng Seatbelt; và trên Linux, nó sử dụng bubblewrap. Những hạn chế cấp hệ điều hành này áp dụng cho các lệnh shell và máy chủ MCP cục bộ bất kể tác vụ chạy ở cục bộ hay trên đám mây. Tuy nhiên, các công cụ tệp tích hợp sẵn phụ thuộc vào các kiểm tra bên trong harness của agent thay vì sự cô lập của OS, và các máy chủ MCP từ xa hoàn toàn nằm ngoài sandbox quy trình cục bộ.
Chi tiết chính
- Định tuyến Auto cho GitHub Copilot dự kiến ra mắt vào cuối tháng 10 năm 2026.
- Microsoft chưa nêu rõ lượng ngữ cảnh kho lưu trữ hoặc lịch sử hội thoại được gửi lên đám mây trong quá trình định tuyến Auto.
- Mô hình MAI Code 1.1 Flash yêu cầu 53GB cho các trọng số và đạt mức sử dụng bộ nhớ đỉnh điểm 75,5GB, khiến hầu hết laptop tiêu chuẩn không đáp ứng được.
- Suy luận cục bộ không đảm bảo một phiên ngoại tuyến, vì các agent vẫn có thể truy cập dịch vụ bên ngoài hoặc công cụ mạng.
- Các máy chủ MCP từ xa không được bao phủ bởi sandbox quy trình cục bộ, mà thay vào đó dựa vào các kiểm tra chính sách kết nối.
- Mô hình cục bộ đã lượng tử hóa đạt điểm 70,8% trên SWE-Bench Verified, thấp hơn một chút so với điểm 72,6% của phiên bản đám mây độ chính xác đầy đủ.
Tại sao điều này quan trọng
Đối với các kỹ sư phần mềm và trưởng nhóm kỹ thuật, mối lo ngại chính là chủ quyền dữ liệu. Nhiều tổ chức cấm gửi mã độc quyền hoặc tài liệu nội bộ tới các mô hình đám mây công cộng. Nếu không có cái nhìn rõ ràng về những gì định tuyến Auto gửi lên đám mây, hoặc khả năng hạn chế suy luận chỉ ở các mô hình cục bộ, các nhóm tuân thủ không thể phê duyệt việc sử dụng Copilot cho các dự án nhạy cảm. Tuyên bố rằng suy luận cục bộ không phải là ngoại tuyến làm suy yếu giả định rằng việc chọn một mô hình cục bộ đảm bảo quyền riêng tư dữ liệu.
Hơn nữa, rào cản phần cứng giới hạn khả năng tiếp cận tính năng này. Yêu cầu bộ nhớ hợp nhất 128GB và phần cứng NVIDIA cao cấp có nghĩa là chỉ một tỷ lệ nhỏ nhà phát triển có thể hưởng lợi từ suy luận cục bộ. Điều này tạo ra sự bất bình đẳng, nơi chỉ những người có workstation hàng đầu mới có tiềm năng giữ nhiều dữ liệu hơn trên thiết bị, trong khi những người khác vẫn phụ thuộc vào định tuyến đám mây mà không có biện pháp bảo vệ rõ ràng. Sự phức tạp trong việc quản lý các chính sách sandbox giữa các công cụ và hệ điều hành khác nhau cũng làm tăng chi phí vận hành cho các trưởng nhóm IT.
Bạn có thể làm gì
- Kiểm toán việc sử dụng Copilot hiện tại của bạn để xác định bất kỳ quy trình làm việc nào liên quan đến mã nhạy cảm hoặc kho lưu trữ nội bộ.
- Theo dõi tài liệu của Microsoft để cập nhật xem liệu có tùy chọn hạn chế chỉ cục bộ được thêm vào định tuyến Auto hay không.
- Đánh giá khả năng phần cứng của đội ngũ bạn so với yêu cầu bộ nhớ đỉnh điểm 75,5GB trước khi lên kế hoạch áp dụng suy luận cục bộ.
- Xem xét lại các chính sách sandbox cho lệnh shell, máy chủ MCP cục bộ và máy chủ MCP từ xa để hiểu rõ những lỗ hổng trong sự cô lập tồn tại ở đâu.
- Cân nhắc thủ công chọn các mô hình cục bộ nếu khả dụng, nhưng hãy xác minh rằng quyền truy cập công cụ đã bị khóa chặt để ngăn chặn các yêu cầu mạng không mong muốn.
- Làm việc với nhóm bảo mật của bạn để xác định mức độ rủi ro chấp nhận được đối với rò rỉ dữ liệu, xét theo tình trạng thiếu minh bạch hiện tại từ phía Microsoft.



