AI mở & chạy cục bộ

DeepSeek đưa thư viện GEMM hiệu năng cao lên NPU Huawei Ascend

DeepGEMM-Ascend mang đến hiệu suất nhân ma trận gần đạt đỉnh, tương thích API với phần cứng Huawei Ascend 950, hỗ trợ các khối lượng công việc FP4, FP8 và BF16.

Được dịch tự động từ bản gốc tiếng Anh.

DeepSeek AI đã phát hành DeepGEMM-Ascend, một thư viện chuyên dụng cho phép thực hiện phép nhân ma trận trên các bộ xử lý thần kinh (NPU) của Huawei Ascend. Được công bố vào ngày 30 tháng 9 năm 2026, dự án mã nguồn mở này chuyển đổi framework DeepGEMM gốc sang hệ sinh thái Ascend, nhắm mục tiêu cụ thể vào dòng phần cứng Ascend 950.

Bản phát hành cung cấp cho các kỹ sư một công cụ để đạt được mức sử dụng phần cứng gần như tối đa trong các tác vụ suy luận và huấn luyện mô hình ngôn ngữ lớn (LLM) mà không cần viết lại mã kernel ở tầng thấp. Bằng cách trừu tượng hóa các ràng buộc phức tạp của phần cứng, thư viện cho phép nhà phát triển sử dụng các API quen thuộc trong khi vẫn tận dụng được các tối ưu hóa đặc thù của Ascend.

Chuyện gì đã xảy ra

DeepGEMM-Ascend là bản chuyển đổi trực tiếp của thư viện DeepGEMM, được thiết kế riêng cho nền tảng Huawei Ascend. Bản phát hành ban đầu hỗ trợ các thiết bị Ascend 950 và yêu cầu bộ công cụ CANN 9.20. Thư viện duy trì khả năng tương thích API đầy đủ với dự án DeepGEMM gốc, nghĩa là người dùng có thể cài đặt gói và tiếp tục sử dụng quy trình làm việc phát triển giống hệt như trên các nền tảng được hỗ trợ khác.

Thư viện hỗ trợ nhiều kiểu dữ liệu và thao tác quan trọng được sử dụng trong các mô hình AI hiện đại, bao gồm phép nhân ma trận tổng quát (GEMM) với định dạng BF16, FP8 và FP4. Nó cũng bao gồm hỗ trợ chuyên biệt cho MQA logits và các toán tử MegaMoE, những thành phần thiết yếu cho kiến trúc hỗn hợp chuyên gia (mixture-of-experts) hiệu quả. Sự hỗ trợ rộng rãi này đảm bảo rằng các nhà phát triển làm việc với cấu trúc mô hình tiên tiến nhất có thể triển khai chúng hiệu quả trên phần cứng Ascend.

Một tính năng chính của bản phát hành này là lớp trừu tượng nhẹ nhàng nằm trên các primitive MAD (nhân cộng ma trận) của Ascend. Lớp này che giấu các chi tiết phức tạp như bố cục ma trận fractal, ràng buộc căn chỉnh, tính toán địa chỉ và các tham số tầng thấp dài dòng. Bằng cách quản lý nội bộ những độ phức tạp này, thư viện giúp các kernel GEMM giữ được mã nguồn gọn gàng trong khi vẫn duy trì hiệu suất thực thi cao.

Cách thức hoạt động

DeepGEMM-Ascend đạt được hiệu suất bằng cách áp dụng các kỹ thuật tối ưu hóa đặc thù của Ascend, đẩy phần cứng đến gần giới hạn lý thuyết của nó. Thư viện sử dụng phương pháp nạp dữ liệu thưa (sparse data loading) và đường ống dựa trên coroutine (coroutine-based pipelining) để giảm thiểu thời gian chờ và tối đa hóa thông lượng. Các phương pháp này cho phép kernel xử lý đồng thời việc di chuyển dữ liệu và tính toán, giảm bớt các nút thắt thường gặp trong các tác vụ điện toán hiệu năng cao.

Việc triển khai đóng vai trò là tài liệu tham khảo cho tối ưu hóa hiệu suất cực đoan trên nền tảng Ascend. Mặc dù có mã nguồn nhẹ, thư viện chứng minh khả năng đạt hiệu suất phần cứng đỉnh điểm trên nhiều hình dạng ma trận khác nhau. Điều này đặc biệt quan trọng đối với các khối lượng công việc động, nơi kích thước tensor thay đổi thường xuyên trong quá trình suy luận hoặc huấn luyện.

Đối với các nhà phát triển tích hợp thư viện này, định dạng hệ số tỷ lệ (scaling factor) hơi khác so với các triển khai của NVIDIA. Trên Ascend, mỗi cặp hệ số tỷ lệ UE8M0 dọc theo chiều K được đóng gói vào một int16, với các giá trị được lưu trữ theo thứ tự MN-major để đạt hiệu quả phần cứng tối ưu. Thư viện cung cấp các hàm tiện ích để chuyển đổi hệ số tỷ lệ sang bố cục bắt buộc này, đảm bảo khả năng tương tác liền mạch với các pipeline dữ liệu hiện có.

Chi tiết chính

  • Hỗ trợ phần cứng: Được phát triển và xác minh trên dòng NPU Huawei Ascend 950.
  • Yêu cầu phần mềm: Cần bộ công cụ CANN 9.20, torch_npu, Python 3.10 trở lên và trình biên dịch hỗ trợ C++20.
  • Kiểu dữ liệu: Hỗ trợ các thao tác GEMM BF16, FP8 và FP4, cùng với MQA logits và các toán tử MegaMoE.
  • Hiệu suất: Các thao tác GEMM dày đặc (dense) đạt tới 99,8% giới hạn phần cứng đối với định dạng BF16 và 99,5% đối với định dạng FP8.
  • Kỹ thuật tối ưu hóa: Sử dụng nạp dữ liệu thưa và đường ống dựa trên coroutine để tiệm cận giới hạn hiệu suất phần cứng.
  • Giấy phép: Phát hành theo Giấy phép MIT, cho phép áp dụng rộng rãi và sửa đổi.

Tại sao điều này quan trọng

Đối với các kỹ sư phần mềm xây dựng hạ tầng AI, bản phát hành này đáng kể hạ thấp rào cản gia nhập khi sử dụng phần cứng Huawei Ascend. Trong lịch sử, việc tối ưu hóa kernel cho các bộ tăng tốc phi-NVIDIA đòi hỏi chuyên môn sâu về kiến trúc phần cứng cụ thể và quản lý thủ công bố cục bộ nhớ. DeepGEMM-Ascend trừu tượng hóa những khó khăn này, cho phép các nhóm tập trung vào kiến trúc mô hình thay vì tinh chỉnh thiết bị ở tầng thấp.

Các tỷ lệ sử dụng cao được báo cáo trong benchmark gợi ý rằng các tổ chức có thể đạt được khả năng mở rộng chi phí hiệu quả trên cụm Ascend mà không hy sinh hiệu quả tính toán. Với các thao tác GEMM dày đặc đạt gần 100% giới hạn phần cứng, thư viện đảm bảo rằng tài nguyên NPU đắt đỏ không bị lãng phí do sự kém hiệu quả của phần mềm. Điều này rất quan trọng đối với các triển khai quy mô lớn, nơi ngay cả những cải thiện nhỏ về tỷ lệ sử dụng cũng chuyển thành khoản tiết kiệm đáng kể về năng lượng và thời gian.

Hơn nữa, việc hỗ trợ các tính năng nâng cao như MegaMoE và MQA logits cho thấy thư viện đã sẵn sàng cho các kiến trúc mô hình thế hệ tiếp theo. Khi các mô hình AI trở nên lớn hơn và phức tạp hơn, khả năng xử lý hiệu quả định tuyến hỗn hợp chuyên gia (mixture-of-experts routing) và multi-query attention trở thành lợi thế cạnh tranh. Thư viện này cung cấp một nền tảng vững chắc để triển khai các tính năng đó trên phần cứng Ascend.

Bạn có thể làm gì

  • Cài đặt thư viện bằng pip với cờ no-build-isolation để đảm bảo biên dịch đúng các extension C++.
  • Xác minh môi trường của bạn đáp ứng các yêu cầu, đặc biệt kiểm tra xem đã có CANN 9.20 và Python 3.10 trở lên hay chưa.
  • Sử dụng các hàm tiện ích được cung cấp để chuyển đổi hệ số tỷ lệ sang bố cục bắt buộc cho các thao tác GEMM.
  • Cấu hình môi trường để tận dụng các tối ưu hóa đặc thù của Ascend nhằm đạt hiệu suất tốt nhất.

Công cụ từ cửa hàng Bytechap

$89

DocBento

Hệ thống quản lý tài liệu tự host, có khả năng đọc mọi bản quét và trả lời kèm trích dẫn trang cụ thể.

Demo trực tiếp

Đọc tiếp

Tất cả bài viết