Phân tích Roofline chỉ ra lý do ZeRO-3 thất bại với DeepSeek-V3 trên nền tảng Hopper
Mô hình hóa giới hạn tốc độ ánh sáng (speed of light) cho thấy FSDP tạo ra nút thắt cổ chai giao tiếp qua InfiniBand đối với DeepSeek-V3, khiến song song hóa theo pipeline trở thành lựa chọn bắt buộc để huấn luyện hiệu quả.
Được dịch tự động từ bản gốc tiếng Anh.
Các kỹ sư hạ tầng phân tích cấu hình huấn luyện cho DeepSeek-V3 trên cụm máy chủ H800 đã sử dụng phương pháp phân tích roofline để xác định các chiến lược song song hóa tối ưu. Được công bố vào tháng 10 năm 2026, bài phân tích chuyên sâu này chứng minh rằng Fully Sharded Data Parallelism (FSDP), còn được gọi là ZeRO-3, tạo ra một nút thắt cổ chai giao tiếp nghiêm trọng khi mở rộng quy mô kiến trúc mô hình cụ thể này.
Phân tích kết luận rằng cần phải áp dụng song song hóa theo pipeline (pipeline parallelism) để giữ hệ thống ở trạng thái bị giới hạn bởi năng lực tính toán (compute-bound) thay vì bị giới hạn bởi băng thông giao tiếp (communication-bound). Bằng cách so sánh các giới hạn phần cứng lý thuyết với hiệu suất đo thực tế, các tác giả cung cấp một phương pháp dự đoán hiệu quả huấn luyện mà không cần xây dựng và benchmark nhiều hệ thống quy mô đầy đủ.
Chuyện gì đã xảy ra
Trong phần hai của loạt bài về huấn luyện DeepSeek-V3, các tác giả đã xem xét cách các lựa chọn song song hóa, checkpointing kích hoạt (activation checkpointing) và số học độ chính xác thấp ảnh hưởng đến yêu cầu bộ nhớ. Họ đã xác định một cấu hình cho phép mô hình vừa khít trên cụm máy chủ H800 gồm 2048 node. Các tác giả lưu ý rằng kết quả này không phải ngẫu nhiên; việc cố định kiến trúc mô hình và nhắm mục tiêu vào phần cứng cụ thể mà DeepSeek sử dụng tự nhiên dẫn đến cấu hình mà nhóm gốc đã chọn.
Thách thức cốt lõi được giải quyết là lựa chọn chiến lược song song hóa nhằm tối đa hóa số phép toán dấu phẩy động có ích mỗi giây (FLOPs/sec) mà không phải chịu chi phí đắt đỏ của việc triển khai và benchmark nhiều hệ thống trên cụm máy chủ cỡ lớn. Việc triển khai song song hóa theo pipeline phức tạp hơn đáng kể so với FSDP, do đó các kỹ sư cần một cách đáng tin cậy để quyết định giữa hai phương pháp trước khi viết mã. Các tác giả lập luận rằng ngay cả khi xây dựng cả hai hệ thống, sai số trong quá trình benchmark cũng có thể làm vô hiệu hóa việc so sánh.
Để giải quyết vấn đề này, họ đã áp dụng phân tích roofline, một kỹ thuật mô hình hóa hiệu suất kinh điển. Phương pháp này coi tổng số FLOPs yêu cầu là cố định và xác định xem hệ thống bị giới hạn bởi tốc độ tính toán hay băng thông giao tiếp phân tán. Phân tích tiết lộ rằng FSDP là một lựa chọn kém cho DeepSeek-V3 vì nó bị ràng buộc bởi băng thông InfiniBand, trong khi các chiến lược khác có thể giữ cho GPU bận rộn với việc tính toán.
Cơ chế hoạt động
Phân tích roofline dựa trên khái niệm hiệu suất "tốc độ ánh sáng" (SOL - speed of light), đại diện cho giới hạn trên tuyệt đối mà phần cứng có thể đạt được. Trong vật lý, không gì vượt quá tốc độ ánh sáng; trong điện toán, không phần mềm nào có thể vượt quá đỉnh lý thuyết của silicon cơ bản. Tuy nhiên, việc sử dụng các con số đỉnh từ tài liệu marketing thường gây hiểu lầm. Các con số TFLOP/s mà NVIDIA quảng cáo giả định các điều kiện lý tưởng, chẳng hạn như tensor bằng không và lịch trình lệnh hoàn hảo, những điều hiếm khi xảy ra trong các phép nhân ma trận thực tế.
Hiệu suất thực tế khác biệt so với bảng thông số kỹ thuật do việc nạp bộ nhớ, độ trễ của phân cấp cache và giới hạn nguồn điện. Ví dụ, việc chạy dữ liệu khác không có thể kích hoạt giới hạn nguồn điện làm giảm tốc độ xung nhịp, nghĩa là hiệu suất phụ thuộc vào giá trị dữ liệu đầu vào. Để giải quyết vấn đề này, các tác giả sử dụng FLOPs khả thi được đo lường thông qua microbenchmark từ Smol Training Playbook của HuggingFace. Đối với độ chính xác BF16, H800 đạt 758 TFLOP/s, tương đương 76,6% đỉnh lý thuyết 989 TFLOP/s. Đối với FP8, nó đạt 1,46 PFLOP/s, tức là 73,6% của đỉnh 1,98 PFLOP/s.
Băng thông mạng cũng được xử lý tương tự. Mặc dù thông số kỹ thuật của InfiniBand tuyên bố 50 GB/s, mức này phần lớn có thể đạt được, nhưng hiệu suất NVLink trên H800 thấp hơn so với H100. DeepSeek báo cáo chỉ đạt băng thông đơn hướng 160 GB/s trên NVLink của H800, so với thông số 200 GB/s. Phân tích sử dụng các giá trị đo được này để tính toán thời gian dành cho giao tiếp so với tính toán.
Trong huấn luyện phân tán, nút thắt cổ chai chuyển từ bộ nhớ băng thông cao (HBM) sang băng thông liên node. Tổng số FLOPs yêu cầu cho một bước huấn luyện vẫn không đổi bất kể chiến lược song song hóa, giống như việc cắt một chiếc pizza không làm thay đổi kích thước tổng thể của nó. Tuy nhiên, chi phí giao tiếp biến đổi mạnh mẽ. Nếu thời gian giao tiếp vượt quá thời gian tính toán, hệ thống sẽ bị giới hạn bởi giao tiếp, và GPU sẽ ngồi chờ dữ liệu trong khi nhàn rỗi. Mục tiêu là đảm bảo tính toán mất nhiều thời gian hơn giao tiếp, cho phép trainer chồng lấn (overlap) các thao tác này để che giấu độ trễ.
Chi tiết quan trọng
- Mục tiêu phần cứng: Phân tích tập trung vào cụm máy chủ gồm 2048 node GPU NVIDIA H800.
- Năng lực tính toán khả thi: Hiệu suất BF16 đo được là 758 TFLOP/s (76,6% đỉnh), và FP8 là 1,46 PFLOP/s (73,6% đỉnh).
- Ràng buộc mạng: Băng thông InfiniBand được giả định ở mức 50 GB/s mỗi GPU, trong khi NVLink bị giới hạn ở 160 GB/s dựa trên báo cáo của DeepSeek.
- Kết luận về song song hóa: FSDP (ZeRO-3) bị loại bỏ vì nó bị ràng buộc bởi băng thông InfiniBand đối với kích thước mô hình này.
- Phương pháp luận: Cách tiếp cận so sánh thời gian "tốc độ ánh sáng" tính toán cho FLOPs và truyền byte để xác định xem một bước bị giới hạn bởi tính toán hay giao tiếp.
- Đơn giản hóa: Multi-Token Prediction (MTP) được bỏ qua trong phân tích cụ thể này để duy trì sự rõ ràng.
Tại sao điều này quan trọng
Đối với các đội ngũ hạ tầng học máy, phân tích này cung cấp một khung làm việc chặt chẽ để đưa ra các quyết định kiến trúc rủi ro cao mà không cần đầu tư ban đầu khổng lồ. Việc xây dựng và benchmark nhiều chiến lược song song hóa trên hàng nghìn GPU tốn kém và mất thời gian một cách cấm kỵ. Phân tích roofline cung cấp một giải pháp thay thế dựa trên bảng tính có thể dự đoán các nút thắt cổ chai hiệu suất với độ chính xác hợp lý. Nó ngăn cản các đội ngũ theo đuổi các lộ trình triển khai, chẳng hạn như thiết lập song song hóa theo pipeline phức tạp, chỉ để phát hiện sau đó rằng một cách tiếp cận đơn giản hơn như FSDP sẽ thất bại do giới hạn mạng.
Hơn nữa, sự khác biệt giữa thông số marketing và hiệu suất khả thi là rất quan trọng đối với việc lập kế hoạch năng lực chính xác. Dựa vào các đỉnh lý thuyết có thể dẫn đến đánh giá quá cao thông lượng huấn luyện. Bằng cách sử dụng microbenchmark đo được, các kỹ sư có thể tạo ra dòng thời gian thực tế và kỳ vọng ngân sách. Điều này đặc biệt quan trọng khi các mô hình trở nên lớn hơn và độ chính xác giảm xuống, giúp tăng tốc tính toán nhưng không giảm khối lượng giao tiếp, có khả năng làm trầm trọng thêm các nút thắt cổ chai băng thông.
Bạn có thể làm gì
- Benchmark hiệu suất GEMM của phần cứng của bạn bằng các thư viện như cuBLAS để xác định FLOP/s khả thi thay vì dựa vào bảng thông số kỹ thuật.
- Đo băng thông NVLink và InfiniBand thực tế trong môi trường cụm máy chủ của bạn, vì topo thực tế và giới hạn nguồn điện có thể làm giảm thông lượng.
- Sử dụng phân tích roofline để so sánh các chiến lược song song hóa trước khi triển khai, tập trung vào việc thời gian giao tiếp có vượt quá thời gian tính toán hay không.
- Tính đến các giới hạn nguồn điện trong mô hình của bạn, nhận thức rằng dữ liệu đầu vào khác không có thể làm chậm tốc độ xung nhịp GPU trong quá trình huấn luyện.
- Ưu tiên các cấu hình bị giới hạn bởi tính toán khi có thể, đảm bảo rằng chi phí giao tiếp có thể được chồng lấn với phép tính.
- Đánh giá lại các giả định khi thay đổi mức độ chính xác, vì độ chính xác thấp hơn làm tăng tốc độ tính toán nhưng có thể chuyển nút thắt cổ chai sang băng thông mạng.



