Triển khai hệ thống gợi ý tạo sinh với NVIDIA Dynamo-Triton và HSTU
NVIDIA trình diễn quy trình làm việc end-to-end để phục vụ các mô hình Hierarchical Sequential Transduction Unit (HSTU) bằng cách sử dụng PyTorch AOTI, bộ nhớ đệm FlexKV và Dynamo-Triton nhằm giảm độ trễ suy luận.