Bereitstellung generativer Recommender mit NVIDIA Dynamo-Triton und HSTU
NVIDIA demonstriert einen End-to-End-Workflow für die Bereitstellung von Modellen der Hierarchical Sequential Transduction Unit (HSTU) unter Verwendung von PyTorch AOTI, FlexKV-Caching und Dynamo-Triton zur Reduzierung der Inferenz-Latenz.