Déploiement de recommandeurs génératifs avec NVIDIA Dynamo-Triton et HSTU
NVIDIA démontre un flux de travail de bout en bout pour servir les modèles Hierarchical Sequential Transduction Unit (HSTU) à l'aide de PyTorch AOTI, du cache FlexKV et de Dynamo-Triton afin de réduire la latence d'inférence.