Despliegue de recomendadores generativos con NVIDIA Dynamo-Triton y HSTU
NVIDIA demuestra un flujo de trabajo integral para servir modelos Hierarchical Sequential Transduction Unit utilizando PyTorch AOTI, caché FlexKV y Dynamo-Triton para reducir la latencia de inferencia.