Construir con IA

Despliegue de recomendadores generativos con NVIDIA Dynamo-Triton y HSTU

NVIDIA demuestra un flujo de trabajo integral para servir modelos Hierarchical Sequential Transduction Unit utilizando PyTorch AOTI, caché FlexKV y Dynamo-Triton para reducir la latencia de inferencia.

Traducido automáticamente del original en inglés.

NVIDIA ha publicado una guía técnica que detalla cómo desplegar sistemas de recomendación generativa basados en la Unidad de Transducción Secuencial Jerárquica (HSTU) mediante su servidor de inferencia Dynamo-Triton. Publicada a finales de septiembre de 2026, la guía describe un flujo de trabajo integral que combina la compilación Ahead-of-Time Inductor de PyTorch con el almacenamiento en caché clave-valor respaldado por GPU para gestionar eficientemente secuencias largas del historial de usuario.

El lanzamiento está dirigido a ingenieros que desarrollan motores de personalización a gran escala y necesitan equilibrar la complejidad del modelo con presupuestos estrictos de latencia. Al integrar estas herramientas, los desarrolladores pueden servir modelos de recomendación conscientes de la secuencia sin reescribir código para entornos de ejecución separados, logrando aceleraciones significativas en hardware moderno.

Qué ocurrió

Los sistemas de recomendación generativa están transformando la forma en que las plataformas gestionan la personalización al tratar el comportamiento del usuario como un problema de modelado de secuencias, en lugar de una serie de pasos aislados de recuperación y clasificación. En este paradigma, las interacciones del usuario, el contexto y los elementos candidatos se convierten en tokens dentro de un flujo de eventos de alta cardinalidad. El modelo aprende a predecir los siguientes elementos relevantes basándose en esta secuencia. Si bien este enfoque captura comportamientos secuenciales ricos, introduce desafíos sustanciales de servicio debido a los largos historiales de usuarios y las grandes tablas de embeddings.

Para abordar estos desafíos, NVIDIA actualizó su repositorio recsys-examples con un flujo de trabajo completo de inferencia HSTU. Este flujo aprovecha Dynamo-Triton, anteriormente conocido como Triton Inference Server, para gestionar el ciclo de vida del despliegue. El sistema utiliza PyTorch AOTI para compilar los modelos en artefactos nativos de C++, reduciendo la sobrecarga de Python. También incorpora el almacenamiento en caché clave-valor respaldado por FlexKV para guardar estados de atención reutilizables, evitando la necesidad de recalcular los largos historiales de usuario en cada solicitud.

La guía proporciona benchmarks que muestran que esta pila ofrece ganancias de rendimiento medibles. En una GPU NVIDIA RTX PRO 6000 Blackwell Workstation Edition, el modelo HSTU de ocho capas logró una reducción de latencia de hasta 5,93 veces con un tamaño de lote de 8 cuando se utilizó una tasa de aciertos del 100% en la caché clave-valor de GPU. Esta mejora es relativa a la misma configuración sin caché, destacando la eficiencia de reutilizar los estados calculados.

Cómo funciona

El núcleo de este flujo de trabajo es la combinación de la compilación ahead-of-time y el almacenamiento en caché inteligente. PyTorch AOTI exporta el modelo de clasificación HSTU a un paquete que incluye el archivo compilado, los metadatos y los archivos de la tabla de embeddings. Este artefacto puede ser cargado por un entorno de ejecución nativo de C++, lo que elimina la sobrecarga de interpretación asociada con la ejecución estándar de Python. La implementación de embeddings optimiza aún más la memoria utilizando una NV Embedding Cache, que almacena solo los embeddings populares en la memoria de GPU mientras mantiene la tabla completa en la memoria de CPU.

La eficiencia del servicio se ve potenciada además por el KVCacheManager, que gestiona el almacenamiento de datos clave-valor procedentes de cálculos de secuencias previas. Este gestor utiliza una tabla paginada de datos clave-valor en la memoria de GPU, soportando operaciones como búsqueda, asignación y desalojo. Cuando la memoria de GPU está limitada, los estados de usuario más antiguos se eliminan mediante una política de menos recientemente usado (LRU), proporcionando el almacenamiento del lado del host una capa adicional. El kernel de atención HSTU consume datos directamente desde esta caché, permitiendo al modelo omitir el recálculo de partes estables del historial de un usuario.

Dynamo-Triton actúa como la capa de producción, cargando el paquete compilado con AOTI a través de su backend de PyTorch. Esta configuración asegura que la validación realizada durante el desarrollo mediante la reproducción nativa en C++ coincida estrechamente con el servicio en producción. El sistema gestiona el manejo de solicitudes, las métricas y la integración del backend, creando una pila unificada para la inferencia de recomendadores generativos.

Detalles clave

  • Benchmark de hardware: Las pruebas se realizaron en una GPU NVIDIA RTX PRO 6000 Blackwell Workstation Edition utilizando la configuración de clasificación KuaiRand-1K.
  • Mejoras de latencia: El modelo HSTU de ocho capas mostró una reducción de latencia de 5,93 veces con un tamaño de lote de 8 y aciertos del 100% en la caché KV de GPU, en comparación con la inferencia AOTI sin caché.
  • Estructura del modelo: El benchmark utilizó variantes HSTU de tres y ocho capas, un tamaño oculto de 512, cuatro cabezales de atención y pesos BF16.
  • Longitud de la secuencia: La longitud máxima de la secuencia del historial fue de 8.192 tokens, con una longitud de secuencia alineada efectiva de 8.320 tokens.
  • Método de compilación: PyTorch AOTI compila el modelo ahead-of-time en artefactos nativos de C++, reduciendo la sobrecarga en tiempo de ejecución en comparación con el backend estándar de Python.
  • Mecanismo de caché: La caché KV respaldada por FlexKV almacena estados de atención reutilizables, evitando el recálculo de largos historiales de usuario cuando solo se añaden nuevos tokens.

Por qué importa

Para los ingenieros de software que construyen sistemas de recomendación, la latencia es una restricción crítica. Los retrasos en la clasificación pueden impactar directamente los tiempos de carga de página y la participación del usuario. A medida que los modelos se vuelven más conscientes de la secuencia para mejorar la calidad de la personalización, el costo computacional de procesar largos historiales de usuario aumenta. Este flujo de trabajo demuestra que es posible mantener arquitecturas de modelos generativos complejos cumpliendo requisitos estrictos de latencia mediante infraestructuras de servicio optimizadas.

La integración de AOTI y la caché KV aborda dos cuellos de botella principales: la sobrecarga en tiempo de ejecución y el cálculo redundante. Al compilar los modelos ahead-of-time, los desarrolladores eliminan la penalización de la interpretación de Python durante la inferencia. Al almacenar en caché los estados clave-valor, evitan repetir cálculos de atención costosos para partes estáticas del historial del usuario. Esto permite a los equipos escalar la profundidad del modelo y la longitud de la secuencia sin aumentar proporcionalmente los costos de inferencia.

Además, la alineación entre la validación en desarrollo y el servicio en producción reduce el riesgo operativo. Utilizar el mismo paquete AOTI tanto para la validación en C++ como para el despliegue en Dynamo-Triton asegura que las características de rendimiento observadas en las pruebas se mantengan verdaderas en producción. Esta consistencia simplifica el camino desde la investigación hasta el despliegue para los sistemas de recomendación generativa.

Qué puedes hacer

  • Clona el repositorio recsys-examples de NVIDIA para acceder a la guía de inferencia HSTU y al código de ejemplo.
  • Revisa la documentación de Dynamo-Triton para entender cómo configurar el backend PyTorch AOTI para tus modelos.
  • Experimenta con el almacenamiento en caché respaldado por FlexKV para medir las reducciones de latencia para tus longitudes específicas de historial de usuario.
  • Valida los artefactos exportados con AOTI utilizando la reproducción nativa en C++ para asegurar la corrección antes de desplegar en producción.
  • Realiza benchmarks de tus modelos HSTU con diferentes tamaños de lote para determinar la configuración óptima para tu hardware.
  • Explora las funciones de NV Embedding Cache para reducir el uso de memoria de GPU para grandes tablas de embeddings categóricos.

Herramientas de la Tienda de Bytechap

$89

DocBento

Gestión documental autoalojada que lee cada escaneo y responde con citas de página.

Demo en vivo
$79

WorkBento

Suite de RR. HH. y gestión del entorno laboral impulsada por IA que puedes alojar tú mismo.

Demo en vivo

Seguir leyendo

Todos los artículos