Kubernetes presenta una extensión de la Gateway API para el enrutamiento de inferencia de LLM
El proyecto Kubernetes lanzó la Gateway API Inference Extension para estandarizar el enrutamiento de cargas de trabajo de IA generativa, reduciendo la latencia y mejorando la utilización de las GPU.
