Kubernetes introduit une extension de l'API Gateway pour le routage de l'inférence LLM
Le projet Kubernetes a publié l'extension d'inférence de l'API Gateway afin de standardiser le routage des charges de travail d'IA générative, réduisant ainsi la latence et améliorant l'utilisation des GPU.
