Kubernetes stellt Gateway-API-Erweiterung für das Routing von LLM-Inferenz vor
Das Kubernetes-Projekt hat die Gateway API Inference Extension veröffentlicht, um das Routing für generative KI-Workloads zu standardisieren, die Latenz zu reduzieren und die GPU-Auslastung zu verbessern.
