SageMaker HyperPod réduit de 82 % la latence du premier token avec un routage d’inférence Kubernetes natif
La passerelle d’inférence SageMaker HyperPod remplace le round-robin par un routage piloté par six signaux en temps réel, réduisant la latence du premier token jusqu’à 82 % sans toucher au code applicatif. Déployez-la en add-on EKS si vous servez plusieurs modèles ou un parc GPU hétérogène derrière un seul endpoint.