A AWS lançou o SageMaker HyperPod Inference Gateway, um componente nativo de Kubernetes oferecido como complemento gerenciado para Amazon EKS. A solução direciona solicitações de inferência com base em métricas dos servidores e das GPUs, em vez de depender apenas de distribuição circular. A empresa informa compatibilidade com vLLM e SGLang e afirma que o recurso pode ser adotado sem alterar a aplicação.
Nos testes divulgados pela AWS, a redução do tempo até o primeiro token chegou a 82%; o número é um resultado do fornecedor em condições específicas, não uma garantia para qualquer carga. O anúncio contempla roteamento dentro de um cluster, enquanto recursos entre clusters e regiões aparecem como futuros. Para equipes que operam modelos, o interesse é aproveitar melhor a capacidade instalada e controlar latência, verificando esses ganhos com o próprio tráfego.