A AWS anunciou o lançamento do Amazon SageMaker HyperPod Inference Gateway, um sistema de roteamento ciente de GPU nativo de Kubernetes que é implementado como um add-on gerenciado no Amazon EKS sem necessidade de alterações no código da aplicação. Ao substituir o balanceamento de carga round-robin por decisões em tempo real fundamentadas em métricas como utilização de cache KV, profundidade de fila e acerto de cache de prefixo, o gateway entrega uma redução de até 82% no primeiro token e de 97% a 98% em p99 TTFT sob tráfego variável. A solução é compatível com servidores como vLLM e SGLang.
← Todas as notícias
IA1 min de leituraPor Tiago Bona
Amazon SageMaker HyperPod Inference Gateway otimiza inferência de modelos em larga escala
Nova solução com roteamento baseado em sinais de inferência em tempo real reduz a latência do primeiro token em até 82%.
O Radar na sua caixa de entrada
Uma seleção curta de tecnologia, negócios e inovação, com confirmação por e-mail.