← Todas as notícias

Amazon SageMaker HyperPod Inference Gateway otimiza inferência de modelos em larga escala

Nova solução com roteamento baseado em sinais de inferência em tempo real reduz a latência do primeiro token em até 82%.

A AWS anunciou o lançamento do Amazon SageMaker HyperPod Inference Gateway, um sistema de roteamento ciente de GPU nativo de Kubernetes que é implementado como um add-on gerenciado no Amazon EKS sem necessidade de alterações no código da aplicação. Ao substituir o balanceamento de carga round-robin por decisões em tempo real fundamentadas em métricas como utilização de cache KV, profundidade de fila e acerto de cache de prefixo, o gateway entrega uma redução de até 82% no primeiro token e de 97% a 98% em p99 TTFT sob tráfego variável. A solução é compatível com servidores como vLLM e SGLang.

O Radar na sua caixa de entrada

Uma seleção curta de tecnologia, negócios e inovação, com confirmação por e-mail.

Você pode retirar cada consentimento. Leia o Aviso de Privacidade.