SageMaker HyperPod adiciona cache de modelos para acelerar inferência de LLMs
Recurso reduz tempo de inicialização a frio e acelera autoescalonamento em até 60%.
Capa editorial: SageMaker HyperPod adiciona cache de modelos para acelerar inferência de LLMs
A AWS lançou o suporte a cache de modelos no Amazon SageMaker HyperPod, uma otimização voltada para a inferência de grandes modelos de linguagem. A solução pré-carrega pesos em discos NVMe locais e mantém imagens de contêineres prontas nos nós de computação. Testes comparativos em modelos de 57 GB a 145 GB indicam uma redução de 97% no tempo de download de contêineres e um escalonamento cerca de 60% mais ágil.
O Radar na sua caixa de entrada
Uma seleção curta de tecnologia, negócios e inovação, com confirmação por e-mail.