SageMaker HyperPod implementa cache de modelos para acelerar inferência de LLMs
Recurso pré-carrega pesos e imagens de contêineres reduzindo cold starts em até 60%.
Capa editorial: SageMaker HyperPod implementa cache de modelos para acelerar inferência de LLMs
A AWS anunciou que o Amazon SageMaker HyperPod agora suporta cache de modelos, técnica de otimização que pré-carrega pesos em discos NVMe locais e armazena contêineres previamente. A medida elimina downloads lentos via rede durante eventos de autoscaling em cargas de trabalho com IA generativa, reduzindo o tempo de escalonamento em cerca de 60% e o tempo de obtenção de imagens em até 97%.
O Radar na sua caixa de entrada
Uma seleção curta de tecnologia, negócios e inovação, com confirmação por e-mail.