← Todas as notícias

SageMaker HyperPod implementa cache de modelos para acelerar inferência de LLMs

Recurso pré-carrega pesos e imagens de contêineres reduzindo cold starts em até 60%.

Capa editorial: SageMaker HyperPod implementa cache de modelos para acelerar inferência de LLMs
Capa editorial: SageMaker HyperPod implementa cache de modelos para acelerar inferência de LLMs

A AWS anunciou que o Amazon SageMaker HyperPod agora suporta cache de modelos, técnica de otimização que pré-carrega pesos em discos NVMe locais e armazena contêineres previamente. A medida elimina downloads lentos via rede durante eventos de autoscaling em cargas de trabalho com IA generativa, reduzindo o tempo de escalonamento em cerca de 60% e o tempo de obtenção de imagens em até 97%.

O Radar na sua caixa de entrada

Uma seleção curta de tecnologia, negócios e inovação, com confirmação por e-mail.

Você pode retirar cada consentimento. Leia o Aviso de Privacidade.