A OpenAI anunciou melhorias no cache de prompts para a família GPT-6, incluindo ferramentas de diagnóstico, painéis e controle sobre os prefixos elegíveis. O mecanismo reutiliza processamento de trechos iniciais compartilhados entre solicitações, dentro de uma janela de 30 minutos. A empresa informa desconto de até 90% sobre tokens de entrada que efetivamente utilizem o cache.
Para aplicações que repetem instruções ou contexto, o recurso pode reduzir processamento e despesas, mas a economia depende da quantidade de conteúdo reutilizável e da frequência das chamadas. Não se trata de armazenar uma resposta pronta para toda pergunta, nem de remover partes do contexto enviado ao modelo. Os pontos de controle permitem definir o fim do prefixo a aproveitar. A avaliação econômica deve observar a taxa real de acertos do cache e os demais custos da aplicação, evitando projetar o desconto máximo sobre todo o consumo.