OpenAI lança cache de prompts melhorado para o GPT-6

OpenAI lança cache de prompts melhorado para o GPT-6

A OpenAI apresentou em 22 de setembro de 2026 um sistema reformulado de cache de prompts para a família GPT-6. O foco são agentes persistentes que trabalham por horas em tarefas longas, como refatorar bases de código ou produzir documentos e apresentações bem pesquisados.

O problema que a empresa quer resolver é o das aplicações que fazem uma sequência de chamadas de API encadeadas. Cada requisição repete instruções, definições de ferramentas e contexto dos turnos anteriores, e recalcular tudo isso custa tempo e dinheiro.

Mais acertos por padrão e desconto em 30 minutos

A OpenAI explica que já armazena esse contexto compartilhado em cache para reutilizar computação entre requisições. Isso reduz o tempo de resposta e garante descontos de até 90% nos tokens de entrada cacheados.

A novidade da família GPT-6 é um sistema aprimorado que eleva as taxas de acerto já na configuração padrão. O desconto passa a ser concedido para prefixos compartilhados elegíveis reaproveitados dentro de uma janela de 30 minutos.

Segundo a empresa, esses controles opcionais se somam ao desempenho que o motor entrega por conta própria.

Diagnóstico de falhas e painel de uso

Para tornar o comportamento do cache visível, foi lançado o Prompt Caching Dashboard, que mostra quanto da entrada de uma aplicação está sendo servida pelo cache. É possível acompanhar taxas de acerto ao longo do tempo e usar o gráfico de composição da entrada para comparar tokens cacheados e não cacheados, identificando quedas e medindo o impacto de mudanças na aplicação.

Quando a queda é inesperada, entra em cena a ferramenta de diagnóstico de cache de prompts. Ela compara uma requisição com uma resposta recente para apontar alterações em modelo, ferramentas, configurações ou entrada que impediram o reaproveitamento.

No exemplo divulgado, a razão reportada é tools_changed, com 5.629 tokens reutilizáveis de comparação e 5.629 tokens perdidos. A estimativa de tokens afetados ajuda a dimensionar o problema e a decidir onde otimizar a integração.

Controles explícitos, raciocínio variável e pré-aquecimento

Os desenvolvedores ganharam também breakpoints explícitos de cache, que permitem escolher quais prefixos de prompt serão reutilizados, conforme o guia de cache de prompts.

Em modelos GPT-6, agora é possível alterar o esforço de raciocínio entre respostas sem quebrar o cache. Basta anexar uma atualização de configuração, mantendo inalterado o esforço definido no nível da requisição, para elevar o empenho em uma tarefa difícil ou reduzi-lo em um acompanhamento rotineiro.

Para preservar o cache quando ferramentas e instruções mudam, a orientação é manter definições, esquemas e ordenação estáveis. Também é possível usar allowed_tools para deixar apenas as ferramentas relevantes chamáveis, ou definir tool_choice como none quando nenhuma for necessária, em vez de remover definições.

Instruções novas devem ser anexadas ao fim do contexto, em mensagens de desenvolvedor, sobrepondo-se às antigas.

Há ainda o pré-aquecimento do cache, que prepara contexto conhecido de antemão. Instruções compartilhadas, definições de ferramentas ou material de referência entram antes, para que o modelo comece a responder mais cedo quando a requisição chegar, tirando o processamento do tempo de espera do usuário.

Resultados relatados por parceiros

A OpenAI reuniu depoimentos de quem já opera com o recurso.

Mario Rodriguez, chief product officer do GitHub Copilot, afirma que, ao longo dos últimos meses, a fatia de tokens de prompt que exigem processamento novo caiu mais de 50% em bilhões de requisições, na comparação com a linha de base anterior. O resultado é uma pilha de inferência mais eficiente e primeiro token mais rápido para os desenvolvedores.

Arian Hanifi, chief technology officer, relata que painel e diagnósticos elevaram a taxa de acerto em alguns pontos percentuais e cortaram custos em 20%. Também permitem alertas quando o cache quebra.

Com breakpoints explícitos, tornou-se viável bifurcar conversas para tarefas de segundo plano reaproveitando quase todo o contexto compartilhado.

No Manus, o líder do time de agentes, Bin Fan, conta que o trabalho conjunto refinou o posicionamento de breakpoints e combinou cache explícito e automático. A taxa de acerto subiu de cerca de 85% para acima de 90% em menos de uma semana.

Eugene Mikhantyev, engenheiro de IA, relata que a migração para breakpoints explícitos elevou a taxa de acerto de 83% para 91% nas avaliações. As escritas de cache caíram aproximadamente dois terços e os custos de inferência ficaram 36% menores para a mesma carga de trabalho.

Por que isso importa

Cache deixou de ser detalhe de implementação para virar item de planilha. Em agentes de longa duração, cada ponto percentual de acerto se traduz em menos computação, menos latência e mais margem.

É isso que torna economicamente viável manter conversas ramificadas, tarefas em segundo plano e sessões de horas.

O contraponto é a fragilidade. Basta mudar uma ferramenta no meio do caminho para derrubar o reaproveitamento, como mostra o diagnóstico com 5.629 tokens perdidos.

Por isso a OpenAI empacotou o cache junto de instrumentos de medição e de padrões de projeto que só acrescentam conteúdo ao fim do contexto, empurrando a discussão para a disciplina operacional de quem constrói agentes.

Fontes e links

Matéria publicada originalmente em OpenAI

Últimas Notícias

OpenAI lança GPT-6 Sol e Luna com API 50% mais barata
Roteiros de IA em vídeos: criador aponta falta de voz própria
GPT-6 Sol e GPT-6 Luna chegam ao Amazon Bedrock
Qualcomm lança chips Snapdragon com foco em IA local