Blank white background with no objects or features visible.

Estamos disponibilizando acesso gratuito ao Gartner Hype Cycle for AI Governance 2026 completo. Obtenha sua cópia →

O novo preço de cache do GPT-5.6 tem um ponto de equilíbrio, e ele é o mesmo para Sol, Terra e Luna

By Amrutha Potluri

Published: October 10, 2026

Quando a OpenAI lançou o GPT-5.6 em 9 de julho com três níveis (Sol, Terra e Luna), a maior parte da atenção se voltou para a própria hierarquia de níveis. A mudança mais discreta é a mais interessante: as gravações em cache agora são cobradas pela primeira vez, a 1,25x a taxa normal de entrada, enquanto as leituras de cache mantêm o desconto existente de 90%. O cache costumava ser uma vantagem quase gratuita. Agora ele tem um custo, o que significa que também existe um ponto em que deixa de valer a pena.

Então, onde fica esse ponto? Criamos um pequeno modelo de custo para descobrir, em todos os três níveis.

Resumindo a matemática

Para uma carga de trabalho típica de agente, você tem um grande contexto compartilhado (prompt do sistema, esquemas de ferramentas, contexto do repositório) reutilizado em muitas chamadas, além de uma pequena parte exclusiva por solicitação. O ponto de equilíbrio depende de três números: o preço total de entrada, o preço de gravação em cache e o preço de leitura em cache. Resolva a combinação de gravação/leitura onde o cache custa o mesmo que não usar cache, e você obtém uma proporção única.

Aqui está a parte que não esperávamos: essa proporção é idêntica em Sol, Terra e Luna. As gravações podem representar até 78,3% das solicitações antes que o cache deixe de valer a pena, e esse número não muda com o tamanho do contexto, o volume de solicitações ou o nível em que você está. A OpenAI aplicou os mesmos multiplicadores de 1,25x/0,10x uniformemente em toda a família, portanto, a escolha do nível altera seus custos absolutos, não sua estratégia de cache.

Onde isso realmente importa: quanto você economiza, não se você deve usar cache

O tamanho do contexto não altera o ponto de equilíbrio, mas muda o que está em jogo. Executando a mesma proporção de gravação/leitura em três tamanhos de contexto:

Com um contexto compartilhado pequeno (1 mil tokens), as economias são reais, mas modestas, mesmo com altas taxas de repetição. Com um grande (32 mil tokens, pense em prompts de sistema longos e grandes esquemas de ferramentas), a mesma taxa de repetição produz economias drasticamente maiores, simplesmente porque há mais sendo descontado em cada leitura.

Como é o tráfego realista

Uma taxa de repetição fixa e limpa é um bom exemplo didático, mas o tráfego real de agentes não é tão organizado. As durações das sessões (quantas chamadas compartilham um contexto em cache antes que ele mude ou expire) variam muito. Modelamos as durações das sessões com uma distribuição log-normal (média de 25 solicitações por sessão, cauda longa) e obtivemos uma participação de gravação simulada de cerca de 3%, com uma sessão mediana de 23 solicitações e uma sessão no 90º percentil de 58. Isso não chega nem perto do limite de equilíbrio de 78,3%. Nesta simulação, o cache venceu confortavelmente: as economias variaram de 24% em um contexto pequeno de 1 mil tokens até quase 80% em um de 32 mil.

O único modo de falha que vale a pena observar: contexto que muda rapidamente. Se o contexto compartilhado do seu agente mudar a cada poucas solicitações em vez de persistir por dezenas delas, você pode acabar do lado errado desse limite, e o cache se torna um custo em vez de uma economia.

Conclusão

Não julgue o preço do cache do GPT-5.6 apenas pelo preço de tabela. Modele sua própria combinação de gravação/leitura em relação ao limite de 78,3%. Se o contexto do seu agente permanecer estável por dezenas de solicitações de cada vez, é muito provável que o cache ainda seja uma vitória clara com o novo preço, independentemente do nível que você esteja usando.

Leitura adicional

Try now.

One gateway for all your models, MCP servers, and agents.
No credit card needed.

Start free
Table of Contents

One Gateway for Every LLM, Agent and MCP Server

Book a 30-min with our AI expert

Book a Demo

The fastest way to build, govern and scale your AI

Book Demo
Summarize with
ChatGPT logo by OpenAI
Perplexity AI logo
Blurry red snowflake on white background, symmetrical frosty design with soft edges and abstract shape.

Discover More

August 26, 2026
|
5 min read

Gemini 3 Pro: Benchmarks e como usá-lo via Gateway

July 20, 2023
|
5 min read

LLMOps CoE: A próxima fronteira no cenário de MLOps

May 25, 2023
|
5 min read

LLMs de Código Aberto: Abrace ou Pereça

August 27, 2025
|
5 min read

Mapeando o Mercado de IA On-Prem: De Chips a Planos de Controle

October 10, 2026
|
5 min read

As 10 Melhores Ferramentas LLMOps em 2026

comparação
October 10, 2026
|
5 min read

5 lições sobre como executar IA agentiva em produção - Do nosso bate-papo

No items found.
October 10, 2026
|
5 min read

Escala para Zero no Kubernetes: Uma Análise Aprofundada do Elasti

Engenharia e Produto
October 10, 2026
|
5 min read

Observabilidade em Fluxos de Trabalho de LLM: Transformando Caixas Pretas em Caixas de Vidro

No items found.
No items found.

Recent Blogs

Black left pointing arrow symbol on white background, directional indicator.
Black left pointing arrow symbol on white background, directional indicator.
Take a quick product tour
Start Product Tour
Product Tour