CUSTO / COST
Lê a mesma entrada por menos.
Exemplo: uma entrada com cache hit custa 10% da entrada comum
Mesmo com o mesmo modelo, custo e velocidade podem variar muito.
O segredo está emcongelar o início da solicitação.
O início permanece. Só entram novas informações no final.
* Exemplo com preços oficiais de GPT-5.6, Claude e Gemini · † Maior valor em estudo no arXiv com 500 sessões; algumas estratégias não melhoraram ou ficaram mais lentas
MECANISMO / THE MECHANISM
O cache de prompt e contexto não memoriza a resposta. Durante o prefill, o provedor reutiliza os cálculos do prefixo correspondente. Se o cache é válido, só a nova cauda precisa ser lida.
Lê toda a entrada e cria o estado computacional.
Evita recalcular o mesmo início.
Gera a resposta token por token.
O cache reduz principalmente o prefill da entrada. O custo da saída e a velocidade de geração são fatores separados.
INTERACTIVE LAB 01
A parte reutilizável muda conforme o ponto alterado.
Reutiliza os três primeiros blocos sem alterações.
Em um cache de prefixo típico, a parte reutilizável diminui depois do ponto alterado.
IMPACTO / WHY IT MATTERS
As condições e os benefícios variam entre provedores e modelos. Os 90% são uma condição representativa do preço da entrada, não a redução do custo total.
CUSTO / COST
Exemplo: uma entrada com cache hit custa 10% da entrada comum
VELOCIDADE / SPEED
O ganho varia conforme o prefixo e a infraestrutura
CAPACIDADE / THROUGHPUT
Na maioria dos modelos, Claude exclui leituras de cache do ITPM
INTERACTIVE LAB 02
Este modelo simples cobra a leitura do cache a 10% da entrada comum. Gravação, armazenamento (TTL) e saída não estão incluídos.
Carga efetiva por turno, convertida em tokens de preço integral
Índice de custo da entrada28 / 100
Economia estimada72%
Mesmo com taxa de hit maior, um contexto grande demais gera carga cerca de 5,7× maior.
Nossos registros de uso do Orca
ORCA HQ · 2026.07.20—07.27 · LOCAL USAGE LOG
Analisamos 207 sessões com caminhos verificados nos registros do HQ agregados localmente pelo Orca. Os tokens são a soma dos campos usage; não estimamos custos sem registros de cobrança.
WHAT THE LOG SHOWS
Dos 2,201 bilhões de tokens, 2,161 bilhões foram cache read, 38,82 milhões cache write e 799 mil entrada nova.
Leitura do cacheMEDIDO
2,161 bi98.20%Gravação no cacheMEDIDO
38,82 mi1.76%Entrada novaMEDIDO
799 mil0.04%alta reutilização, mas contexto absoluto grande
THREE REAL RUNS
Todas são benchmarks do Orca com Claude Opus 5. Os totais foram arredondados.
Observação: as leituras foram cerca de 460 vezes maiores que as gravações.
Observação: a maioria dos tokens de entrada foi reutilizada.
Observação: tarefas longas também apresentaram alta reutilização.
As três execuções fizeram tarefas com o mesmo objetivo em sequência, na mesma sessão e em pouco tempo.
Atenção: é uma forte correlação, não uma classificação direta da causa de cada gravação.PRÁTICA / THE PLAYBOOK
Otimizar o cache depende de como você inicia, conduz e organiza a sessão.
Chatbot geral / PRESCRIPTION
Organize a descrição e os materiais no início.
Continue a mesma tarefa na mesma thread.
Informe apenas mudanças em documentos longos.
CACHE & CONTEXT HABITS
WHAT TO MEASURE
O cache hit está acontecendo?
A sessão está pesada demais?
Quanto custa cada resultado?
O primeiro token ficou mais rápido?
A linha de base e a tendência da sua carga são mais importantes que uma taxa ideal universal.
OPINIÃO DO GPT / A MODEL'S TAKE
Otimizar o cachenão é um truque de prompt;é projetar a estrutura da informação.
A taxa de hit é útil, mas 100% não é o objetivo. Reutilize fatos estáveis e leia de novo apenas o que é necessário agora.
Se houver conflito com atualidade ou precisão, priorize a precisão.
Verificação de 30 segundos
YOUR NEXT SESSION
Cada item marcado deixa a sessão mais leve.
ONE LINE TO REMEMBER
Economia estimada = taxa de hit × (1 − preço da leitura / preço comum). Com leitura a 10% e hit de 80%, o custo de entrada cai cerca de 72%.
Não. TTL, tamanho mínimo, descontos e campos usage variam por provedor e modelo.
Não. Depende das políticas do provedor, TTL e gestão interna do contexto.
Comparamos documentos oficiais e o estudo original em 13 de agosto de 2026. Os números do Orca foram recalculados dos logs locais de usage.