COMO USAR IAISSUE 07

CACHE HIT EM IA
GUIA COMPLETO

Mesmo com o mesmo modelo, custo e velocidade podem variar muito.
O segredo está emcongelar o início da solicitação.

REQUEST / 0042LIVE
01Definições de ferramentasFIXO
02Instruções do sistemaFIXO
03Documento de referênciaFIXO
CACHE BOUNDARY
04Pergunta atualALTERADO
05Resultado recenteALTERADO

O início permanece. Só entram novas informações no final.

Preço da leitura de cacheExemplo: 90%↓*
Maior ganho de TTFT31%↓
Princípio centralInício fixo, final variável

* Exemplo com preços oficiais de GPT-5.6, Claude e Gemini · † Maior valor em estudo no arXiv com 500 sessões; algumas estratégias não melhoraram ou ficaram mais lentas

01

MECANISMO / THE MECHANISM

A IA não memoriza a resposta;
ela reutiliza o cálculo do mesmo início.

O cache de prompt e contexto não memoriza a resposta. Durante o prefill, o provedor reutiliza os cálculos do prefixo correspondente. Se o cache é válido, só a nova cauda precisa ser lida.

01Prefill

Lê toda a entrada e cria o estado computacional.

02Reutilização do cache

Evita recalcular o mesmo início.

03Decodificação

Gera a resposta token por token.

Ponto-chave

O cache reduz principalmente o prefill da entrada. O custo da saída e a velocidade de geração são fatores separados.

INTERACTIVE LAB 01

Experimente quebrar o cache.

A parte reutilizável muda conforme o ponto alterado.

SIMULATIONBom fluxo: 3/5
01Definições de ferramentasHIT
02Instruções do sistemaHIT
03Documento de referênciaHIT
04Pergunta atualNEW
05Resultado recenteNEW

Reutiliza os três primeiros blocos sem alterações.

Em um cache de prefixo típico, a parte reutilizável diminui depois do ponto alterado.

02

IMPACTO / WHY IT MATTERS

Custo, velocidade e capacidade. Um único hit muda os três.

As condições e os benefícios variam entre provedores e modelos. Os 90% são uma condição representativa do preço da entrada, não a redução do custo total.

A

CUSTO / COST

Lê a mesma entrada por menos.

90%↓

Exemplo: uma entrada com cache hit custa 10% da entrada comum

B

VELOCIDADE / SPEED

Ao pular um prefill longo, o primeiro token chega mais rápido.

TTFT↓

O ganho varia conforme o prefixo e a infraestrutura

C

CAPACIDADE / THROUGHPUT

Faça mais trabalho com o mesmo orçamento e tempo.

×MORE

Na maioria dos modelos, Claude exclui leituras de cache do ITPM

INTERACTIVE LAB 02

Olhar só para a taxa de hit é enxergar apenas metade.

Este modelo simples cobra a leitura do cache a 10% da entrada comum. Gravação, armazenamento (TTL) e saída não estão incluídos.

RESULT / PER TURN
56K

Carga efetiva por turno, convertida em tokens de preço integral

Índice de custo da entrada28 / 100

Economia estimada72%

98% HIT900K × 0.118 = 106.2K
VS
70% HIT50K × 0.37 = 18.5K

Mesmo com taxa de hit maior, um contexto grande demais gera carga cerca de 5,7× maior.

CASE

Nossos registros de uso do Orca

ORCA HQ · 2026.07.20—07.27 · LOCAL USAGE LOG

Encontramos em nossos registros o padrão que mantém o cache ativo.

Analisamos 207 sessões com caminhos verificados nos registros do HQ agregados localmente pelo Orca. Os tokens são a soma dos campos usage; não estimamos custos sem registros de cobrança.

Período observadoMEDIDO
8 dias
20–27 de julho
Sessões do OrcaMEDIDO
207
caminhos do HQ verificados
Respostas registradasMEDIDO
12.554
com usage
Modelos usadosMEDIDO
8
Claude, GLM e DeepSeek

WHAT THE LOG SHOWS

Parcela das leituras de cache no total de tokens de entrada

Dos 2,201 bilhões de tokens, 2,161 bilhões foram cache read, 38,82 milhões cache write e 799 mil entrada nova.

MEDIDOcache read ÷ (read + write + fresh input)

Leitura do cacheMEDIDO

2,161 bi98.20%

Gravação no cacheMEDIDO

38,82 mi1.76%

Entrada novaMEDIDO

799 mil0.04%
Média por turno172 mil cache-read tokens

alta reutilização, mas contexto absoluto grande

THREE REAL RUNS

Em execuções de cerca de uma hora, houve leituras de cache em centenas de respostas.

Todas são benchmarks do Orca com Claude Opus 5. Os totais foram arredondados.

01 · Revisão operacionalOPSREV3

615turnos

Tempo
57 min
Leitura do cache
137,1 mi
Gravação no cache
298 mil
Proporção de leitura
99.78%

Observação: as leituras foram cerca de 460 vezes maiores que as gravações.

02 · Revisão de cenáriosSCENAREV

486turnos

Tempo
49 min
Leitura do cache
110,2 mi
Gravação no cache
292 mil
Proporção de leitura
99.73%

Observação: a maioria dos tokens de entrada foi reutilizada.

03 · Revisão de resumo longoLONGSUM4

425turnos

Tempo
48 min
Leitura do cache
100,5 mi
Gravação no cache
264 mil
Proporção de leitura
99.74%

Observação: tarefas longas também apresentaram alta reutilização.

O principal achado

As três execuções fizeram tarefas com o mesmo objetivo em sequência, na mesma sessão e em pouco tempo.

Atenção: é uma forte correlação, não uma classificação direta da causa de cada gravação.
03

PRÁTICA / THE PLAYBOOK

Congele o início. Mude apenas o final.

Otimizar o cache depende de como você inicia, conduz e organiza a sessão.

BEFORE01

Antes de começar, decida o que ficará fixo.

  • Organize regras permanentes e referências
  • Defina modelo, MCP e ferramentas
  • Uma tarefa por thread
DURING02

Durante o trabalho, acrescente só o que mudou.

  • Pergunta e resultado mais recente no final
  • Mova imagens e logs para arquivos
  • Execute a mesma tarefa em sequência
RESET03

Quando ficar pesado, reorganize.

  • Compacte o contexto da mesma tarefa
  • Abra nova thread quando a tarefa mudar
  • Verifique taxa de hit e tokens absolutos

Chatbot geral / PRESCRIPTION

Uma thread por assunto; materiais uma vez

  1. 01

    Organize a descrição e os materiais no início.

  2. 02

    Continue a mesma tarefa na mesma thread.

  3. 03

    Informe apenas mudanças em documentos longos.

CACHE & CONTEXT HABITS

Estes hábitos prejudicam a reutilização e a eficiência do contexto.

  • ×Valores dinâmicos nas instruções do sistema
  • ×Alterar ferramentas ou ordem com frequência
  • ×Editar e colar novamente o mesmo documento
  • ×Acumular imagens e logs brutos
  • ×Misturar tarefas diferentes na mesma thread

WHAT TO MEASURE

Acompanhe proporções e valores absolutos.

01Leitura / gravação do cache

O cache hit está acontecendo?

02Entrada total por turno

A sessão está pesada demais?

03Custo por tarefa

Quanto custa cada resultado?

04TTFT

O primeiro token ficou mais rápido?

A linha de base e a tendência da sua carga são mais importantes que uma taxa ideal universal.

04

OPINIÃO DO GPT / A MODEL'S TAKE

Otimizar o cachenão é um truque de prompt;é projetar a estrutura da informação.

A taxa de hit é útil, mas 100% não é o objetivo. Reutilize fatos estáveis e leia de novo apenas o que é necessário agora.

OPTIMIZE IN THIS ORDER
  1. 01Remover contexto desnecessário
  2. 02Fixar informações estáveis
  3. 03Separar threads por tarefa
  4. 04Medir a taxa de hit

Se houver conflito com atualidade ou precisão, priorize a precisão.

05

Verificação de 30 segundos

YOUR NEXT SESSION

Antes de começar, confira apenas seis pontos.

0 / 6

Cada item marcado deixa a sessão mais leve.

ONE LINE TO REMEMBER

Bom uso do cache =
estabilidade do início × controle do contexto × ritmo de trabalho

Como os números foram calculados?

Economia estimada = taxa de hit × (1 − preço da leitura / preço comum). Com leitura a 10% e hit de 80%, o custo de entrada cai cerca de 72%.

O cache funciona igual em toda IA?

Não. TTL, tamanho mínimo, descontos e campos usage variam por provedor e modelo.

O mesmo chat garante um cache hit?

Não. Depende das políticas do provedor, TTL e gestão interna do contexto.

Fontes primárias da verificação

Comparamos documentos oficiais e o estudo original em 13 de agosto de 2026. Os números do Orca foram recalculados dos logs locais de usage.