USO DE IAISSUE 07

ACIERTOS DE CACHÉ DE IA
GUÍA COMPLETA

Incluso con el mismo modelo, el coste y la velocidad pueden variar mucho.
La clave está encongelar el inicio de cada solicitud.

REQUEST / 0042LIVE
01Definiciones de herramientasFIJO
02Instrucciones del sistemaFIJO
03Documentos de referenciaFIJO
CACHE BOUNDARY
04Pregunta actualCAMBIO
05Resultados recientesCAMBIO

Mantén intacto el inicio. Añade solo información nueva al final.

Precio de lectura de cachéEjemplo: 90%↓*
Mejora máxima del TTFT31%↓
Principio clavePrefijo fijo, cola variable

* Ejemplo de tarifas oficiales de GPT-5.6, Claude y Gemini · † Máximo en un estudio de arXiv con 500 sesiones; algunas estrategias no mejoraron o fueron más lentas

01

PRINCIPIO / THE MECHANISM

La IA no recuerda la respuesta:
reutiliza el cálculo del mismo prefijo.

La caché de prompts y contexto no recuerda la respuesta. Durante el prefill, el proveedor reutiliza el cálculo del prefijo coincidente. Si sigue válido, solo lee la cola nueva.

01Prefill

Lee toda la entrada y genera el cálculo interno.

02Reutilización de caché

Evita volver a calcular el mismo prefijo.

03Decodificación

Genera la respuesta token a token.

Clave

La caché reduce principalmente el prefill de entrada. El coste de salida y la velocidad de generación son independientes.

INTERACTIVE LAB 01

Rompe la caché tú mismo.

La parte reutilizable depende de dónde hagas el cambio.

SIMULATIONBuen flujo: 3/5
01Definiciones de herramientasHIT
02Instrucciones del sistemaHIT
03Documentos de referenciaHIT
04Pregunta actualNEW
05Resultados recientesNEW

Los tres primeros bloques se reutilizan sin cambios.

En una caché de prefijos típica, se reduce la parte reutilizable posterior al cambio.

02

IMPACTO / WHY IT MATTERS

Coste, velocidad y capacidad. Un acierto de caché cambia las tres.

Los requisitos y beneficios varían según proveedor y modelo. El 90% es una condición representativa del precio de entrada, no el ahorro de toda la solicitud.

A

COSTE / COST

Lee la misma entrada por menos.

90%↓

Ejemplo: una entrada con acierto cuesta el 10% de la normal

B

VELOCIDAD / SPEED

Evita un prefill largo y recibe antes el primer token.

TTFT↓

El efecto depende de la longitud del prefijo y la infraestructura

C

CAPACIDAD / THROUGHPUT

Haz más trabajo con el mismo presupuesto y tiempo.

×MORE

Claude excluye en muchos modelos los tokens de caché del cálculo de ITPM

INTERACTIVE LAB 02

La tasa de aciertos solo cuenta la mitad de la historia.

Este modelo fija la lectura de caché en el 10% de una entrada normal. Excluye escritura, almacenamiento (TTL) y salida.

RESULT / PER TURN
56K

Carga efectiva por turno, expresada en tokens a precio completo

Índice de coste de entrada28 / 100

Ahorro estimado72%

98% HIT900K × 0.118 = 106.2K
VS
70% HIT50K × 0.37 = 18.5K

Incluso con más aciertos, un contexto demasiado grande supone unas 5,7 veces más carga.

CASE

Nuestros registros de uso de Orca

ORCA HQ · 2026.07.20—07.27 · LOCAL USAGE LOG

En nuestros registros encontramos los patrones que hacen que la caché cobre vida.

Analizamos 207 sesiones de HQ cuyas rutas pudimos verificar en los registros locales de Orca. Los tokens son la suma de los campos usage; no estimamos costes sin registros de facturación.

Periodo observadoMEDIDO
8 días
20–27 de julio
Sesiones de OrcaMEDIDO
207
rutas de HQ verificadas
Respuestas registradasMEDIDO
12.554
con usage
Modelos utilizadosMEDIDO
8
Claude, GLM y DeepSeek

WHAT THE LOG SHOWS

Proporción de lecturas de caché sobre todos los tokens de entrada

De 2.201 mil M de tokens, 2.161 mil M fueron cache read, 38,82 M cache write y 799 mil entrada nueva.

MEDIDOcache read ÷ (read + write + fresh input)

Lectura de cachéMEDIDO

2.161 mil M98.20%

Escritura de cachéMEDIDO

38,82 M1.76%

Entrada nuevaMEDIDO

799 mil0.04%
Promedio por turno172 mil cache-read tokens

alta reutilización, pero contexto absoluto grande

THREE REAL RUNS

En ejecuciones de una hora, hubo lecturas de caché en cientos de respuestas.

Las tres fueron pruebas de Orca con Claude Opus 5. Los totales están redondeados.

01 · Revisión operativaOPSREV3

615turnos

Duración
57 min
Lectura de caché
137,1 M
Escritura de caché
298 mil
Proporción de lectura
99.78%

Observación: las lecturas fueron unas 460 veces mayores que las escrituras.

02 · Revisión de escenariosSCENAREV

486turnos

Duración
49 min
Lectura de caché
110,2 M
Escritura de caché
292 mil
Proporción de lectura
99.73%

Observación: se reutilizó la mayoría de los tokens de entrada.

03 · Revisión de resumen extensoLONGSUM4

425turnos

Duración
48 min
Lectura de caché
100,5 M
Escritura de caché
264 mil
Proporción de lectura
99.74%

Observación: el trabajo extenso también mostró alta reutilización.

Lo que comprobamos

Las tres ejecuciones continuaron tareas con el mismo objetivo en una sola sesión y durante poco tiempo.

Nota: es una correlación fuerte, no una clasificación directa de la causa de cada escritura.
03

PRÁCTICA / THE PLAYBOOK

Congela el inicio. Cambia solo la cola.

Optimizar la caché depende de cómo inicias, continúas y ordenas una sesión.

BEFORE01

Decide qué quedará fijo antes de empezar.

  • Organiza reglas duraderas y referencias
  • Define modelo, MCP y herramientas
  • Una tarea por hilo
DURING02

Añade solo lo que cambie durante el trabajo.

  • Pregunta y resultados recientes al final
  • Mueve imágenes y registros a archivos
  • Continúa la misma tarea cuando sea posible
RESET03

Cuando pese demasiado, ordénalo.

  • Comprime el contexto de la misma tarea
  • Abre otro hilo cuando cambie la tarea
  • Revisa aciertos y tokens absolutos

Chatbot general / PRESCRIPTION

Un hilo por tema; materiales una vez

  1. 01

    Organiza descripción y materiales al principio.

  2. 02

    Continúa la misma tarea en el mismo hilo.

  3. 03

    Indica solo los cambios de documentos largos.

CACHE & CONTEXT HABITS

Estos hábitos perjudican la reutilización y la eficiencia del contexto.

  • ×Valores dinámicos en instrucciones del sistema
  • ×Cambiar a menudo herramientas u orden
  • ×Editar y volver a pegar el mismo documento
  • ×Acumular imágenes y registros brutos
  • ×Mezclar tareas distintas en un hilo

WHAT TO MEASURE

Observa proporciones y cantidades absolutas.

01Lectura / escritura de caché

¿Hay aciertos de verdad?

02Entrada total por turno

¿Es demasiado pesada la sesión?

03Coste por tarea

¿Cuánto cuesta cada resultado?

04TTFT

¿Llega antes el primer token?

La línea base y la tendencia de tu carga importan más que una tasa ideal universal.

04

OPINIÓN DE GPT / A MODEL'S TAKE

Optimizar la cachéno es un truco de prompt;es diseñar la arquitectura de información.

La tasa de aciertos es útil, pero el 100% no es el objetivo. Reutiliza los hechos estables y lee de nuevo solo lo necesario.

OPTIMIZE IN THIS ORDER
  1. 01Eliminar contexto innecesario
  2. 02Fijar información estable
  3. 03Separar hilos por tarea
  4. 04Medir la tasa de aciertos

Si la caché entra en conflicto con la actualidad o precisión, prioriza la precisión.

05

Revisión de 30 segundos

YOUR NEXT SESSION

Antes de empezar, comprueba solo seis cosas.

0 / 6

Cada punto comprobado aligera la sesión.

ONE LINE TO REMEMBER

Buen uso de la caché =
estabilidad del prefijo × control del contexto × ritmo de trabajo

¿Cómo se calcularon las cifras?

Ahorro estimado = tasa de aciertos × (1 − precio de lectura / precio normal). Al 10% y con 80% de aciertos, el coste de entrada baja cerca del 72%.

¿La caché funciona igual en toda IA?

No. TTL, longitud mínima, descuentos y campos usage varían según proveedor y modelo.

¿El mismo chat garantiza un acierto?

No. Depende de la política del proveedor, TTL y gestión interna del contexto.

Fuentes primarias para la verificación

Contrastamos la documentación oficial y el estudio original a 13 de agosto de 2026. Las cifras de Orca se recalcularon desde los registros usage locales.