COSTE / COST
Lee la misma entrada por menos.
Ejemplo: una entrada con acierto cuesta el 10% de la normal
Incluso con el mismo modelo, el coste y la velocidad pueden variar mucho.
La clave está encongelar el inicio de cada solicitud.
Mantén intacto el inicio. Añade solo información nueva al final.
* Ejemplo de tarifas oficiales de GPT-5.6, Claude y Gemini · † Máximo en un estudio de arXiv con 500 sesiones; algunas estrategias no mejoraron o fueron más lentas
PRINCIPIO / THE MECHANISM
La caché de prompts y contexto no recuerda la respuesta. Durante el prefill, el proveedor reutiliza el cálculo del prefijo coincidente. Si sigue válido, solo lee la cola nueva.
Lee toda la entrada y genera el cálculo interno.
Evita volver a calcular el mismo prefijo.
Genera la respuesta token a token.
La caché reduce principalmente el prefill de entrada. El coste de salida y la velocidad de generación son independientes.
INTERACTIVE LAB 01
La parte reutilizable depende de dónde hagas el cambio.
Los tres primeros bloques se reutilizan sin cambios.
En una caché de prefijos típica, se reduce la parte reutilizable posterior al cambio.
IMPACTO / WHY IT MATTERS
Los requisitos y beneficios varían según proveedor y modelo. El 90% es una condición representativa del precio de entrada, no el ahorro de toda la solicitud.
COSTE / COST
Ejemplo: una entrada con acierto cuesta el 10% de la normal
VELOCIDAD / SPEED
El efecto depende de la longitud del prefijo y la infraestructura
CAPACIDAD / THROUGHPUT
Claude excluye en muchos modelos los tokens de caché del cálculo de ITPM
INTERACTIVE LAB 02
Este modelo fija la lectura de caché en el 10% de una entrada normal. Excluye escritura, almacenamiento (TTL) y salida.
Carga efectiva por turno, expresada en tokens a precio completo
Índice de coste de entrada28 / 100
Ahorro estimado72%
Incluso con más aciertos, un contexto demasiado grande supone unas 5,7 veces más carga.
Nuestros registros de uso de Orca
ORCA HQ · 2026.07.20—07.27 · LOCAL USAGE LOG
Analizamos 207 sesiones de HQ cuyas rutas pudimos verificar en los registros locales de Orca. Los tokens son la suma de los campos usage; no estimamos costes sin registros de facturación.
WHAT THE LOG SHOWS
De 2.201 mil M de tokens, 2.161 mil M fueron cache read, 38,82 M cache write y 799 mil entrada nueva.
Lectura de cachéMEDIDO
2.161 mil M98.20%Escritura de cachéMEDIDO
38,82 M1.76%Entrada nuevaMEDIDO
799 mil0.04%alta reutilización, pero contexto absoluto grande
THREE REAL RUNS
Las tres fueron pruebas de Orca con Claude Opus 5. Los totales están redondeados.
Observación: las lecturas fueron unas 460 veces mayores que las escrituras.
Observación: se reutilizó la mayoría de los tokens de entrada.
Observación: el trabajo extenso también mostró alta reutilización.
Las tres ejecuciones continuaron tareas con el mismo objetivo en una sola sesión y durante poco tiempo.
Nota: es una correlación fuerte, no una clasificación directa de la causa de cada escritura.PRÁCTICA / THE PLAYBOOK
Optimizar la caché depende de cómo inicias, continúas y ordenas una sesión.
Chatbot general / PRESCRIPTION
Organiza descripción y materiales al principio.
Continúa la misma tarea en el mismo hilo.
Indica solo los cambios de documentos largos.
CACHE & CONTEXT HABITS
WHAT TO MEASURE
¿Hay aciertos de verdad?
¿Es demasiado pesada la sesión?
¿Cuánto cuesta cada resultado?
¿Llega antes el primer token?
La línea base y la tendencia de tu carga importan más que una tasa ideal universal.
OPINIÓN DE GPT / A MODEL'S TAKE
Optimizar la cachéno es un truco de prompt;es diseñar la arquitectura de información.
La tasa de aciertos es útil, pero el 100% no es el objetivo. Reutiliza los hechos estables y lee de nuevo solo lo necesario.
Si la caché entra en conflicto con la actualidad o precisión, prioriza la precisión.
Revisión de 30 segundos
YOUR NEXT SESSION
Cada punto comprobado aligera la sesión.
ONE LINE TO REMEMBER
Ahorro estimado = tasa de aciertos × (1 − precio de lectura / precio normal). Al 10% y con 80% de aciertos, el coste de entrada baja cerca del 72%.
No. TTL, longitud mínima, descuentos y campos usage varían según proveedor y modelo.
No. Depende de la política del proveedor, TTL y gestión interna del contexto.
Contrastamos la documentación oficial y el estudio original a 13 de agosto de 2026. Las cifras de Orca se recalcularon desde los registros usage locales.