← Artículos

Mi caché de Claude Code duraba cinco minutos

· 6 min de lectura

La caché de Claude Code dura una hora solo en la conversación principal y solo mientras estés dentro del uso incluido de tu plan. En cuanto pasas del límite y empiezas a consumir créditos de uso, esa conversación baja a cinco minutos. Todo lo demás, subagentes incluidos, está en cinco minutos por defecto. Desde la versión 2.1.242 puedes elegirlo tú.

Llevo meses trabajando con Claude Code todos los días y creía que la caché me duraba una hora. Pagaba suscripción, había leído que la suscripción venía con la caché larga, y con eso me quedé. Ayer, revisando la documentación de otra cosa, me encontré con una tabla que dice justo lo contrario para el caso en el que yo estaba la mitad del mes. Esta es la autopsia: qué creía, qué dice la documentación, y qué cambié.

Lo que yo creía que había comprado

La caché de prompts no es memoria. Claude no "recuerda" nada entre mensajes: en cada turno se reenvía el contexto entero (instrucciones del sistema, tu CLAUDE.md, los archivos que abriste, las respuestas anteriores) y el servidor cobra mucho más barato la parte que ya había procesado. Mientras la caché siga viva, tu mensaje nuevo es lo único que se procesa de cero. Esa caché caduca por inactividad. Cada petición que le pega reinicia el reloj. Y ahí está el detalle que a mí se me pasó: hay dos relojes posibles, cinco minutos y una hora, y por defecto no lo eliges tú.

Este sistema es el que enseño dentro de la comunidad MÁQUINA IA: las estaciones, los gates y el código que lo sostiene.

La tabla que lo dice todo

La documentación de Claude Code parte todas tus peticiones en dos cubos. El de la conversación principal (tus turnos interactivos, las corridas con la bandera de impresión y los turnos del Agent SDK) y el de todo lo demás: subagentes, workflows, forks, compactaciones, títulos de sesión. Con suscripción y dentro del uso incluido de tu plan, la conversación principal va a una hora. En cuanto pasas del límite del plan y Claude Code empieza a tirar de créditos de uso, esa misma conversación baja al TTL barato de cinco minutos. Y la fila de abajo, "todo lo demás", son cinco minutos en las dos columnas, salvo unas peticiones auxiliares que controla Anthropic en el servidor. Traducido a mi día: la mitad del mes yo estaba en una hora y la otra mitad en cinco minutos, sin que nada en la pantalla cambiara. La misma sesión, el mismo repositorio, el mismo trabajo. Lo único distinto era de dónde salía el dinero. Lo mismo aparece contado con otras palabras en la página de costos: el primer mensaje después de una pausa más larga que la caché falla y reprocesa tu contexto completo. Dos páginas oficiales distintas diciendo lo mismo es lo que separa un dato de un rumor.

Y los subagentes están peor

Yo corro mesas de agentes casi a diario: un verificador, un crítico, un auditor. Todos esos caen en el cubo de "todo lo demás", así que están en cinco minutos aunque estés dentro del plan y pagando puntual. Son justo los procesos que arrancan, piensan un rato largo y vuelven, o sea, los que más fácil se pasan de cinco minutos. Ese fue el dato que me cambió la cara. No es un caso raro de fin de mes: es mi arquitectura de trabajo entera.

Por qué no es un truco sucio

Aquí es donde me toca ser justo, porque lo fácil sería escribir que te lo bajan a escondidas. No. Está documentado, con tabla y con la explicación. Y la razón es económica en las dos direcciones: la caché de una hora mantiene el contexto caliente durante pausas largas, pero cobra más cara cada escritura de caché. Si trabajas a ráfagas y nunca te separas más de cinco minutos, la hora te sale peor: pagas el recargo de escritura y no usas la vida extra. El valor por defecto protege a ese perfil. Lo que sí me parece raro es que la decisión sea tuya desde hace unos días y que casi nadie lo sepa.

Qué cambié en mi máquina

Desde la versión 2.1.242 de Claude Code existen dos ajustes: uno para la conversación principal y otro para el resto. Cada uno acepta exactamente dos valores, cinco minutos o una hora, y cualquier otra cosa la ignora en silencio. Yo puse la hora solo en la conversación principal, que es la que dejo abierta cuando me levanto de la silla, y dejé el otro cubo en el valor por defecto. Mis subagentes arrancan y terminan seguidos dentro de una corrida: ahí el recargo de escritura no me compra nada. No voy a cantar un porcentaje de ahorro porque todavía no tengo la medición de un mes contra otro. Cuando la tenga, la publico.

Qué puede salir mal

Confundir la caché con el límite de sesión. Son dos relojes distintos: el de la caché decide cuánto te cuesta volver después de una pausa, el límite decide cuándo te quedas sin turno. Cambiar uno no toca el otro. Escribir un valor que no sea cinco minutos ni una hora. No falla, no avisa: lo ignora, y tú te quedas creyendo que lo configuraste. Ponerlo en una versión vieja. Los dos ajustes y sus dos variables de entorno piden 2.1.242 o superior. Y ponerlo en todas partes por si acaso. Si tu forma de trabajar es una ráfaga de veinte minutos y cerrar, la hora te va a costar más. La documentación lo dice sin adornos.

Preguntas frecuentes

¿Cuánto dura de verdad la caché de Claude Code?
Depende de dos cosas: en qué cubo cae la petición y cómo se está facturando. Con suscripción y dentro del uso incluido del plan, la conversación principal tiene una hora. Con créditos de uso, clave de API o proveedor de nube, esa misma conversación tiene cinco minutos. Todo lo que va fuera de la conversación principal tiene cinco minutos por defecto en los dos casos.
¿Por qué mis subagentes tienen cinco minutos si pago suscripción?
Porque los subagentes no viven en el cubo de la conversación principal. La documentación mete ahí también los workflows, los forks, la compactación y los títulos de sesión, y a todo ese grupo le asigna cinco minutos por defecto aunque estés dentro de tu plan. Solo cambia si eliges tú el TTL de ese cubo con el ajuste correspondiente.
¿Poner la caché en una hora siempre sale más barato?
No, y la propia documentación lo advierte. El TTL de una hora mantiene la caché caliente durante pausas largas, pero cobra más cara cada escritura de caché. Si trabajas en ráfagas cortas y nunca dejas la sesión quieta más de cinco minutos, pagas el recargo de escritura y no aprovechas la vida extra, así que te sale peor.
¿Esto arregla el límite de uso de mi plan?
No, y es la confusión más común. El TTL de caché decide cuánto te cuesta el primer mensaje después de una pausa, porque si la caché expiró se reprocesa tu contexto completo. El límite de uso decide cuándo te quedas sin turnos. Son dos relojes independientes y tocar uno no mueve el otro.

Fuentes