El AI Helper ahora muestra exactamente cuánto de tu prompt va a la caché
Hasta la v3.2.70 el indicador de contexto en el AI Helper estimaba el consumo de tokens con la regla "caracteres / 4". Funcionaba, pero se desviaba un 10–30% según el modelo y el idioma. En la v3.2.71–73 hemos pasado a cifras reales desde la API — con un desglose adicional de cuántos tokens caen en la caché (que cuesta unas 10× menos que el input fresco).
Qué es la caché de prompt
Las tres grandes APIs de LLM (Anthropic Claude, OpenAI GPT, Google Gemini) admiten cachear prefijos largos del prompt. Si sigues enviando peticiones con el mismo principio (el mismo system prompt + snapshot del DOM + historial de la conversación), a partir de la segunda llamada ya no pagas por esos tokens — el proveedor reconoce el mismo prefijo y solo te cobra el precio de cache-hit (~10% del precio normal del token).
Para el AI Helper, que trabaja paso a paso dentro de una conversación — el system prompt no cambia, el árbol del DOM cambia poco, el historial crece linealmente — la caché captura típicamente el 70–95% del prompt. Esa es la diferencia entre un dólar y diez centavos por ronda.
Lo que ves ahora en el AI Helper (v3.2.73)
Debajo de la ventana del chat, en la barra de estadísticas, hay tres indicadores de tokens separados:
- Input fresco — los tokens de este turno que la API tuvo que procesar desde cero (tu nuevo mensaje + cualquier DOM nuevo).
- En caché — los tokens reconocidos como prefijo del turno anterior — cuestan una fracción del precio normal.
- Output — lo que el modelo generó (siempre precio completo, nunca cacheado).
La suma de input + cached es la longitud total de tu prompt en este turno — el equivalente del antiguo "input" único. Disjuntos — sin doble conteo.
De dónde salen los números
Los proveedores devuelven el uso en campos de la respuesta de la API. Cada uno tiene su propia nomenclatura:
- Anthropic (Claude) —
usage.input_tokens,usage.cache_creation_input_tokens,usage.cache_read_input_tokens,usage.output_tokens. - OpenAI (GPT-4o, o1) —
usage.prompt_tokens,usage.prompt_tokens_details.cached_tokens,usage.completion_tokens. - Google (Gemini) —
usageMetadata.promptTokenCount,usageMetadata.cachedContentTokenCount,usageMetadata.candidatesTokenCount.
El AI Helper lee la respuesta de cada proveedor y la normaliza a un formato uniforme (input / cached / output). El indicador se actualiza justo después de terminar el turno — sin llamadas extra, sin estimaciones.
Qué te da en la práctica
Tres cosas concretas que no sabías antes de la v3.2.73:
- Coste real por ronda — tienes las cifras exactas para multiplicar por la tarifa de tu proveedor. Sin calculadoras online, sin adivinanzas. Lo que se factura = lo que se muestra.
- Ratio de cache-hit — cuando empiezas una nueva conversación, cached = 0 (la caché se está construyendo). En los turnos siguientes lo ves subir. Un cache-hit del 90%+ significa que la conversación va eficiente; un 30% significa que aún estás metiendo mucho contexto nuevo.
- "Seguir o empezar de cero" — cuando ves que cached empieza a bajar (p. ej. el árbol del DOM cambió y el prefijo ya no coincide), sabes que es más fácil reiniciar la conversación con contexto nuevo que añadir más turnos.
Por qué importa
Las APIs de LLM son más baratas que hace un año, pero con uso intensivo los centavos siguen sumando. Usamos el AI Helper para construir reglas CSS/JS complejas en docenas de dominios — cada ronda son 5–20 mil tokens. Sin caché, son dólares al mes; con un 90% de cache-hit, decenas de centavos. Mostrar números reales ayuda a moldear el workflow en esa dirección.
Notas por proveedor
La caché es específica de cada proveedor — TTL distinto, tamaño mínimo de prefijo distinto, precios distintos. Para orientarte:
- Anthropic Claude — TTL de caché 5 minutos, mínimo 1024 tokens en el prefijo, escritura en caché = 1.25× el precio de input, lectura de caché = 0.1× el precio de input.
- OpenAI GPT-4o / o1 — caché automática a partir de 1024 tokens, sin tarifa de escritura separada, lectura de caché = 0.5× el precio de input.
- Google Gemini 1.5 — API explícita de context caching, el usuario elige qué cachear, tarifa de escritura + almacenamiento, lectura más barata que el input fresco.
Valores vigentes al momento de escribir (mayo de 2026) — comprueba tarifas actualizadas con tu proveedor.
Ver también
- Ventanas en la página — el AI Helper como una de las ventanas de desarrollador
- El AI Helper en un shadow DOM — un paso reciente en el aislamiento de estilos de la ventana
- Tutorial interactivo de onboarding — de cero a una regla funcionando con el AI Helper
Instala JustZix — y usa números reales en lugar de estimaciones.
Valora este artículo
Sin valoraciones — sé el primero.