L'AI Helper affiche désormais exactement quelle part de votre prompt va dans le cache
Jusqu'à la v3.2.70, l'indicateur de contexte de l'AI Helper estimait la consommation de tokens selon la règle « caractères / 4 ». Cela fonctionnait, mais l'écart était de 10–30 % selon le modèle et la langue. En v3.2.71–73, nous sommes passés aux chiffres réels de l'API — avec en plus une ventilation indiquant combien de tokens atterrissent dans le cache (ce qui coûte environ 10× moins cher que l'input frais).
Qu'est-ce que le cache de prompt
Les trois grandes API LLM (Anthropic Claude, OpenAI GPT, Google Gemini) prennent en charge la mise en cache de longs préfixes de prompt. Si vous envoyez à répétition des requêtes ayant le même début (même prompt système + snapshot DOM + historique de la conversation), vous ne payez plus ces tokens lors du deuxième appel et des suivants — le fournisseur reconnaît le même préfixe et ne vous facture que le tarif cache-hit (environ 10 % du prix plein du token).
Pour l'AI Helper, qui travaille pas à pas au sein d'une conversation — le prompt système ne change pas, l'arbre DOM change rarement, l'historique grandit linéairement — le cache capte typiquement 70–95 % du prompt. C'est la différence entre un dollar et dix cents par tour.
Ce que vous voyez désormais dans l'AI Helper (v3.2.73)
Sous la fenêtre de chat, dans la barre de statistiques, il y a trois indicateurs de tokens distincts :
- Input frais — les tokens de ce tour que l'API a dû traiter depuis zéro (votre nouveau message + tout nouveau DOM).
- Caché — les tokens reconnus comme préfixe du tour précédent — ils coûtent une fraction du prix normal.
- Output — ce que le modèle a généré (toujours plein tarif, jamais caché).
La somme input + cached représente la longueur totale de votre prompt pour ce tour — l'équivalent de l'ancien « input » unique. Disjoints — aucun double comptage.
D'où viennent les chiffres
Les fournisseurs renvoient l'usage dans des champs de la réponse de l'API. Chacun a sa propre nomenclature :
- Anthropic (Claude) —
usage.input_tokens,usage.cache_creation_input_tokens,usage.cache_read_input_tokens,usage.output_tokens. - OpenAI (GPT-4o, o1) —
usage.prompt_tokens,usage.prompt_tokens_details.cached_tokens,usage.completion_tokens. - Google (Gemini) —
usageMetadata.promptTokenCount,usageMetadata.cachedContentTokenCount,usageMetadata.candidatesTokenCount.
L'AI Helper lit la réponse de chaque fournisseur et la normalise dans un format uniforme (input / cached / output). L'indicateur se met à jour immédiatement après la fin du tour — aucun appel supplémentaire, aucune estimation.
Ce que cela vous apporte en pratique
Trois choses concrètes que vous ne saviez pas avant la v3.2.73 :
- Coût réel par tour — vous avez les chiffres exacts à multiplier par le tarif de votre fournisseur. Pas de calculatrice en ligne, pas de devinettes. Ce qui est facturé = ce qui est affiché.
- Taux de cache-hit — quand vous lancez une nouvelle conversation, cached = 0 (le cache est en cours de construction). Aux tours suivants, vous le voyez monter. Un cache-hit de 90 %+ signifie que la conversation tourne efficacement ; 30 % signifie que vous injectez encore beaucoup de contexte nouveau.
- « Continuer ou repartir de zéro » — quand vous voyez que cached commence à chuter (p. ex. l'arbre DOM a changé et le préfixe ne correspond plus), vous savez qu'il est plus simple de relancer la conversation avec un nouveau contexte que de multiplier les tours.
Pourquoi c'est important
Les API LLM sont moins chères qu'il y a un an, mais en usage intensif, les centimes s'additionnent. Nous utilisons l'AI Helper pour construire des règles CSS/JS complexes sur des dizaines de domaines — chaque tour fait 5–20 milliers de tokens. Sans cache, cela représente des dollars par mois ; avec 90 % de cache-hit, des dizaines de centimes. Afficher les chiffres réels aide à façonner le workflow dans ce sens.
Notes par fournisseur
Le cache est spécifique au fournisseur — TTL différent, taille minimale de préfixe différente, prix différents. Pour s'orienter :
- Anthropic Claude — TTL cache 5 minutes, minimum 1024 tokens dans le préfixe, écriture cache = 1.25× le prix input, lecture cache = 0.1× le prix input.
- OpenAI GPT-4o / o1 — cache automatique à partir de 1024 tokens, pas de frais d'écriture séparés, lecture cache = 0.5× le prix input.
- Google Gemini 1.5 — API explicite de context caching, l'utilisateur choisit ce qui est mis en cache, frais d'écriture + stockage, lecture moins chère que l'input frais.
Valeurs valables au moment de la rédaction (mai 2026) — vérifiez les tarifs en direct auprès de votre fournisseur.
Voir aussi
- Fenêtres sur la page — l'AI Helper comme l'une des fenêtres développeur
- L'AI Helper dans un shadow DOM — une étape récente dans l'isolation de style de la fenêtre
- Tutoriel d'onboarding interactif — de zéro à une règle fonctionnelle avec l'AI Helper
Installez JustZix — et utilisez des chiffres réels plutôt que des estimations.
Notez cet article
Aucune note — soyez le premier.