← Tous les articles

Tutoriels

L'AI Helper affiche désormais exactement quelle part de votre prompt va dans le cache

Jusqu'à la v3.2.70, l'indicateur de contexte de l'AI Helper estimait la consommation de tokens selon la règle « caractères / 4 ». Cela fonctionnait, mais l'écart était de 10–30 % selon le modèle et la langue. En v3.2.71–73, nous sommes passés aux chiffres réels de l'API — avec en plus une ventilation indiquant combien de tokens atterrissent dans le cache (ce qui coûte environ 10× moins cher que l'input frais).

Qu'est-ce que le cache de prompt

Les trois grandes API LLM (Anthropic Claude, OpenAI GPT, Google Gemini) prennent en charge la mise en cache de longs préfixes de prompt. Si vous envoyez à répétition des requêtes ayant le même début (même prompt système + snapshot DOM + historique de la conversation), vous ne payez plus ces tokens lors du deuxième appel et des suivants — le fournisseur reconnaît le même préfixe et ne vous facture que le tarif cache-hit (environ 10 % du prix plein du token).

Pour l'AI Helper, qui travaille pas à pas au sein d'une conversation — le prompt système ne change pas, l'arbre DOM change rarement, l'historique grandit linéairement — le cache capte typiquement 70–95 % du prompt. C'est la différence entre un dollar et dix cents par tour.

Ce que vous voyez désormais dans l'AI Helper (v3.2.73)

Sous la fenêtre de chat, dans la barre de statistiques, il y a trois indicateurs de tokens distincts :

La somme input + cached représente la longueur totale de votre prompt pour ce tour — l'équivalent de l'ancien « input » unique. Disjoints — aucun double comptage.

D'où viennent les chiffres

Les fournisseurs renvoient l'usage dans des champs de la réponse de l'API. Chacun a sa propre nomenclature :

L'AI Helper lit la réponse de chaque fournisseur et la normalise dans un format uniforme (input / cached / output). L'indicateur se met à jour immédiatement après la fin du tour — aucun appel supplémentaire, aucune estimation.

Ce que cela vous apporte en pratique

Trois choses concrètes que vous ne saviez pas avant la v3.2.73 :

Pourquoi c'est important

Les API LLM sont moins chères qu'il y a un an, mais en usage intensif, les centimes s'additionnent. Nous utilisons l'AI Helper pour construire des règles CSS/JS complexes sur des dizaines de domaines — chaque tour fait 5–20 milliers de tokens. Sans cache, cela représente des dollars par mois ; avec 90 % de cache-hit, des dizaines de centimes. Afficher les chiffres réels aide à façonner le workflow dans ce sens.

Notes par fournisseur

Le cache est spécifique au fournisseur — TTL différent, taille minimale de préfixe différente, prix différents. Pour s'orienter :

Valeurs valables au moment de la rédaction (mai 2026) — vérifiez les tarifs en direct auprès de votre fournisseur.

Voir aussi

Installez JustZix — et utilisez des chiffres réels plutôt que des estimations.

Notez cet article

Aucune note — soyez le premier.

Essayez vous-même

Installez JustZix et collez n'importe quel snippet de cet article. Deux minutes de zéro à une règle fonctionnelle sur tous vos appareils.

Obtenir JustZix

Fonctionnalités · Comment ça marche · Exemples · Cas d'usage