Der AI-Helper zeigt jetzt genau, wie viel deines Prompts in den Cache geht
Bis v3.2.70 schätzte die Kontextanzeige im AI-Helper den Token-Verbrauch nach der Regel „Zeichen / 4". Es funktionierte, lag aber je nach Modell und Sprache um 10–30% daneben. In v3.2.71–73 sind wir auf echte Zahlen aus der API umgestiegen — mit zusätzlicher Aufschlüsselung, wie viele Tokens im Cache landen (was ~10× weniger kostet als frischer Input).
Was Prompt-Cache ist
Alle drei großen LLM-APIs (Anthropic Claude, OpenAI GPT, Google Gemini) unterstützen das Caching langer Prompt-Präfixe. Wenn du immer wieder Anfragen mit demselben Anfang sendest (derselbe System-Prompt + DOM-Snapshot + Konversationsverlauf), bezahlst du beim zweiten und jedem weiteren Aufruf nicht erneut für diese Tokens — der Provider erkennt dasselbe Präfix und stellt dir nur den Cache-Hit-Preis in Rechnung (~10% des vollen Token-Preises).
Für den AI-Helper, der schrittweise über eine Konversation arbeitet — der System-Prompt ändert sich nicht, der DOM-Baum ändert sich selten, die Historie wächst linear — fängt der Cache typischerweise 70–95% des Prompts ab. Das ist der Unterschied zwischen einem Dollar und zehn Cent pro Runde.
Was du jetzt im AI-Helper siehst (v3.2.73)
Unter dem Chat-Fenster, in der Statistikleiste, gibt es drei separate Token-Indikatoren:
- Frischer Input — die Tokens dieser Runde, die die API von Grund auf verarbeiten musste (deine neue Nachricht + neuer DOM).
- Gecacht — die Tokens, die als Präfix der vorherigen Runde erkannt wurden — sie kosten einen Bruchteil des normalen Preises.
- Output — was das Modell generiert hat (immer voller Preis, nie gecacht).
Die Summe von input + cached ist die gesamte Länge deines Prompts für diese Runde — das Äquivalent des alten einzelnen „Input". Disjunkt — keine Doppelzählung.
Woher die Zahlen kommen
Die Provider liefern den Verbrauch in Feldern der API-Antwort. Jeder hat seine eigene Benennung:
- Anthropic (Claude) —
usage.input_tokens,usage.cache_creation_input_tokens,usage.cache_read_input_tokens,usage.output_tokens. - OpenAI (GPT-4o, o1) —
usage.prompt_tokens,usage.prompt_tokens_details.cached_tokens,usage.completion_tokens. - Google (Gemini) —
usageMetadata.promptTokenCount,usageMetadata.cachedContentTokenCount,usageMetadata.candidatesTokenCount.
Der AI-Helper liest die Antwort jedes Providers und normalisiert sie in ein einheitliches Format (input / cached / output). Die Anzeige aktualisiert sich direkt nach dem Ende der Runde — keine zusätzlichen Aufrufe, keine Schätzung.
Was es dir in der Praxis bringt
Drei konkrete Dinge, die du vor v3.2.73 nicht wusstest:
- Echte Kosten pro Runde — du hast die genauen Zahlen, die du mit dem Tarif deines Providers multiplizieren kannst. Keine Online-Rechner, kein Raten. Was abgerechnet wird = was angezeigt wird.
- Cache-Trefferquote — wenn du eine neue Konversation startest, ist cached = 0 (der Cache wird gerade aufgebaut). In den folgenden Runden siehst du, wie sie steigt. Ein Cache-Hit von 90%+ bedeutet, dass die Konversation effizient läuft; 30% bedeutet, dass du noch viel neuen Kontext einwirfst.
- „Weitermachen oder neu starten" — wenn du siehst, dass cached anfängt zu sinken (z.B. der DOM-Baum hat sich geändert und das Präfix passt nicht mehr), weißt du, dass es einfacher ist, die Konversation mit neuem Kontext neu zu starten, als weitere Runden draufzuwerfen.
Warum das wichtig ist
LLM-APIs sind billiger als vor einem Jahr, aber bei intensiver Nutzung summieren sich die Cent immer noch. Wir nutzen den AI-Helper, um komplexe CSS/JS-Regeln über Dutzende Domains zu bauen — jede Runde sind 5–20 Tausend Tokens. Ohne Cache sind das Dollar pro Monat; mit 90% Cache-Hit zehn Cent. Das Anzeigen echter Zahlen hilft, den Workflow entsprechend zu gestalten.
Provider-Hinweise
Cache ist providerspezifisch — unterschiedliche TTL, unterschiedliche Mindestpräfix-Größe, unterschiedliche Preise. Zur Orientierung:
- Anthropic Claude — Cache-TTL 5 Minuten, mindestens 1024 Tokens im Präfix, Cache-Write = 1.25× Input-Preis, Cache-Read = 0.1× Input-Preis.
- OpenAI GPT-4o / o1 — automatischer Cache ab 1024 Tokens, keine separate Write-Gebühr, Cache-Read = 0.5× Input-Preis.
- Google Gemini 1.5 — explizite Context-Caching-API, der Nutzer wählt, was gecacht wird, Write- + Speichergebühr, Read günstiger als frischer Input.
Werte aktuell zum Zeitpunkt des Schreibens (Mai 2026) — prüfe Live-Tarife bei deinem Provider.
Siehe auch
- Fenster auf der Seite — der AI-Helper als eines der Entwicklerfenster
- AI-Helper in einem Shadow DOM — ein jüngster Schritt in der Stil-Isolation des Fensters
- Interaktives Onboarding-Tutorial — von null zu einer funktionierenden Regel mit dem AI-Helper
JustZix installieren — und nutze echte Zahlen statt Schätzungen.
Bewerte diesen Beitrag
Noch keine Bewertungen — sei der Erste.