AI Helper pokazuje teraz dokładnie, ile z Twojego promptu trafia w cache
Do v3.2.70 wskaźnik kontekstu w AI Helperze szacował zużycie tokenów regułą „liczba znaków / 4". Działało, ale rozjeżdżało się o 10–30% w zależności od modelu i języka. W v3.2.71–73 przełączyliśmy się na realne liczby z API — z dodatkowym rozbiciem na to, ile tokenów trafia w cache (czyli kosztuje ~10× mniej niż świeży input).
Co to jest prompt cache
Wszystkie trzy duże API LLM-ów (Anthropic Claude, OpenAI GPT, Google Gemini) wspierają mechanizm cache-owania długich prefiksów promptu. Jeśli wysyłasz wielokrotnie zapytanie z tym samym początkiem (np. ten sam system prompt + zrzut DOM-u strony + historia rozmowy), drugie i kolejne wywołania nie liczą tych tokenów ponownie — dostawca rozpoznaje, że to ten sam prefix i obciąża Cię tylko cache-hit price (~10% pełnej ceny tokenu).
Dla AI Helper-a, który prowadzi rozmowę krok po kroku — system prompt nie zmienia się, drzewo DOM-u zmienia się rzadko, historia rośnie liniowo — cache trafia zwykle w 70–95% promptu. To różnica między dolarem a dziesięcioma centami za rundę.
Co widzisz teraz w AI Helperze (v3.2.73)
Pod oknem chatu, w pasku statystyk, są trzy oddzielne wskaźniki tokenów:
- Input świeży — tokeny tej tury, które API musiało przetworzyć od zera (twoja nowa wiadomość + ewentualny nowy DOM).
- Cached — tokeny rozpoznane jako prefix poprzedniej tury — kosztują ułamek normalnej ceny.
- Output — to, co model wygenerował (zawsze pełny koszt, nie cache-uje się).
Suma input + cached to całkowita długość Twojego promptu w tej turze — równowartość starego pojedynczego „input". Rozłączny — żadnego double-countingu.
Skąd biorą się te liczby
Dostawcy zwracają usage w polach odpowiedzi API. Każdy ma własne nazewnictwo:
- Anthropic (Claude) —
usage.input_tokens,usage.cache_creation_input_tokens,usage.cache_read_input_tokens,usage.output_tokens. - OpenAI (GPT-4o, o1) —
usage.prompt_tokens,usage.prompt_tokens_details.cached_tokens,usage.completion_tokens. - Google (Gemini) —
usageMetadata.promptTokenCount,usageMetadata.cachedContentTokenCount,usageMetadata.candidatesTokenCount.
AI Helper czyta odpowiedź z każdego dostawcy i sprowadza do jednolitego formatu (input/cached/output). Wskaźnik pojawia się natychmiast po zakończeniu tury — bez żadnych dodatkowych zapytań ani szacowań.
Co Ci to daje w praktyce
Trzy konkretne rzeczy, których przed v3.2.73 nie wiedziałeś:
- Realny koszt rundy — masz dokładne liczby do pomnożenia przez stawkę swojego dostawcy. Bez kalkulatorów online, bez szacunków. Wpisany koszt = wpisany.
- Cache hit ratio — gdy zaczynasz nową rozmowę, cached = 0 (cache się buduje). W kolejnych turach widzisz, jak rośnie. Cache hit 90%+ to znak, że rozmowa idzie efektywnie; 30% to znak, że wciąż dorzucasz duże fragmenty kontekstu.
- Decyzja „kontynuuj czy zacznij od zera" — gdy widzisz, że cached zaczyna spadać (bo np. drzewo DOM-u zmieniło się i prefix przestał pasować), wiesz, że łatwiej jest zrestartować rozmowę z nowym kontekstem niż dorzucać kolejne tury.
Dlaczego to ma znaczenie
API LLM-ów są tańsze niż były rok temu, ale wciąż liczą się grosze przy intensywnym użyciu. AI Helper w JustZix-ie używamy do tworzenia złożonych reguł CSS/JS na dziesiątkach domen — każda runda 5–20 tysięcy tokenów. Bez cache to dolarów miesięcznie; z 90% cache hit to dziesiątki centów. Wskaźnik realnych liczb pomaga zoptymalizować workflow w tę stronę.
Wpływ na trzy dostawców
Cache jest specyficzny dla dostawcy — różne TTL, różne minima rozmiaru prefix-u, różne ceny. Dla orientacji:
- Anthropic Claude — cache TTL 5 minut, minimum 1024 tokeny w prefixie, cache write = 1.25× input price, cache read = 0.1× input price.
- OpenAI GPT-4o / o1 — automatyczny cache od 1024 tokenów, brak osobnej opłaty za write, cache read = 0.5× input price.
- Google Gemini 1.5 — explicit context caching API, użytkownik wybiera, co cache-ować, write + storage fee, read taniej niż świeży input.
Wartości dostępne w czasie pisania (maj 2026) — sprawdzaj aktualne stawki u dostawcy.
Zobacz też
- Okna na froncie — AI Helper jako jedno z okien deweloperskich
- AI Helper w shadow DOM — niedawny krok w stylistycznej izolacji okna
- Interaktywny samouczek — od zera do działającej reguły z AI Helperem
Zainstaluj JustZix — i miej realne liczby zamiast szacunków.
Oceń ten wpis
Brak ocen — oceń jako pierwszy.