← Tutti gli articoli

Tutorial

L'AI Helper ora mostra esattamente quanta parte del tuo prompt finisce in cache

Fino alla v3.2.70 l\'indicatore di contesto nell\'AI Helper stimava il consumo di token con la regola "caratteri / 4". Funzionava, ma sbagliava del 10–30% a seconda del modello e della lingua. Nella v3.2.71–73 siamo passati ai numeri reali dall\'API — con in più la suddivisione di quanti token finiscono in cache (che costa circa 10× meno dell\'input fresco).

Cos\'è la cache del prompt

Tutte e tre le grandi API LLM (Anthropic Claude, OpenAI GPT, Google Gemini) supportano il caching di lunghi prefissi di prompt. Se continui a inviare richieste con lo stesso inizio (stesso system prompt + snapshot del DOM + cronologia della conversazione), dalla seconda chiamata in poi non paghi più quei token — il provider riconosce lo stesso prefisso e ti addebita solo il prezzo cache-hit (circa il 10% del prezzo pieno dei token).

Per l\'AI Helper, che lavora passo dopo passo dentro una conversazione — il system prompt non cambia, l\'albero del DOM cambia raramente, la cronologia cresce in modo lineare — la cache cattura tipicamente il 70–95% del prompt. È la differenza tra un dollaro e dieci centesimi per giro.

Cosa vedi ora nell\'AI Helper (v3.2.73)

Sotto la finestra della chat, nella barra delle statistiche, ci sono tre indicatori di token separati:

La somma di input + cached è la lunghezza totale del tuo prompt per questo turno — l\'equivalente del vecchio "input" unico. Disgiunti — nessun doppio conteggio.

Da dove vengono i numeri

I provider restituiscono l\'usage in campi della risposta API. Ognuno ha la propria denominazione:

L\'AI Helper legge la risposta di ciascun provider e la normalizza in un formato uniforme (input / cached / output). L\'indicatore si aggiorna subito dopo la fine del turno — nessuna chiamata extra, nessuna stima.

Cosa ti dà in pratica

Tre cose concrete che non sapevi prima della v3.2.73:

Perché è importante

Le API LLM sono più economiche di un anno fa, ma con un uso intenso i centesimi si sommano. Usiamo l\'AI Helper per costruire regole CSS/JS complesse su decine di domini — ogni giro fa 5–20 mila token. Senza cache sono dollari al mese; con il 90% di cache-hit, decine di centesimi. Mostrare numeri reali aiuta a modellare il workflow in quella direzione.

Note per provider

La cache è specifica per provider — TTL diverso, dimensione minima del prefisso diversa, prezzi diversi. Per orientarti:

Valori validi al momento della scrittura (maggio 2026) — controlla le tariffe in tempo reale con il tuo provider.

Vedi anche

Installa JustZix — e usa numeri reali invece di stime.

Valuta questo articolo

Nessuna valutazione — sii il primo.

Provalo tu stesso

Installa JustZix e incolla qualsiasi snippet di questo articolo. Due minuti da zero a una regola funzionante su tutti i tuoi dispositivi.

Ottieni JustZix

Funzionalità · Come funziona · Esempi · Casi d'uso