Building & Running AI intermediate

Prompt Caching

Reusing the processed form of a repeated prompt prefix so you do not pay full price for it again.

Quando molte richieste condividono un prefisso lungo e stabile — un system prompt, un documento, una serie di esempi — la cache permette al provider di non ricalcolarlo. Il risparmio è ampio e quasi gratuito: metti il contenuto stabile all’inizio e quello variabile alla fine.

In pratica: Un manuale da 20,000 token messo in cache una volta, poi interrogato mille volte a costo ridotto.

Where this comes up