Building & Running AI intermediate

Prompt Caching

Reusing the processed form of a repeated prompt prefix so you do not pay full price for it again.

Quando muitas requisições compartilham um prefixo longo e estável — um system prompt, um documento, um conjunto de exemplos —, o cache permite que o provedor pule o reprocessamento. A economia é grande e praticamente de graça: coloque o conteúdo estável no começo e o conteúdo variável no fim.

Na prática: Um manual de 20,000 tokens colocado em cache uma vez e depois consultado mil vezes por um custo baixo.

Where this comes up