Building & Running AI intermediate

Prompt Caching

Reusing the processed form of a repeated prompt prefix so you do not pay full price for it again.

Quand de nombreuses requêtes partagent un long préfixe stable — un prompt système, un document, une série d’exemples —, le cache permet au fournisseur d’éviter de le recalculer. L’économie est importante et quasiment gratuite : placez le contenu stable en premier et le contenu variable en dernier.

En pratique : Un manuel de 20 000 tokens mis en cache une fois, puis interrogé mille fois à faible coût.

Where this comes up