Building & Running AI intermediate

Prompt Caching

Reusing the processed form of a repeated prompt prefix so you do not pay full price for it again.

Cuando muchas solicitudes comparten un prefijo largo y estable — un prompt del sistema, un documento, un conjunto de ejemplos —, la caché le permite al proveedor evitar recalcularlo. El ahorro es grande y casi gratis: pon el contenido estable primero y el contenido variable al final.

En la práctica: Un manual de 20,000 tokens que se cachea una vez y luego se consulta mil veces a bajo costo.

Where this comes up