Benchmark
A standard test set used to compare models — useful for direction, unreliable as a guarantee.
Los benchmarks hacen que los modelos sean comparables sobre el papel. Sus debilidades son estructurales: con el tiempo se filtran a los datos de entrenamiento, se optimiza para ellos como si fueran la meta y rara vez se parecen a tu carga de trabajo. Léelos como una señal gruesa y después corre tus propias evals.
En la práctica: Un modelo que encabeza un benchmark de programación y aun así falla en tu base de código.