¿Qué es Benchmark?
Una prueba estandarizada para medir y comparar el rendimiento de diferentes modelos de IA.
// Explicación
Como los rankings universitarios, los benchmarks son pruebas que permiten comparar modelos de forma objetiva (o al menos intentarlo). MMLU, HumanEval, SWE-bench, GPQA son algunos de los más usados. Cada empresa presenta sus modelos con sus mejores scores, lo que a veces hace difícil comparar manzanas con manzanas.
// Ejemplo
Cuando OpenAI dice que GPT-5 supera a Claude en MMLU, está usando un benchmark. Es como comparar estudiantes con el mismo examen — útil, pero no lo dice todo.