cual.ai/Glosario/Benchmark

¿Qué es Benchmark?

Una prueba estandarizada para medir y comparar el rendimiento de diferentes modelos de IA.

// Explicación

Como los rankings universitarios, los benchmarks son pruebas que permiten comparar modelos de forma objetiva (o al menos intentarlo). MMLU, HumanEval, SWE-bench, GPQA son algunos de los más usados. Cada empresa presenta sus modelos con sus mejores scores, lo que a veces hace difícil comparar manzanas con manzanas.

// Ejemplo

Cuando OpenAI dice que GPT-5 supera a Claude en MMLU, está usando un benchmark. Es como comparar estudiantes con el mismo examen — útil, pero no lo dice todo.

← Ver los 42 términos del glosario