← Todos los postsBlog · 7 de septiembre de 2025

¿Qué es un benchmark? (y por qué no debes creértelo todo)

MMLU, HumanEval, GPQA... Los benchmarks son el carnet de notas de los modelos de IA. Te explicamos qué miden, cómo y cuándo te engañan.

Cada vez que sale un modelo nuevo, la marca presume con números: “89.4% en MMLU”, “SOTA en GPQA”, “Elo de 1400 en LMArena”. ¿Qué significan? ¿Te sirven para decidir qué modelo usar? Vamos a destriparlo.

La idea básica

Un benchmark es un examen estandarizado para modelos de IA. Igual que la selectividad tiene unas preguntas fijas y una nota comparable, los benchmarks hacen lo mismo con los modelos: les pasan un conjunto fijo de preguntas y cuentan cuántas acierta.

¿Para qué sirve? Para tres cosas:

  1. Comparar modelos entre sí con la misma vara de medir.
  2. Medir el progreso del campo: ¿el modelo nuevo de verdad es mejor, o solo parece?
  3. Detectar puntos débiles: le va bien en código pero fatal en razonamiento largo.

Los benchmarks que verás siempre (chuleta rápida)

Benchmark Qué mide Analogía
MMLU / MMLU-Pro Conocimiento general en 57 materias El examen de oposiciones de todo
GPQA Preguntas nivel doctorado, las llama “Google-Proof” El examen que ni con Google apruebas
HumanEval / SWE-bench Programar: funciones y bugs reales La prueba técnica de una entrevista
MATH / AIME Matemáticas La olimpiada matemática
IFEval Seguir instrucciones al pie de la letra Si pides “solo 3 frases”, obedece
LMArena Duelos a ciegas votados por humanos El Tinder de los LLMs
LongBench / RULER Contexto largo: recordar documentos enormes Memoria de elefante

Cómo se miden (por detrás)

Depende del tipo de examen:

  • Opción múltiple (MMLU): se le da la pregunta y se compara la letra que responde con la correcta. Número de aciertos sobre total, y a vivir.
  • Código (HumanEval): se le da una función a medias y se ejecutan tests automáticos. Si los tests pasan, acierta. Es la forma más honesta de medir.
  • Duelos humanos (LMArena): dos modelos anónimos responden a lo mismo, la gente vota cuál es mejor, y todo ello alimenta una liga tipo Elo de ajedrez.
  • Respuesta abierta (IFEval, LongBench): se usan jueces automáticos (muchas veces otro LLM) o reglas duras para puntuar.

Los 3 pecados de los benchmarks (por qué no debes creértelo todo)

1. Contaminación

Si las preguntas del examen se han filtrado en internet (y acaban en los datos de entrenamiento), el modelo no razona la respuesta: la ha memorizado. Es como aprobar un examen porque tienes el solucionario. MMLU lleva años sospechoso de esto.

2. Optimizar para el examen

Si todo el mundo compite en los mismos exámenes, los fabricantes acaban entrenando (o elegiendo) los modelos que puntúan mejor en ellos. El número sube, y la mejora real no es tan grande. Teaching to the test, de toda la vida.

3. No miden lo que TÚ necesitas

Da igual que un modelo saque 92 en MMLU si para tu caso (escribir correos, resumir reuniones, programar scripts pequeños) otro modelo “peor” te va mejor, es más rápido o es gratis en tu servidor.

Nuestro consejo del laboratorio

  1. Mira los benchmarks como filtros: un modelo por debajo del top 30 en todo, difícil que te sorprenda.
  2. Para decidir entre 3-4 finalistas, pruébalos con tus tareas reales. Nuestro truco: una lista de 10 prompts que uses a diario, guardada en un archivo, para pasársela a cada modelo nuevo.
  3. Desconfía de benchmarks donde solo se cita el bueno. Si un lanzamiento solo menciona “logramos SOTA en X” y esconde el resto, hay gato encerrado.

En el próximo post: cómo montar tu propio mini-benchmark casero para evaluar modelos con tus casos de uso. Con receta incluida, por supuesto. 🍳