EP.003 — Benchmarks: la nota que no te dice nada (y cómo medir de verdad)
MMLU, GPQA, LMArena... Destripamos los benchmarks de IA: qué miden, cómo se juegan los fabricantes con ellos y cómo montar tu propio examen casero.

De qué hablamos
Cada lanzamiento de modelo viene con números imposibles. En este episodio aprendemos a leerlos con ojo crítico: qué es un benchmark, cuáles son los importantes, dónde te engañan y cómo crear TU propio benchmark con tus tareas reales.
Capítulos
- 00:00 Intro: el número de moda (“SOTA en GPQA!”)
- 05:20 Qué es un benchmark: la analogía de la selectividad
- 12:45 Los 7 benchmarks que verás siempre (chuleta)
- 20:30 Contaminación: cuando el modelo tiene el solucionario
- 27:15 Teaching to the test: el negocio de los números
- 34:40 Nuestro mini-benchmark casero, paso a paso
- 43:30 Conclusiones: cómo elegir modelo sin hacerte daño
Menciones y links
- LMArena — los duelos a ciegas
- [MMLU / GPQA / SWE-bench] — los exámenes de siempre
- Post: ¿Qué es un benchmark?
- Receta: Tu mini-benchmark casero
Frases del episodio
“Si el modelo no razona la respuesta, la ha memorizado. Y eso no es inteligencia, es un apuntes escondido.”