← Todos los episodiosEP.003 · 17 de septiembre de 2025

EP.003 — Benchmarks: la nota que no te dice nada (y cómo medir de verdad)

MMLU, GPQA, LMArena... Destripamos los benchmarks de IA: qué miden, cómo se juegan los fabricantes con ellos y cómo montar tu propio examen casero.

47:03benchmarksevaluaciónfundamentos

De qué hablamos

Cada lanzamiento de modelo viene con números imposibles. En este episodio aprendemos a leerlos con ojo crítico: qué es un benchmark, cuáles son los importantes, dónde te engañan y cómo crear TU propio benchmark con tus tareas reales.

Capítulos

  • 00:00 Intro: el número de moda (“SOTA en GPQA!”)
  • 05:20 Qué es un benchmark: la analogía de la selectividad
  • 12:45 Los 7 benchmarks que verás siempre (chuleta)
  • 20:30 Contaminación: cuando el modelo tiene el solucionario
  • 27:15 Teaching to the test: el negocio de los números
  • 34:40 Nuestro mini-benchmark casero, paso a paso
  • 43:30 Conclusiones: cómo elegir modelo sin hacerte daño

Frases del episodio

“Si el modelo no razona la respuesta, la ha memorizado. Y eso no es inteligencia, es un apuntes escondido.”