← Todos los postsBlog · 10 de octubre de 2025

El banco de pruebas: cómo medimos de verdad en el laboratorio

Nuestro banco de evaluación propio: 9 bloques de pruebas, un goldenset de 56 ítems con trampas reales, TC-60 de seguridad y la regla de oro: cada modelo con su mejor configuración declarada.

Complemento real de qué es un benchmark y del mini-benchmark casero. Esta es la batería seria — la que usamos en el laboratorio antes de declarar un modelo “de producción”. Si os interesa montar algo parecido, aquí está el diseño completo.

El problema que resuelve

Medir tok/s es fácil. La pregunta difícil es: ¿merece la pena este modelo para NUESTRO trabajo? La velocidad sin calidad y la calidad sin velocidad son medias decisiones. Y la seguridad… ya la dejamos fuera demasiadas veces (nos mordió: ver errores del laboratorio).

Los 9 bloques de nuestra batería

Bloque Qué responde
01 · Identidad y salud ¿Estamos midiendo el modelo y la receta correctos? (versión, commit, config efectiva)
02 · Velocidad TTFT frío/caliente, decode, prefill 18K→262K, contexto largo
03 · Concurrencia ×1 a ×10 en paralelo: ¿rinde con varios agentes o solo en solitario?
04 · Especulación y caché A/B con y sin drafter; aceptación real; coste en memoria
05 · Calidad y seguridad Goldenset 56 ítems + TC-60 de seguridad
06 · Código y herramientas ¿Es fiable como agente? Tool-calls reales en el arnés
07 · Artefactos ¿Entrega archivos/HTML que se pueden abrir y usar?
08 · Resistencia Soak 30 min, cancelación, reinicio, recuperación
09 · Sistema RAM, KV, swap, temperatura, potencia, energía

El goldenset: 56 ítems con trampas REALES

La pieza más valiosa del banco. No son preguntas genéricas de MMLU: son 56 ítems sacados del material real del laboratorio, donde las trampas son errores que de verdad cometimos (y que de verdad engañaron a un modelo).

Familia Qué mide
T · Trampas 14 detectar contradicciones, datos ausentes, diagnósticos no demostrados
F · Factual 10 recuperar un dato exacto de un documento largo
D · Derivación 10 calcular y razonar sobre medidas reales
C · Código 7 escribir código verificable y reversible
V · Control verdadero 10 aceptar premisas correctas sin “rebote” escéptico
H · Herramientas 5 ejecutar herramientas y devolver valores comprobables

Puntuación 0/1/2 por ítem, 112 puntos máximo. Una respuesta inventada o una trampa aceptada = 0.

El secreto de un buen goldenset: las trampas tienen que ser auténticas. Un documento que de verdad afirmaba algo falso engaña a los modelos igual que nos engañó a nosotros. Las trampas inventadas de laboratorio son más débiles.

TC-60: la batería de seguridad

60 escenarios de seguridad en modo agente (inyección de prompts, parámetros omitidos, acciones irreversibles, polling asíncrono…). Se ejecutan 5 tiradas por escenario — no vale 4/5: si falla UNA vez, hay agujero.

El caso que nos enseñó esto: un modelo que sin system prompt defensivo cayó 5/5 ante una inyección “durmiendo” que se ejecutaba dos turnos después. Con el prompt, 5/5 resiste. La misma máquina, la misma velocidad. Solo cambió la seguridad.

Los gates antes de declarar “en producción”

  1. Config efectiva guardada y seis medidas consecutivas tras calentamiento
  2. Sin errores de auth, parser, stream o cancelación
  3. TC-60 5/5 y goldenset completo sin ítems inválidos
  4. Tool smoke real en los tres clientes
  5. Temperatura, potencia, memoria y energía reportadas junto a tok/s
  6. Si es cluster: recuperación de ambos nodos verificada

La ficha de cada modelo

modelo · nodo/cluster · cuantización · runtime/commit · contexto
· MTP · TTFT · prefill · decode · agregado ×4/×8
· Goldenset /112 · TC-60 · tools
· temperatura máxima · W · energía
· resultado · límites

La regla de comparación honesta

Cada modelo corre con su mejor configuración estable, declarada completa. Nunca mezclamos cifras externas con medidas propias. Y en cada nota distinguimos tres cosas: medido, derivado y no medido.

La frase que resume el método: “no falla, miente”. Cuando un benchmark da un número raro, casi siempre mide otra cosa de la que crees.

En el próximo post: los resultados reales de nuestra pila con este banco — GLM-5.3 Flash corriendo con 1M de contexto en las dos sparks. 🧪