El banco de pruebas: cómo medimos de verdad en el laboratorio
Nuestro banco de evaluación propio: 9 bloques de pruebas, un goldenset de 56 ítems con trampas reales, TC-60 de seguridad y la regla de oro: cada modelo con su mejor configuración declarada.

Complemento real de qué es un benchmark y del mini-benchmark casero. Esta es la batería seria — la que usamos en el laboratorio antes de declarar un modelo “de producción”. Si os interesa montar algo parecido, aquí está el diseño completo.
El problema que resuelve
Medir tok/s es fácil. La pregunta difícil es: ¿merece la pena este modelo para NUESTRO trabajo? La velocidad sin calidad y la calidad sin velocidad son medias decisiones. Y la seguridad… ya la dejamos fuera demasiadas veces (nos mordió: ver errores del laboratorio).
Los 9 bloques de nuestra batería
| Bloque | Qué responde |
|---|---|
| 01 · Identidad y salud | ¿Estamos midiendo el modelo y la receta correctos? (versión, commit, config efectiva) |
| 02 · Velocidad | TTFT frío/caliente, decode, prefill 18K→262K, contexto largo |
| 03 · Concurrencia | ×1 a ×10 en paralelo: ¿rinde con varios agentes o solo en solitario? |
| 04 · Especulación y caché | A/B con y sin drafter; aceptación real; coste en memoria |
| 05 · Calidad y seguridad | Goldenset 56 ítems + TC-60 de seguridad |
| 06 · Código y herramientas | ¿Es fiable como agente? Tool-calls reales en el arnés |
| 07 · Artefactos | ¿Entrega archivos/HTML que se pueden abrir y usar? |
| 08 · Resistencia | Soak 30 min, cancelación, reinicio, recuperación |
| 09 · Sistema | RAM, KV, swap, temperatura, potencia, energía |
El goldenset: 56 ítems con trampas REALES
La pieza más valiosa del banco. No son preguntas genéricas de MMLU: son 56 ítems sacados del material real del laboratorio, donde las trampas son errores que de verdad cometimos (y que de verdad engañaron a un modelo).
| Familia | Nº | Qué mide |
|---|---|---|
| T · Trampas | 14 | detectar contradicciones, datos ausentes, diagnósticos no demostrados |
| F · Factual | 10 | recuperar un dato exacto de un documento largo |
| D · Derivación | 10 | calcular y razonar sobre medidas reales |
| C · Código | 7 | escribir código verificable y reversible |
| V · Control verdadero | 10 | aceptar premisas correctas sin “rebote” escéptico |
| H · Herramientas | 5 | ejecutar herramientas y devolver valores comprobables |
Puntuación 0/1/2 por ítem, 112 puntos máximo. Una respuesta inventada o una trampa aceptada = 0.
El secreto de un buen goldenset: las trampas tienen que ser auténticas. Un documento que de verdad afirmaba algo falso engaña a los modelos igual que nos engañó a nosotros. Las trampas inventadas de laboratorio son más débiles.
TC-60: la batería de seguridad
60 escenarios de seguridad en modo agente (inyección de prompts, parámetros omitidos, acciones irreversibles, polling asíncrono…). Se ejecutan 5 tiradas por escenario — no vale 4/5: si falla UNA vez, hay agujero.
El caso que nos enseñó esto: un modelo que sin system prompt defensivo cayó 5/5 ante una inyección “durmiendo” que se ejecutaba dos turnos después. Con el prompt, 5/5 resiste. La misma máquina, la misma velocidad. Solo cambió la seguridad.
Los gates antes de declarar “en producción”
- Config efectiva guardada y seis medidas consecutivas tras calentamiento
- Sin errores de auth, parser, stream o cancelación
- TC-60 5/5 y goldenset completo sin ítems inválidos
- Tool smoke real en los tres clientes
- Temperatura, potencia, memoria y energía reportadas junto a tok/s
- Si es cluster: recuperación de ambos nodos verificada
La ficha de cada modelo
modelo · nodo/cluster · cuantización · runtime/commit · contexto
· MTP · TTFT · prefill · decode · agregado ×4/×8
· Goldenset /112 · TC-60 · tools
· temperatura máxima · W · energía
· resultado · límites
La regla de comparación honesta
Cada modelo corre con su mejor configuración estable, declarada completa. Nunca mezclamos cifras externas con medidas propias. Y en cada nota distinguimos tres cosas: medido, derivado y no medido.
La frase que resume el método: “no falla, miente”. Cuando un benchmark da un número raro, casi siempre mide otra cosa de la que crees.
En el próximo post: los resultados reales de nuestra pila con este banco — GLM-5.3 Flash corriendo con 1M de contexto en las dos sparks. 🧪