La regla del reparto: ¿cuándo compensa usar los dos nodos?
La aritmética de GB leídos por token que decide cuándo un modelo merece las dos sparks y cuándo repartir es un retroceso. Con los veredictos reales de los candidatos que hemos probado.

La lección más cara (en descargas de 169GB por nodo) que nos ha dado el laboratorio, destilada en una regla y una tabla de veredictos reales.
La regla, en una línea
Repartir un modelo entre dos nodos solo compensa si NO cabe en uno, o si está estrangulado por ancho de banda de memoria. Si cabe y ya va rápido, ocupar las dos máquinas es un retroceso.
La aritmética que lo decide
Todo se reduce a cuántos GB hay que leer por token. Un modelo denso lee todos sus pesos en cada token generado; con tensor parallel = 2, cada nodo lee la mitad.
| modelo | pesos | leído/token con 1 nodo | con 2 nodos |
|---|---|---|---|
| Qwen 27B | 22 GB | 22 GB | 11 GB |
| Step Flash 148B | ~75 GB | 75 GB (estrangulado) | 37,5 GB |
| MoE 295B | 181 GB | no cabe | 90,5 GB |
El ancho de banda de memoria es el techo físico del GB10: ~8,8 tok/s para un modelo denso de 31GB, medido con tres modelos distintos y siempre el mismo techo. La única forma de superar ese techo: leer menos por token (MoE, cuantización, especulación) o repartir la lectura.
La lección que nos costó una descarga de 338GB
Tuvimos un candidato (un MoE de 295B) que cumplía la regla de abajo —no cabía en un nodo— y aun así fue un mal negocio: 8,17 tok/s frente a los 43,91 de DeepSeek corriendo en las mismas dos máquinas, con 131k de contexto frente a 1M.
La regla dice cuándo repartir tiene sentido técnico. No dice que el modelo merezca la pena. Esa segunda pregunta solo la contesta medir — y medir sale barato: 12 minutos de carga y tres tiradas de velocidad.
Cuando el candidato compite contra algo ya medido, la tirada de velocidad va primero: antes que el banco completo, antes que nada.
Los veredictos reales de nuestra mesa
| candidato | ¿dos sparks? | veredicto |
|---|---|---|
| DeepSeek V4 Flash | ✅ necesita (155 GiB/nodo) | ✅ corrió en producción: 43,9 tok/s, 1M contexto |
| ❌ no cabe en uno | ❌ descartado: 8,2 tok/s. Ocupa igual, va 5× peor | |
| MiMo V2.5 Omni | ✅ necesita | candidato válido: texto+imagen+vídeo+audio (capacidad que no teníamos) |
| Step 3.7 Flash 148B | ⚠️ cabe pero estrangulado | candidato: 7 tareas/h en un nodo; repartirlo es lo que lo hace usable |
| ❌ cabe y va rápido | ❌ descartado: mejor caso repartido ≈ 39 tok/s vs 120 en un nodo | |
| GLM 5.3 Flash | ✅ necesita | beta operativa hoy: la ficha completa en su post |
| Qwen 2.4T-A95B | ❌ imposible | 4,9TB en BF16. Ni locos |
Los tres filtros, en orden
- ¿Cabe? Si no cabe en uno y lo necesitas → repartir. Si cabe → paso 2.
- ¿Va rápido ya? Si sí → no repartir (Qwen: 120 tok/s en un nodo es insuperable repartiendo).
- ¿Merece la pena? Mide velocidad ANTES de descargar 338GB. La velocidad es la primera señal, no la última.
La moraleja del laboratorio
El hardware no pregunta si el modelo es bueno. Las dos sparks reparten lo que les pidas y te dan la cifra. La regla te ahorra la descarga; la medición te ahorra el error. Las dos cosas juntas son lo más parecido a un “no te arrepentirás” que existe en IA local. 🧮