// el rack — Rack-0

El foso es el rack

Cualquiera puede hablar de IA. Muy pocos pueden demostrar un modelo de 300–700B corriendo en su propia casa, con vatios medidos. Ese es el foso de En Local: un mini-datacenter de aficionado-pro que enseñamos en cámara. El cluster es el personaje.

El inventario

6× ASUS Ascent GX10

El cluster: 768GB unificados

DGX Spark OEM: GB10 Grace Blackwell, 128GB unificados por nodo, 1 PFLOP FP4, ConnectX-7 2×200GbE. ~27W en reposo, ~112W a plena carga por nodo.

En pares corren modelos de 300B–400B (DeepSeek V4 Flash, GLM NVFP4). Con cuatro nodos sirven modelos de la escala GLM ~700B a ~22 tok/s. Contenido «imposible» para el resto del timeline.

MikroTik CRS812

El tejido RoCE

2×400G + 2×200G + 8×50G. El switch que usa la comunidad Spark. Cableado QSFP, MTU 9000, RoCE de verdad frente al TCP que frena el NCCL. Eso también es contenido.

3× Strix Halo 128GB

Capacidad enorme, poco ancho de banda

Ryzen AI Max+ 395: hasta ~96–108GB para la iGPU a ~215GB/s. MoE de 30B a 70–100 tok/s, gpt-oss-120B ~50 tok/s, denso de 70B a 4–6 tok/s (honrado). Ideal para servir modelos 24/7, embeddings y TTS.

2× RTX 5090 mobile · 24GB

La cámara rápida

896GB/s donde el modelo cabe: 8B a ~110 tok/s, 32B Q4 a ~23 tok/s. ComfyUI, WAN, clips del podcast, miniaturas y voice-clone local. Todo el material visual del canal nace aquí.

La arquitectura viva

cada pieza aparece en cámara cada 2 semanas — regla de oro
Nodo noticia

1 Strix Halo: modelo MoE 30B–70B siempre caliente + embeddings BGE-M3 + TTS local. Cada mañana resume papers y repos — alimenta el podcast y la newsletter.

Nodo demo

1× 5090: 8B–32B a toda velocidad para los vídeos de «en 15 segundos lo corres». El benchmark en un frame sale de aquí.

Nodo frontera

2 GX10 enlazados: el modelo de la semana que no cabe en una GPU de consumo. Las fichas de GLM-5.3, DeepSeek V4 y Qwen3.8 salen de aquí.

Nodo soberano

1 GX10 / 1 Halo: ALIA-40B instruct + Salamandra, RAG en español sobre BOE, contratos, documentación clínica. La demo que nadie más enseña corriendo.

Nodo creativo

1× 5090 + 1 Halo: imagen y vídeo local para el propio canal. Miniaturas, clips, artefactos del podcast.

Reserva / fine-tune

El resto de GX10: LoRA/QLoRA de dominio en español, cuantizaciones GGUF/NVFP4 y A/B de runtimes (vLLM, SGLang, llama.cpp, TensorRT-LLM).

Los números que nos definen

768GBmemoria unificada en cluster
700Bmodelos demostrados en local
1Mtokens de contexto verificados
0de API en los benchmarks

Cada cifra de esta web sale de nuestro banco de pruebas: seis medidas consecutivas, temperatura, potencia y energía junto a tok/s.Medido, derivado o no medido — nunca confundidos.

Los dos del rack

Toni

Rack y número — benchmarks, configs, cluster

Benchmarks, configs, cluster, fine-tunes. Grabar terminal + vatímetro + fotos del rack. Backups, luz, discos y NCCL.

Jaume

Cara y red — guion, comunidad, comercial

Guion, voz del podcast, hilos de opinión. Respuestas, DMs, Spaces y newsletter. Comercial: diagnósticos y pilotos.

El credo

  • Publicamos medido o no publicamos
  • Números concretos: tok/s, GB, W, €
  • Los errores también se publican
  • La newsletter es el activo; X es el megáfono

Síguenos y escúchanos

El podcast semanal + los benchs diarios. Todo desde el rack, todo en español.