Tokens, cuantización y otras palabras raras: el diccionario del Laboratorio
El vocabulario mínimo para entender cualquier noticia de IA: tokens, cuantización, VRAM, fine-tuning, RAG... explicado sin dolor.

Cuando empezamos en esto, la mitad de las noticias no las entendíamos por el idioma: tokens, cuantización, inference… Aquí va el diccionario que nos habría ahorrado meses. Los términos ordenados de más a menos importantes.
Lo básico imprescindible
Token: la unidad con la que los modelos leen y escriben. No es una palabra exacta: es un trozo de texto (~4 caracteres en inglés, algo menos en español). “automóvil” puede ser 2-3 tokens. Cuando un modelo dice “contexto de 128K tokens”, cabe más o menos una novela.
Prompt: lo que le escribes al modelo. El prompt es el 80% de la calidad que obtienes, no lo dudes.
Inference (inferencia): el momento en que el modelo “piensa” y te responde. Cuando un servidor de IA “sirve inferencia”, está ejecutando el modelo para responder peticiones.
Cuantización: técnica para hacer los modelos más pequeños guardando los números con menos precisión. Los pesos originales son 16-bit; cuantizar a 4-bit reduce x4 la memoria con una pérdida mínima. Es LA magia que permite correr modelos grandes en casa. Q4, Q8, IQ3… son niveles distintos (menos bits = menos memoria = algo peor calidad).
VRAM: la memoria de la tarjeta gráfica. Es el recurso más cotizado del IA local: el modelo entero (más el contexto) tiene que caber ahí para ir rápido. La RAM de tu PC también vale, pero a cambio de velocidad.
Intermedio
Fine-tuning: reentrenar un modelo existente con tus datos para especializarlo. Como darle un máster a un generalista.
RAG (Retrieval-Augmented Generation): en vez de esperar que el modelo sepa de tus documentos, se los buscas tú y se los pegas en el prompt. Combinación de búsqueda (embeddings) + generación (LLM). Es cómo las empresas “ enchufan” sus datos a la IA.
Temperature: el dial de creatividad. Baja (0-0.3): respuestas predecibles, ideal para extraer datos. Alta (0.8-1.2): más variadas y creativas, ideal para brainstorming.
System prompt: las instrucciones de fondo que definen cómo actúa el modelo (“Eres un asistente que responde en español, conciso…”). El usuario no lo ve, pero lo condiciona todo.
KV Cache: la memoria que guarda lo ya procesado de la conversación para no repetir el trabajo. Por eso la primera respuesta tarda más que las siguientes.
Avanzado (pero lo oirás siempre)
MoE (Mixture of Experts): arquitectura con múltiples “expertos” internos; por cada token solo se activan unos pocos. Permite modelos gigantes con velocidad de pequeños.
Distillation (destilación): entrenar un modelo pequeño imitando las respuestas de uno gigante. Es como aprender del mejor del curso: el alumno no sabe tanto, pero es mucho más rápido y barato.
LoRA: fine-tuning ligero. En vez de reentrenar el modelo entero, se entrena un “complemento” de unos pocos MB que se enchufa al modelo base. Así se hacen variantes de estilo o especializadas a coste mínimo.
Speculative decoding: truco de velocidad donde un modelo pequeño “borracha” respuesta y el grande las valida. Con lo rápido que es, casi no hay pérdidas.
Test-time compute: la nueva frontera — en vez de mejorar el modelo, darle MÁS tiempo de pensamiento en el momento de responder. Los modelos “de razonamiento” (o1, R1) son esto: mejor respuesta a cambio de más cómputo.
Guardaros este post en marcadores: cada vez que una noticia os deje con la cara de tonto, aquí volveremos. Y si hay un término que nos hayamos dejado y os vuelva loco, escríbenos y lo añadimos. 📖