Juan Diego Andrés PRADA··RAMÍREZ Entrar
Lección 5 de 53

Antes de mirar marcas, tres números

Cualquier equipo para inferencia local se describe con tres números. Con ellos se puede predecir en papel, con un margen de ±30 %, cómo va a rendir antes de comprarlo. Sin ellos se compra por fe.

Número Unidad Qué decide Dónde se lee
Capacidad de memoria GB si el modelo + su contexto caben ficha técnica: VRAM (GPU) o memoria unificada
Ancho de banda de memoria GB/s la velocidad de decode (tokens/s) ficha técnica: memory bandwidth
Cómputo TFLOPS (FP16/BF16) la velocidad de prefill (TTFT) ficha técnica: FP16 performance

El orden importa: primero capacidad (si no cabe, nada más importa), luego ancho de banda (la sensación de velocidad), y por último cómputo (que manda en documentos largos, lección siguiente).

Capacidad: ¿cabe?

memoria necesaria ≈ pesos + caché de contexto + margen del runtime
pesos = parámetros × bytes/parámetro (lección 0.3)
caché de contexto ≈ depende del modelo; orden de 0,1–0,15 GB por cada 1 000 tokens en un 8B
margen ≈ 0,5–1 GB

Ejemplo: un 8B en Q4 (~4,9 GB) con 16k de contexto (~2 GB) y margen → ~8 GB. Cabe justo en una tarjeta de 8 GB, sin dejar nada para un segundo usuario. En 12 GB respira. En 6 GB, no corre o corre partido entre GPU y RAM (y entonces manda el ancho de banda de la RAM, que es 5–10 veces menor).

Ancho de banda: tokens por segundo

Para generar un token, el modelo tiene que leer todos sus pesos una vez. Por eso:

tokens/s (decode, un usuario) ≈ ancho de banda (GB/s) ÷ tamaño de los pesos (GB)
Equipo (clase) [VOLÁTIL — verificado: 2026-09] Ancho de banda 8B Q4 (4,9 GB) 14B Q4 (8,5 GB)
Portátil sin GPU, RAM DDR5 doble canal ~80 GB/s ~16 tok/s ~9 tok/s
GPU de consumo gama media (8–16 GB GDDR6) ~300–500 GB/s ~60–100 tok/s ~35–60 tok/s
Estación Apple Silicon gama alta (memoria unificada) ~400–800 GB/s ~80–160 tok/s ~45–90 tok/s
GPU de consumo tope de gama (24 GB GDDR6X/7) ~900–1 000 GB/s ~180–200 tok/s ~100–120 tok/s

La fórmula es un techo teórico; en la práctica se obtiene el 60–80 %. Pero el orden de magnitud no falla: una CPU no va a dar 60 tok/s con un 8B, por mucho software que se le ponga.

Para un humano leyendo, 15–20 tok/s ya parece «rápido». Para un agente que hace diez pasos por tarea, 15 tok/s significa minutos por tarea. El mismo número es suficiente o insuficiente según el uso.

Cómputo: el tiempo hasta la primera palabra

Antes de escribir, el modelo tiene que procesar todo el contexto (prefill). Eso no es leer pesos una vez: son multiplicaciones de matrices proporcionales a tokens × parámetros. Manda el cómputo:

tiempo de prefill ≈ (2 × parámetros × tokens de entrada) ÷ FLOPS efectivos

Ejemplo: 8B, 6 000 tokens de entrada (un contrato de 12 páginas):

Equipo (clase) FLOPS efectivos FP16 Prefill de 6k tokens
CPU portátil ~1 TFLOPS ~100 s
GPU de consumo gama media ~30–60 TFLOPS ~2–3 s
GPU tope de gama ~100+ TFLOPS < 1 s

Cien segundos hasta la primera palabra es un sistema que nadie usa. Ahí es donde el perfil A se rompe para cargas documentales, y por qué la lección siguiente es la más importante del módulo.

Laboratorio 1.1 · la calculadora

cd ~/labs/el-tornillo && mkdir -p labs/01-01 && cd labs/01-01
cat > calculadora.csv <<'EOF'
equipo,memoria_gb,ancho_banda_gbs,tflops_fp16,modelo_gb,contexto_tokens
portatil-sin-gpu,16,80,1,4.9,8000
gpu-media-12gb,12,360,40,4.9,16000
servidor-24gb,24,1000,120,8.5,32000
EOF
python3 - <<'PY'
import csv
for r in csv.DictReader(open("calculadora.csv")):
 m=float(r["modelo_gb"]); ctx=int(r["contexto_tokens"])
 necesita = m + 0.12*ctx/1000 + 0.8
 cabe = "sí" if necesita <= float(r["memoria_gb"]) else "NO"
 tps = float(r["ancho_banda_gbs"])/m*0.7
 prefill = 2*8e9*6000/(float(r["tflops_fp16"])*1e12*0.5)
 print(f'{r["equipo"]:18s} necesita {necesita:5.1f} GB → cabe: {cabe:3s} | ~{tps:5.0f} tok/s | prefill 6k: {prefill:6.1f} s')
PY

Lo que debe ver: tres líneas. El portátil «cabe» pero con prefill de más de un minuto; el servidor cabe con todo y responde en segundos. Ese es el resultado que se le muestra al cliente antes de que compre.

Entregable: calculadora.csv con los tres equipos que usted tenga a mano o esté considerando.

Qué se degrada en cada perfil

Perfil Qué pasa
A · sin GPU Cabe lo pequeño; el prefill de documentos largos es inviable para uso diario
B · 8–16 GB Modelos medianos cuantizados; contexto limitado por la caché; prefill aceptable
C · 24 GB+ Modelos grandes o medianos en Q8 con contexto amplio; prefill en segundos

Cuándo NO usar esto

  • No use la calculadora para comparar software (dos runtimes en el mismo equipo): eso se mide.
  • No compre por TFLOPS si la carga es chat corto: ahí manda el ancho de banda.
  • No confíe en la cifra de memoria «compartida» de un portátil: la GPU integrada usa RAM lenta.

Práctica

  1. Un cliente ofrece dos opciones: 16 GB a 400 GB/s o 12 GB a 900 GB/s. ¿Cuál para un 14B Q4 con 8k de contexto? ¿Y para un 8B Q8 con 32k?
  2. Estime el prefill de una remisión de 2 páginas (~1 000 tokens) en el perfil A. ¿Es usable?
  3. Explique por qué duplicar la RAM de un portátil no duplica los tokens/s.

Referencias

  1. Documentación de llama.cpp sobre rendimiento y llama-bench: https://github.com/ggml-org/llama.cpp [VOLÁTIL — verificado: 2026-09]
  2. Pope, R. et al. (2022). Efficiently Scaling Transformer Inference. arXiv:2211.05102 — el análisis de memoria y cómputo del que salen las dos fórmulas.
  3. Kwon, W. et al. (2023). Efficient Memory Management for Large Language Model Serving with PagedAttention. arXiv:2309.06180 — por qué la caché de contexto es el segundo consumidor de memoria.

Quiz rápido

Para que repases. No cuenta para certificar — el examen del módulo es el que certifica.

1. ¿Qué decide el ancho de banda de memoria?

2. Un equipo con 80 GB/s y un modelo de 4,9 GB da, como techo, unos:

3. ¿En qué orden se miran los tres números al comprar?

Tu progreso se guarda en este navegador. Inicia sesión para guardarlo en tu cuenta y verlo desde cualquier dispositivo.

¿Le sirvió esta lección?

Sirve para saber qué reescribir. Se puede cambiar cuando quiera.

0 votos
Sin nombre todavía

Su avance y su nombre se guardan en este navegador. No hace falta registrarse.

¿Va por el certificado?

Practicar y comentar no exige nada. Para el certificado sí hace falta verificar el correo, el nombre completo, la institución, el grado, porque el certificado dice quién es usted.

Comentarios (0)

Pregunte lo que no entendió. Alguien más tiene la misma duda y no se atreve.

  • Todavía no hay comentarios. Estrene usted.