Calculadora de hardware para LLM

Hasta 262144 en qwen3-*. La calidad disminuye más allá del contexto nativo.

qwen3-32b · Q4_K_M · KV=Q8

pesos ~17.6 GB · KV 131 KB/token · necesita ~36.8 GB para 131,072

Cuello de botella: KV 47% / pesos 48% / overhead 5%

  • 2x RTX 3090max 131,07243-64 tokens/s
  • RTX 4090 48GBmax 131,07229-43 tokens/s

Unidades decimales: 1 GB=109 bytes1\,\text{GB} = 10^{9}\,\text{bytes}, 1 KB=103 bytes1\,\text{KB} = 10^{3}\,\text{bytes}. No GiB ni KiB.

No se modela descarga de capas a CPU. mmap afecta a carga, no al cálculo de VRAM.

Solo estima decodificación; no modela prefill, que puede ser el cuello de botella en grandes MoE.

decode-only estimate; anchors: llama.cpp single stream, 2026-09

Sobre las estimaciones

  • Decodificación de un flujo (batch=1\text{batch} = 1) calibrada con llama.cpp en 2026-09.
  • Unidades decimales: 1 GB=109 bytes1\,\text{GB} = 10^{9}\,\text{bytes}. Memoria unificada reserva 4 GB para el sistema.
  • MoE lee solo expertos activos, con factor 0,35× por latencia.
  • Q8 KV reduce a la mitad la caché con pérdida de calidad pequeña.
Encuentra GPU o Mac para tu modelo, cuantización y contexto, con estimaciones de tokens/s basadas en llama.cpp y GB decimales.