Calculadora de hardware para LLM
¡Enlace copiado al portapapeles!
Hasta 262144 en qwen3-*. La calidad disminuye más allá del contexto nativo.
qwen3-32b · Q4_K_M · KV=Q8
pesos ~17.6 GB · KV 131 KB/token · necesita ~36.8 GB para 131,072
Cuello de botella: KV 47% / pesos 48% / overhead 5%
- 2x RTX 3090max 131,07243-64 tokens/s
- RTX 4090 48GBmax 131,07229-43 tokens/s
Unidades decimales: , . No GiB ni KiB.
No se modela descarga de capas a CPU. mmap afecta a carga, no al cálculo de VRAM.
Solo estima decodificación; no modela prefill, que puede ser el cuello de botella en grandes MoE.
decode-only estimate; anchors: llama.cpp single stream, 2026-09
Sobre las estimaciones
- Decodificación de un flujo () calibrada con llama.cpp en 2026-09.
- Unidades decimales: . Memoria unificada reserva 4 GB para el sistema.
- MoE lee solo expertos activos, con factor 0,35× por latencia.
- Q8 KV reduce a la mitad la caché con pérdida de calidad pequeña.
Encuentra GPU o Mac para tu modelo, cuantización y contexto, con estimaciones de tokens/s basadas en llama.cpp y GB decimales.