Calculadora de hardware para LLM

Até 262144 para qwen3-*. A qualidade cai além do contexto nativo.

qwen3-32b · Q4_K_M · KV=Q8

pesos ~17.6 GB · KV 131 KB/token · necessário ~36.8 GB para 131,072

Gargalo: KV 47% / pesos 48% / overhead 5%

  • 2x RTX 3090max 131,07243-64 tok/s
  • RTX 4090 48GBmax 131,07229-43 tok/s

Unidades decimais: 1 GB=109 bytes1\,\text{GB} = 10^{9}\,\text{bytes}, 1 KB=103 bytes1\,\text{KB} = 10^{3}\,\text{bytes}. Não GiB/KiB.

Offload para CPU não é um modo da versão 1; mmap afeta apenas carregamento, não a contagem de VRAM.

Estima apenas decodificação; prefill de contextos grandes não é modelado. Em MoEs gigantes, prefill é o verdadeiro gargalo.

decode-only estimate; anchors: llama.cpp single stream, 2026-09

Sobre as estimativas

  • Decodificação de fluxo único (batch=1\text{batch} = 1) calibrada com medições do llama.cpp de setembro de 2026.
  • Unidades decimais: 1 GB=109 bytes1\,\text{GB} = 10^{9}\,\text{bytes}. Máquinas unificadas reservam 4 GB para o sistema.
  • A decodificação MoE lê apenas especialistas ativos, com fator 0,35× por limitação de latência.
  • KV Q8 reduz o cache à metade com perda mínima de qualidade.
Veja qual GPU ou Mac comporta seu modelo, quantização e contexto, e os tok/s estimados com referências do llama.cpp em GB decimais.