Calculadora de hardware para LLM
Link copiado para a área de transferência!
Até 262144 para qwen3-*. A qualidade cai além do contexto nativo.
qwen3-32b · Q4_K_M · KV=Q8
pesos ~17.6 GB · KV 131 KB/token · necessário ~36.8 GB para 131,072
Gargalo: KV 47% / pesos 48% / overhead 5%
- 2x RTX 3090max 131,07243-64 tok/s
- RTX 4090 48GBmax 131,07229-43 tok/s
Unidades decimais: , . Não GiB/KiB.
Offload para CPU não é um modo da versão 1; mmap afeta apenas carregamento, não a contagem de VRAM.
Estima apenas decodificação; prefill de contextos grandes não é modelado. Em MoEs gigantes, prefill é o verdadeiro gargalo.
decode-only estimate; anchors: llama.cpp single stream, 2026-09
Sobre as estimativas
- Decodificação de fluxo único () calibrada com medições do llama.cpp de setembro de 2026.
- Unidades decimais: . Máquinas unificadas reservam 4 GB para o sistema.
- A decodificação MoE lê apenas especialistas ativos, com fator 0,35× por limitação de latência.
- KV Q8 reduz o cache à metade com perda mínima de qualidade.
Veja qual GPU ou Mac comporta seu modelo, quantização e contexto, e os tok/s estimados com referências do llama.cpp em GB decimais.