Калькулятор железа для LLM

До 262144 для qwen3-*. Качество падает за пределами native.

qwen3-32b · Q4_K_M · KV=Q8

веса ~17.6 GB · KV 131 KB/token · нужно ~36.8 GB для 131,072

Узкое место: KV 47% / веса 48% / overhead 5%

  • 2x RTX 3090max 131,07243-64 ток/с
  • RTX 4090 48GBmax 131,07229-43 ток/с

Единицы: десятичные 1 GB=109 байт1\,\text{GB} = 10^{9}\,\text{байт}, 1 KB=103 байт1\,\text{KB} = 10^{3}\,\text{байт}. Не GiB/KiB.

CPU-offload не считается fit-режимом v1; mmap влияет только на загрузку, не на VRAM.

Только оценка декода; префилл не моделируется — на MoE-гигантах префилл и есть бутылочное горлышко.

decode-only estimate; anchors: llama.cpp single stream, 2026-09

Об этих оценках

  • Однопоточный декод (batch=1\text{batch} = 1), калибровка по замерам llama.cpp, 2026-09.
  • Десятичные единицы: 1 GB=109 байт1\,\text{GB} = 10^{9}\,\text{байт}. На unified-машинах 4 GB зарезервировано под ОС.
  • MoE-декод читает только активные эксперты, скидка 0.35× (latency-bound).
  • Q8 KV вдвое сокращает кэш почти без потери качества.
Какой GPU или Mac потянет вашу модель, квант и контекст — и на какой скорости ток/с. Офлайн-оценки декода по замерам llama.cpp (десятичные GB).