Калькулятор железа для LLM
Ссылка скопирована в буфер обмена!
До 262144 для qwen3-*. Качество падает за пределами native.
qwen3-32b · Q4_K_M · KV=Q8
веса ~17.6 GB · KV 131 KB/token · нужно ~36.8 GB для 131,072
Узкое место: KV 47% / веса 48% / overhead 5%
- 2x RTX 3090max 131,07243-64 ток/с
- RTX 4090 48GBmax 131,07229-43 ток/с
Единицы: десятичные , . Не GiB/KiB.
CPU-offload не считается fit-режимом v1; mmap влияет только на загрузку, не на VRAM.
Только оценка декода; префилл не моделируется — на MoE-гигантах префилл и есть бутылочное горлышко.
decode-only estimate; anchors: llama.cpp single stream, 2026-09
Об этих оценках
- Однопоточный декод (), калибровка по замерам llama.cpp, 2026-09.
- Десятичные единицы: . На unified-машинах 4 GB зарезервировано под ОС.
- MoE-декод читает только активные эксперты, скидка 0.35× (latency-bound).
- Q8 KV вдвое сокращает кэш почти без потери качества.
Какой GPU или Mac потянет вашу модель, квант и контекст — и на какой скорости ток/с. Офлайн-оценки декода по замерам llama.cpp (десятичные GB).