Kalkulator Perangkat Keras LLM
Tautan disalin ke papan klip!
Kuantisasillama.cpp di GitHub ↗
cache KV
Hingga 262144 untuk qwen3-*. Kualitas menurun melebihi kualitas asli.
qwen3-32b · Q4_K_M · KV=Q8
bobot ~17.6 GB · KV 131 KB/token · membutuhkan ~36.8 GB untuk 131,072
Faktor pembatas: KV 47% / bobot 48% / overhead 5%
- 2x RTX 3090max 131,07243-64 tok/dtk
- RTX 4090 48GBmax 131,07229-43 tok/dtk
Satuan: desimal , . Tidak pernah GiB/KiB.
Pembongkaran CPU bukan mode fit v1; mmap hanya memengaruhi waktu muat, bukan penghitungan VRAM.
Perkiraan hanya mencakup dekode. Prefill (pemrosesan konteks masukan) tidak dimodelkan; pada model MoE besar, prefill dapat menjadi faktor pembatas utama.
decode-only estimate; anchors: llama.cpp single stream, 2026-09
Tentang perkiraan ini
- Dekode aliran tunggal () dikalibrasi ke pengukuran llama.cpp, 2026-09.
- Satuan desimal: . Mesin terpadu mencadangkan 4 GB untuk OS.
- Dekode MoE hanya membaca pakar aktif, didiskon 0,35× (terikat latensi).
- Q8 KV membagi dua memori cache dengan kehilangan kualitas yang dapat diabaikan.
Perkirakan kebutuhan GPU atau Mac dan kecepatan dekode LLM. Bandingkan model, kuantisasi, serta ukuran konteks berdasarkan referensi llama.cpp.