Kalkulator Perangkat Keras LLM

cache KV

Hingga 262144 untuk qwen3-*. Kualitas menurun melebihi kualitas asli.

qwen3-32b · Q4_K_M · KV=Q8

bobot ~17.6 GB · KV 131 KB/token · membutuhkan ~36.8 GB untuk 131,072

Faktor pembatas: KV 47% / bobot 48% / overhead 5%

  • 2x RTX 3090max 131,07243-64 tok/dtk
  • RTX 4090 48GBmax 131,07229-43 tok/dtk

Satuan: desimal 1 GB=109 byte1\,\text{GB} = 10^{9}\,\text{byte}, 1 KB=103 byte1\,\text{KB} = 10^{3}\,\text{byte}. Tidak pernah GiB/KiB.

Pembongkaran CPU bukan mode fit v1; mmap hanya memengaruhi waktu muat, bukan penghitungan VRAM.

Perkiraan hanya mencakup dekode. Prefill (pemrosesan konteks masukan) tidak dimodelkan; pada model MoE besar, prefill dapat menjadi faktor pembatas utama.

decode-only estimate; anchors: llama.cpp single stream, 2026-09

Tentang perkiraan ini

  • Dekode aliran tunggal (batch=1\text{batch} = 1) dikalibrasi ke pengukuran llama.cpp, 2026-09.
  • Satuan desimal: 1 GB=109 byte1\,\text{GB} = 10^{9}\,\text{byte}. Mesin terpadu mencadangkan 4 GB untuk OS.
  • Dekode MoE hanya membaca pakar aktif, didiskon 0,35× (terikat latensi).
  • Q8 KV membagi dua memori cache dengan kehilangan kualitas yang dapat diabaikan.
Perkirakan kebutuhan GPU atau Mac dan kecepatan dekode LLM. Bandingkan model, kuantisasi, serta ukuran konteks berdasarkan referensi llama.cpp.