LLM-Hardwarerechner
Link in die Zwischenablage kopiert!
Bis zu 262144 für qwen3-*. Jenseits des nativen Kontexts sinkt die Qualität.
qwen3-32b · Q4_K_M · KV=Q8
Gewichte ~17.6 GB · KV 131 KB/token · benötigt ~36.8 GB für 131,072
Engpass: KV 47% / Gewichte 48% / overhead 5%
- 2x RTX 3090max 131,07243-64 Token/s
- RTX 4090 48GBmax 131,07229-43 Token/s
Dezimale Einheiten: , . Keine GiB/KiB.
CPU-Offload ist kein Eignungsmodus in Version 1. mmap beeinflusst nur die Ladezeit, nicht die VRAM-Berechnung.
Nur Dekodierschätzung. Prefill für große Kontexte wird nicht modelliert; bei sehr großen MoE-Modellen kann es der eigentliche Engpass sein.
decode-only estimate; anchors: llama.cpp single stream, 2026-09
Über diese Schätzungen
- Einzelstrom-Dekodierung (), kalibriert anhand von llama.cpp-Messungen aus 2026-09.
- Dezimale Einheiten: . Geräte mit gemeinsamem Speicher reservieren 4 GB für das Betriebssystem.
- MoE-Dekodierung liest nur aktive Experten; Faktor 0,35 wegen Latenzbegrenzung.
- Q8-KV halbiert den Cachespeicher bei geringem Qualitätsverlust.
Welche GPU oder welcher Mac eignet sich für Modell, Quantisierung und Kontext, und mit wie vielen Token/s? Lokale Dekodierschätzungen aus llama.cpp-Referenzen in dezimalen GB.