LLM-Hardwarerechner

Bis zu 262144 für qwen3-*. Jenseits des nativen Kontexts sinkt die Qualität.

qwen3-32b · Q4_K_M · KV=Q8

Gewichte ~17.6 GB · KV 131 KB/token · benötigt ~36.8 GB für 131,072

Engpass: KV 47% / Gewichte 48% / overhead 5%

  • 2x RTX 3090max 131,07243-64 Token/s
  • RTX 4090 48GBmax 131,07229-43 Token/s

Dezimale Einheiten: 1 GB=109 Bytes1\,\text{GB} = 10^{9}\,\text{Bytes}, 1 KB=103 Bytes1\,\text{KB} = 10^{3}\,\text{Bytes}. Keine GiB/KiB.

CPU-Offload ist kein Eignungsmodus in Version 1. mmap beeinflusst nur die Ladezeit, nicht die VRAM-Berechnung.

Nur Dekodierschätzung. Prefill für große Kontexte wird nicht modelliert; bei sehr großen MoE-Modellen kann es der eigentliche Engpass sein.

decode-only estimate; anchors: llama.cpp single stream, 2026-09

Über diese Schätzungen

  • Einzelstrom-Dekodierung (Batch=1\text{Batch} = 1), kalibriert anhand von llama.cpp-Messungen aus 2026-09.
  • Dezimale Einheiten: 1 GB=109 Bytes1\,\text{GB} = 10^{9}\,\text{Bytes}. Geräte mit gemeinsamem Speicher reservieren 4 GB für das Betriebssystem.
  • MoE-Dekodierung liest nur aktive Experten; Faktor 0,35 wegen Latenzbegrenzung.
  • Q8-KV halbiert den Cachespeicher bei geringem Qualitätsverlust.
Welche GPU oder welcher Mac eignet sich für Modell, Quantisierung und Kontext, und mit wie vielen Token/s? Lokale Dekodierschätzungen aus llama.cpp-Referenzen in dezimalen GB.