← Alle ModelleMODELL-CHECK

Kann ich Qwen 3 30B-A3B lokal ausführen?

Qwen 3 30B-A3B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (18.5 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~174 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Qwen 3 30B-A3B ist ein Mixture-of-Experts-Modell, und allein diese Tatsache prägt alles, wie man es einordnen sollte. Auf dem Papier hat es 30.5B Parameter, aber pro Token werden nur 3.3B davon aktiviert – es läuft also mit der Geschwindigkeit eines winzigen Modells und denkt zugleich mit der Breite eines großen. Der Haken ist der Speicher: Du musst trotzdem das ganze Modell im RAM halten. Ein 4-bit-Quant belegt rund 18.5 GB, und das Modell will mindestens 32 GB zum Atmen – das schließt eine 12-GB-Karte wie die RTX 3060 aus, passt aber bequem auf einen 32-GB-Mac mit Apple Silicon oder auf eine 24-GB-4090, wenn du den Kontext moderat hältst.

Im Alltag zahlt sich das MoE-Design auf eine Weise aus, die das Datenblatt untertreibt. Auf einer 4090 sind rund 428 Tokens pro Sekunde drin, und selbst ein M-Max bleibt mit etwa 174 tok/s flott – deutlich schneller, als ein dichtes 30B-Modell auf derselben Hardware je schaffen würde. Reiner CPU-Betrieb auf DDR5 fällt auf etwa 25 tok/s ab, brauchbar für Batch-Jobs, aber nicht für interaktiven Chat. Die 128K Kontext sind echt, aber achte auf das Budget: Sie vollständig zu füllen treibt den Gesamtspeicher auf rund 49.1 GB – auf einer 32-GB-Maschine hältst du den Arbeitskontext also moderat und setzt eher auf einen kleineren Quant, statt das volle Fenster auszureizen.

Gegen Gemma 4 31B, das mit nahezu identischen 30.7B Parametern antritt, ist der Tausch klar. Gemma ist dicht und bringt zusätzlich Coding und Vision mit, wirkt also tendenziell stärker bei multimodalen Aufgaben und strukturierter Code-Arbeit, während das spärliche Design von Qwen 3 30B-A3B es bei Chat und Reasoning in dieser Größenklasse pro Token dramatisch schneller macht. Genau dieses Tempo bei seinem Speicherbedarf ist sein herausragendes Merkmal. Zudem steht es unter Apache 2.0 – anders als anbieterspezifische Open-Weight-Bedingungen kannst du es also frei in kommerziellen und produktiven Einsatz nehmen, ohne lizenzrechtliche Sternchen.

Technische Daten

Parameter30.5B (3.3B aktiv)
Kontextfenster128K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2025-04
Am besten fürChat, Logisches Denken

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3512.8 GB24 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8518.5 GB32 GBEmpfohlen
Q5_K_M5.6521.5 GB32 GBHoch
Q8_08.532.4 GB48 GBNahezu Original
F161661.0 GB96 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.0 GB~19.5 GB
8K Token~1.9 GB~20.4 GB
32K Token~7.7 GB~26.2 GB
128K Token~30.6 GB~49.1 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~428 tok/s
Apple M-series (base)100 GB/s~42 tok/s
Apple M-series Pro270 GB/s~115 tok/s
Apple M-series Max410 GB/s~174 tok/s
CPU only (dual-channel DDR5)60 GB/s~25 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen3:30b

Häufig gestellte Fragen

Qwen 3 30B-A3B Systemanforderungen — Kann ich es lokal ausführen?