Kann ich Qwen3-Next 80B-A3B lokal ausführen?
Qwen3-Next 80B-A3B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 64 GB RAM (48.5 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~192 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen3-Next 80B-A3B ist ein Mixture-of-Experts-Modell von Alibaba, und die plakative Zahl täuscht auf nützliche Weise: Es hat insgesamt 80B Parameter, aber pro Token werden nur rund 3B davon aktiviert. Dadurch generiert es so schnell wie ein winziges Modell und greift trotzdem auf das Wissen eines großen zurück. Der Haken ist der Speicher. Du musst das komplette Modell weiterhin im RAM oder VRAM halten, also brauchst du selbst mit einem 4-Bit-Quant von etwa 48.5 GB mindestens 64 GB, um es zu betreiben. Das schließt einzelne Consumer-GPUs aus und verweist dich stattdessen auf eine Maschine mit viel Speicher.
In der Praxis ist das ein Modell für Apple Silicon oder Workstations, nicht für Gaming-GPUs. Auf einem M Max mit genügend Unified Memory streamt es mit ungefähr 192 tok/s, was für ein Modell der 80B-Klasse wirklich flott ist und der Hauptgrund, warum man danach greift. Eine RTX 3060 mit 12 GB oder eine RTX 4090 mit 24 GB kann es schlicht nicht laden. Auf einer CPU mit DDR5 läuft es noch mit etwa 28 tok/s – langsamer, aber für Batch-Jobs brauchbar. Die 256K Kontext sind real, aber speicherhungrig: Wer Richtung 128K geht, kann den Gesamtspeicher auf rund 95.8 GB treiben, also plane Reserven ein, bevor du ihn füllst.
Im Vergleich zu Llama 3.1 70B, dem naheliegenden dichten Gegenstück, wirkt Qwen3-Next für seine Größe deutlich schneller, weil pro Schritt nur 3B Parameter aktiv sind, während Llama alle 70B durchrechnen muss. Bei Chat und Reasoning ist die Qualität konkurrenzfähig, auch wenn dichte 70B-Modelle bei den härtesten mehrschrittigen Prompts noch die Nase vorn haben können. Sein herausragendes Merkmal ist dieses Verhältnis von Geschwindigkeit zu Größe: die Breite eines großen Modells bei der Latenz eines kleinen, sofern du den Speicher zum Hosten hast. Die Lizenz ist Apache 2.0, du darfst es also frei kommerziell und in der Produktion einsetzen, ohne anbieterspezifische Auflagen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 33.5 GB | 48 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 48.5 GB | 64 GB | Empfohlen |
| Q5_K_M | 5.65 | 56.5 GB | 96 GB | Hoch |
| Q8_0 | 8.5 | 85.0 GB | 128 GB | Nahezu Original |
| F16 | 16 | 160.0 GB | 256 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.5 GB | ~50.0 GB |
| 8K Token | ~3.0 GB | ~51.5 GB |
| 32K Token | ~11.8 GB | ~60.3 GB |
| 128K Token | ~47.3 GB | ~95.8 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Passt nicht in den VRAM |
| Apple M-series (base) | 100 GB/s | ~47 tok/s |
| Apple M-series Pro | 270 GB/s | ~126 tok/s |
| Apple M-series Max | 410 GB/s | ~192 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~28 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3-next:80b