Kann ich Qwen 3 1.7B lokal ausführen?
Qwen 3 1.7B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 3 GB RAM (1.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~297 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Qwen 3 1.7B ist ein winziges Chat-Modell für alle, die einen lokalen Assistenten wollen, der sofort lädt und die Hardware kaum belastet. Mit 4-Bit-Quantisierung belegt es nur etwa 1 GB auf der Festplatte, und das Ganze läuft in rund 3 GB RAM – es passt also auf so gut wie alles: ein altes Notebook, ein Board der Raspberry-Pi-Klasse, ein Smartphone oder eine schwache GPU, die man längst vergessen hat. Zu diesem Modell greift man, wenn man keine dedizierte Grafikkarte hat oder etwas im Hintergrund laufen lassen will, ohne sich überhaupt Gedanken über den Speicher zu machen.
Auf einer echten GPU ist es geradezu absurd schnell. Eine RTX 3060 schafft rund 297 Token pro Sekunde und eine 4090 überschreitet 831, während ein Apple-Silicon-M-Max bei etwa 338 liegt. Selbst reine CPU-Ausführung auf DDR5 erreicht noch rund 49 Token pro Sekunde – schneller, als man liest. Das Kontextfenster beträgt 32K, und anders als bei den Schwergewichten kann man es hier ohne größere Schmerzen tatsächlich ausreizen: Bei vollem 32K-Kontext liegt der Gesamtbedarf bei nur rund 3,1 GB, sodass auch eine bescheidene Maschine ein langes Gespräch bequem im Speicher hält.
Zeit für Ehrlichkeit: Mit 1.7B Parametern ist das ein Chat-Modell, keine Reasoning-Engine. Kurze Fragen und Antworten, Umformulierungen und einfaches Tool-Calling erledigt es problemlos, aber bei mehrstufiger Logik oder allem, was echte Planung erfordert, wird es brüchig. Wenn der Speicher reicht, schlussfolgert Qwen 3 4B in der Regel spürbar besser; wenn es noch enger ist, ist Qwen 3 0.6B der leichtere Schritt nach unten, während SmolLM2 1.7B ein gleich großer Konkurrent ist, den man abwägen sollte. Seine herausragende Stärke ist das Verhältnis von Geschwindigkeit zu Größe, und da es unter Apache 2.0 steht, kannst du es kommerziell und in der Produktion ohne Lizenzsorgen einsetzen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.7 GB | 3 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 1.0 GB | 3 GB | Empfohlen |
| Q5_K_M | 5.65 | 1.2 GB | 3 GB | Hoch |
| Q8_0 | 8.5 | 1.8 GB | 4 GB | Nahezu Original |
| F16 | 16 | 3.4 GB | 6 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.3 GB | ~1.3 GB |
| 8K Token | ~0.5 GB | ~1.5 GB |
| 32K Token | ~2.1 GB | ~3.1 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~297 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~831 tok/s |
| Apple M-series (base) | 100 GB/s | ~82 tok/s |
| Apple M-series Pro | 270 GB/s | ~223 tok/s |
| Apple M-series Max | 410 GB/s | ~338 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~49 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run qwen3:1.7bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Alibaba.
github.comAlibaba — offizielle Seite
Offizielle Seite und Dokumentation von Alibaba.
qwen.ai