← Alle ModelleMODELL-CHECK

Kann ich Qwen 3 1.7B lokal ausführen?

Qwen 3 1.7B von Alibaba benötigt bei der empfohlenen 4-Bit-Quantisierung rund 3 GB RAM (1.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~297 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Qwen 3 1.7B ist ein winziges Chat-Modell für alle, die einen lokalen Assistenten wollen, der sofort lädt und die Hardware kaum belastet. Mit 4-Bit-Quantisierung belegt es nur etwa 1 GB auf der Festplatte, und das Ganze läuft in rund 3 GB RAM – es passt also auf so gut wie alles: ein altes Notebook, ein Board der Raspberry-Pi-Klasse, ein Smartphone oder eine schwache GPU, die man längst vergessen hat. Zu diesem Modell greift man, wenn man keine dedizierte Grafikkarte hat oder etwas im Hintergrund laufen lassen will, ohne sich überhaupt Gedanken über den Speicher zu machen.

Auf einer echten GPU ist es geradezu absurd schnell. Eine RTX 3060 schafft rund 297 Token pro Sekunde und eine 4090 überschreitet 831, während ein Apple-Silicon-M-Max bei etwa 338 liegt. Selbst reine CPU-Ausführung auf DDR5 erreicht noch rund 49 Token pro Sekunde – schneller, als man liest. Das Kontextfenster beträgt 32K, und anders als bei den Schwergewichten kann man es hier ohne größere Schmerzen tatsächlich ausreizen: Bei vollem 32K-Kontext liegt der Gesamtbedarf bei nur rund 3,1 GB, sodass auch eine bescheidene Maschine ein langes Gespräch bequem im Speicher hält.

Zeit für Ehrlichkeit: Mit 1.7B Parametern ist das ein Chat-Modell, keine Reasoning-Engine. Kurze Fragen und Antworten, Umformulierungen und einfaches Tool-Calling erledigt es problemlos, aber bei mehrstufiger Logik oder allem, was echte Planung erfordert, wird es brüchig. Wenn der Speicher reicht, schlussfolgert Qwen 3 4B in der Regel spürbar besser; wenn es noch enger ist, ist Qwen 3 0.6B der leichtere Schritt nach unten, während SmolLM2 1.7B ein gleich großer Konkurrent ist, den man abwägen sollte. Seine herausragende Stärke ist das Verhältnis von Geschwindigkeit zu Größe, und da es unter Apache 2.0 steht, kannst du es kommerziell und in der Produktion ohne Lizenzsorgen einsetzen.

Technische Daten

Parameter1.7B
Kontextfenster32K Token
AnbieterAlibaba
LizenzApache 2.0
Veröffentlicht2025-04
Am besten fürChat

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.350.7 GB3 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.851.0 GB3 GBEmpfohlen
Q5_K_M5.651.2 GB3 GBHoch
Q8_08.51.8 GB4 GBNahezu Original
F16163.4 GB6 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.3 GB~1.3 GB
8K Token~0.5 GB~1.5 GB
32K Token~2.1 GB~3.1 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~297 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~831 tok/s
Apple M-series (base)100 GB/s~82 tok/s
Apple M-series Pro270 GB/s~223 tok/s
Apple M-series Max410 GB/s~338 tok/s
CPU only (dual-channel DDR5)60 GB/s~49 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run qwen3:1.7b

Häufig gestellte Fragen

Qwen 3 1.7B Systemanforderungen — Kann ich es lokal ausführen?