← Alle ModelleMODELL-CHECK

Kann ich SmolLM2 1.7B lokal ausführen?

SmolLM2 1.7B von Hugging Face benötigt bei der empfohlenen 4-Bit-Quantisierung rund 3 GB RAM (1.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~297 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

SmolLM2 1.7B ist für genau die Fälle gedacht, in denen Llama 8B überdimensioniert wäre: ein wirklich winziges Chat-Modell, das du praktisch überall laufen lassen kannst. In 4-Bit-Quantisierung wiegt es rund 1 GB, und du brauchst nur etwa 3 GB RAM, um es mitsamt Arbeitsspeicher unterzubringen. Damit läuft es auf einem Basis-M1-Mac, einem Einsteiger-Laptop, einem Board der Raspberry-Pi-Klasse oder jedem modernen Smartphone mit etwas Luft. Es steht unter der Apache 2.0-Lizenz, du darfst es also kommerziell und produktiv einsetzen, ohne Auflagen seitens des Anbieters. Betrachte es als das Modell, das du einbettest, nicht als das, mit dem du den ganzen Tag chattest.

Im Alltag sticht vor allem der rohe Durchsatz heraus. Auf einer RTX 3060 läuft es mit etwa ~297 tok/s, ein M Max schafft rund ~338 tok/s und eine 4090 erreicht ungefähr ~831 tok/s, weit schneller, als du lesen kannst. Selbst auf einer schlichten DDR5-CPU bringt es noch etwa ~49 tok/s, was für kurze Antworten völlig ohne GPU bestens brauchbar ist. Die eigentliche Grenze ist das Kontextfenster von 8K. Nach heutigen Maßstäben ist das klein, also passt es für einzelne Fragen, Klassifikation und kurze Zusammenfassungen, ein langes Dokument hält es aber nicht. Der Speicher ist hier kein Thema: selbst voll ausgereizte 8K erreichen nur rund 1,5 GB insgesamt.

Sei ehrlich, was dir 1.7B einbringt. Es bewältigt leichtes Chatten, Formatierung und einfaches Befolgen von Anweisungen, schwächelt aber bei mehrstufigem Schlussfolgern und längeren Coding-Aufgaben. Qwen 3 1.7B hat bei schwierigeren, strukturierten Prompts in der Regel die Nase vorn, und DeepSeek R1 1.5B liegt meist vorne, wenn du tatsächlich Chain-of-Thought-Reasoning statt schneller Antworten brauchst. Gegenüber Llama 3.2 1B tauscht es etwas mehr Gewicht gegen gleichmäßigere Ausgabe. Seine herausragende Eigenschaft ist die Effizienz: ein vollständig offener, kommerziell nutzbarer Assistent, der schnell auf Hardware läuft, die nichts sonst derart Leistungsfähiges berührt. Greif dazu, wenn der Footprint wichtiger ist als die Tiefe.

Technische Daten

Parameter1.7B
Kontextfenster8K Token
AnbieterHugging Face
LizenzApache 2.0
Veröffentlicht2024-11
Am besten fürChat

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.350.7 GB3 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.851.0 GB3 GBEmpfohlen
Q5_K_M5.651.2 GB3 GBHoch
Q8_08.51.8 GB4 GBNahezu Original
F16163.4 GB6 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.3 GB~1.3 GB
8K Token~0.5 GB~1.5 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~297 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~831 tok/s
Apple M-series (base)100 GB/s~82 tok/s
Apple M-series Pro270 GB/s~223 tok/s
Apple M-series Max410 GB/s~338 tok/s
CPU only (dual-channel DDR5)60 GB/s~49 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run smollm2

Häufig gestellte Fragen

SmolLM2 1.7B Systemanforderungen — Kann ich es lokal ausführen?