Kann ich SmolLM2 1.7B lokal ausführen?
SmolLM2 1.7B von Hugging Face benötigt bei der empfohlenen 4-Bit-Quantisierung rund 3 GB RAM (1.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~297 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
SmolLM2 1.7B ist für genau die Fälle gedacht, in denen Llama 8B überdimensioniert wäre: ein wirklich winziges Chat-Modell, das du praktisch überall laufen lassen kannst. In 4-Bit-Quantisierung wiegt es rund 1 GB, und du brauchst nur etwa 3 GB RAM, um es mitsamt Arbeitsspeicher unterzubringen. Damit läuft es auf einem Basis-M1-Mac, einem Einsteiger-Laptop, einem Board der Raspberry-Pi-Klasse oder jedem modernen Smartphone mit etwas Luft. Es steht unter der Apache 2.0-Lizenz, du darfst es also kommerziell und produktiv einsetzen, ohne Auflagen seitens des Anbieters. Betrachte es als das Modell, das du einbettest, nicht als das, mit dem du den ganzen Tag chattest.
Im Alltag sticht vor allem der rohe Durchsatz heraus. Auf einer RTX 3060 läuft es mit etwa ~297 tok/s, ein M Max schafft rund ~338 tok/s und eine 4090 erreicht ungefähr ~831 tok/s, weit schneller, als du lesen kannst. Selbst auf einer schlichten DDR5-CPU bringt es noch etwa ~49 tok/s, was für kurze Antworten völlig ohne GPU bestens brauchbar ist. Die eigentliche Grenze ist das Kontextfenster von 8K. Nach heutigen Maßstäben ist das klein, also passt es für einzelne Fragen, Klassifikation und kurze Zusammenfassungen, ein langes Dokument hält es aber nicht. Der Speicher ist hier kein Thema: selbst voll ausgereizte 8K erreichen nur rund 1,5 GB insgesamt.
Sei ehrlich, was dir 1.7B einbringt. Es bewältigt leichtes Chatten, Formatierung und einfaches Befolgen von Anweisungen, schwächelt aber bei mehrstufigem Schlussfolgern und längeren Coding-Aufgaben. Qwen 3 1.7B hat bei schwierigeren, strukturierten Prompts in der Regel die Nase vorn, und DeepSeek R1 1.5B liegt meist vorne, wenn du tatsächlich Chain-of-Thought-Reasoning statt schneller Antworten brauchst. Gegenüber Llama 3.2 1B tauscht es etwas mehr Gewicht gegen gleichmäßigere Ausgabe. Seine herausragende Eigenschaft ist die Effizienz: ein vollständig offener, kommerziell nutzbarer Assistent, der schnell auf Hardware läuft, die nichts sonst derart Leistungsfähiges berührt. Greif dazu, wenn der Footprint wichtiger ist als die Tiefe.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.7 GB | 3 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 1.0 GB | 3 GB | Empfohlen |
| Q5_K_M | 5.65 | 1.2 GB | 3 GB | Hoch |
| Q8_0 | 8.5 | 1.8 GB | 4 GB | Nahezu Original |
| F16 | 16 | 3.4 GB | 6 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.3 GB | ~1.3 GB |
| 8K Token | ~0.5 GB | ~1.5 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~297 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~831 tok/s |
| Apple M-series (base) | 100 GB/s | ~82 tok/s |
| Apple M-series Pro | 270 GB/s | ~223 tok/s |
| Apple M-series Max | 410 GB/s | ~338 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~49 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run smollm2