Kann ich Llama 3.2 1B lokal ausführen?
Llama 3.2 1B von Meta benötigt bei der empfohlenen 4-Bit-Quantisierung rund 3 GB RAM (0.7 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~421 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Llama 3.2 1B ist das Modell, zu dem man greift, wenn man etwas Lokales will, das auf praktisch allem läuft. Mit 1.2B Parametern ist es winzig, und ein 4-Bit-Quant landet bei rund 0.7 GB – das passt in den Speicher eines Geräts auf Smartphone-Niveau, lastet ein Tablet oder ein schwaches Notebook nicht aus und braucht nur etwa 3 GB RAM, um bequem zu laufen. Das ist das Modell für On-Device-Chat, einfaches Vorformulieren und eingebettete Assistenten, bei denen jedes Gigabyte zählt und du nicht voraussetzen kannst, dass überhaupt eine GPU vorhanden ist.
Im Alltag ist die schiere Geschwindigkeit das Highlight. Auf einer RTX 3060 siehst du rund 421 tok/s, und selbst eine CPU mit DDR5 hält mit etwa 70 tok/s mit – schnell genug, um sich bei kurzen Antworten sofort anzufühlen. Der Haken ist das 128K-Kontextfenster: Es ist technisch da, aber es zu füllen treibt den Gesamtspeicher Richtung 7.8 GB, was den ganzen Sinn eines so leichten Modells zunichtemacht. Halte den Arbeitskontext bei ein paar Tausend Tokens, dann bleibt es das Fliegengewicht, für das du gekommen bist.
Sei ehrlich beim Limit: In dieser Größe meistert es kurzen, klar umrissenen Chat einwandfrei, verliert aber bei mehrstufigem Schlussfolgern, längeren Anweisungen und allem, was nach Code aussieht, den Faden. Wenn du den Spielraum hast, folgt Llama 3.2 3B komplexen Prompts in der Regel besser, und Gemma 3 1B ist der naheliegende Quervergleich in derselben Gewichtsklasse. Die herausragende Stärke des 1B ist seine schlichte Reichweite – es läuft, wo größere Modelle es schlicht nicht können. Ein Hinweis zur Lizenz: Es kommt unter der Llama Community Lizenz, die zwar Open-Weight ist, aber Metas eigene Bedingungen mitbringt – prüfe diese also, bevor du es in einem Produkt auslieferst.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.5 GB | 3 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 0.7 GB | 3 GB | Empfohlen |
| Q5_K_M | 5.65 | 0.8 GB | 3 GB | Hoch |
| Q8_0 | 8.5 | 1.3 GB | 4 GB | Nahezu Original |
| F16 | 16 | 2.4 GB | 6 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.2 GB | ~0.9 GB |
| 8K Token | ~0.4 GB | ~1.1 GB |
| 32K Token | ~1.8 GB | ~2.5 GB |
| 128K Token | ~7.1 GB | ~7.8 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~421 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~1178 tok/s |
| Apple M-series (base) | 100 GB/s | ~117 tok/s |
| Apple M-series Pro | 270 GB/s | ~315 tok/s |
| Apple M-series Max | 410 GB/s | ~479 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~70 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run llama3.2:1bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Meta.
github.comMeta — offizielle Seite
Offizielle Seite und Dokumentation von Meta.
llama.com