Kann ich Llama 3.2 3B lokal ausführen?
Llama 3.2 3B von Meta benötigt bei der empfohlenen 4-Bit-Quantisierung rund 4 GB RAM (1.9 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~158 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Llama 3.2 3B ist das Modell, zu dem man greift, wenn man einen echten Assistenten auf Hardware will, die kaum merkt, dass etwas läuft. Mit 4-Bit-Quantisierung landet es bei rund 1.9 GB und verlangt nur etwa 4 GB RAM, passt also praktisch auf alles: ein Einsteiger-Notebook, ein Board der Raspberry-Klasse mit genug Speicher, eine alte 6-GB-GPU oder jeden Apple-Silicon-Mac mit etwas Luft. Wenn dir die 8B-Familie für deine Maschine zu schwer ist, ist das die Stufe darunter, die Chat trotzdem wirklich brauchbar hält.
Im Alltag sticht vor allem das Tempo heraus. Auf einer RTX 3060 sind etwa 158 Tokens pro Sekunde drin, eine 4090 treibt das auf rund 442 hoch – deutlich schneller, als du lesen kannst; selbst eine DDR5-CPU schafft ungefähr 26 tok/s, falls du gar keine GPU hast. Das 128K-Kontextfenster steht zwar in den Specs, aber sei realistisch beim Speicher: füllt man es ganz aus, klettert der Gesamtverbrauch auf rund 13 GB, weit über den Ruheverbrauch des Modells. Halte den Arbeitskontext auf kleinen Maschinen daher bei ein paar Tausend Tokens.
Innerhalb der eigenen Familie tauscht Llama 3.2 3B Tiefe gegen Größe ein. Llama 3.1 8B meistert schwierigeres Reasoning und mehrstufige Anweisungen in der Regel besser, während das 1B-Geschwistermodell nur dann die Wahl ist, wenn dir wirklich der Speicher ausgeht und du schwächere Antworten in Kauf nimmst. Die eigentliche Stärke der 3B-Variante: Sie ist das kleinste Llama, das sich noch wie ein kompetenter Gesprächspartner anfühlt und nicht wie Spielzeug. Ein Vorbehalt: Sie kommt unter der Llama Community-Lizenz, die zwar Open-Weight ist, aber Metas eigene Bedingungen mitbringt – also kein klassisches Open Source. Prüfe diese Bedingungen, bevor du ein Produkt darauf aufbaust.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.3 GB | 4 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 1.9 GB | 4 GB | Empfohlen |
| Q5_K_M | 5.65 | 2.3 GB | 6 GB | Hoch |
| Q8_0 | 8.5 | 3.4 GB | 6 GB | Nahezu Original |
| F16 | 16 | 6.4 GB | 12 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.3 GB | ~2.2 GB |
| 8K Token | ~0.7 GB | ~2.6 GB |
| 32K Token | ~2.8 GB | ~4.7 GB |
| 128K Token | ~11.1 GB | ~13.0 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~158 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~442 tok/s |
| Apple M-series (base) | 100 GB/s | ~44 tok/s |
| Apple M-series Pro | 270 GB/s | ~118 tok/s |
| Apple M-series Max | 410 GB/s | ~180 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~26 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run llama3.2Quellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Meta.
github.comMeta — offizielle Seite
Offizielle Seite und Dokumentation von Meta.
llama.com