← Alle ModelleMODELL-CHECK

Kann ich Llama 3.2 1B lokal ausführen?

Llama 3.2 1B von Meta benötigt bei der empfohlenen 4-Bit-Quantisierung rund 3 GB RAM (0.7 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~421 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Llama 3.2 1B ist das Modell, zu dem man greift, wenn man etwas Lokales will, das auf praktisch allem läuft. Mit 1.2B Parametern ist es winzig, und ein 4-Bit-Quant landet bei rund 0.7 GB – das passt in den Speicher eines Geräts auf Smartphone-Niveau, lastet ein Tablet oder ein schwaches Notebook nicht aus und braucht nur etwa 3 GB RAM, um bequem zu laufen. Das ist das Modell für On-Device-Chat, einfaches Vorformulieren und eingebettete Assistenten, bei denen jedes Gigabyte zählt und du nicht voraussetzen kannst, dass überhaupt eine GPU vorhanden ist.

Im Alltag ist die schiere Geschwindigkeit das Highlight. Auf einer RTX 3060 siehst du rund 421 tok/s, und selbst eine CPU mit DDR5 hält mit etwa 70 tok/s mit – schnell genug, um sich bei kurzen Antworten sofort anzufühlen. Der Haken ist das 128K-Kontextfenster: Es ist technisch da, aber es zu füllen treibt den Gesamtspeicher Richtung 7.8 GB, was den ganzen Sinn eines so leichten Modells zunichtemacht. Halte den Arbeitskontext bei ein paar Tausend Tokens, dann bleibt es das Fliegengewicht, für das du gekommen bist.

Sei ehrlich beim Limit: In dieser Größe meistert es kurzen, klar umrissenen Chat einwandfrei, verliert aber bei mehrstufigem Schlussfolgern, längeren Anweisungen und allem, was nach Code aussieht, den Faden. Wenn du den Spielraum hast, folgt Llama 3.2 3B komplexen Prompts in der Regel besser, und Gemma 3 1B ist der naheliegende Quervergleich in derselben Gewichtsklasse. Die herausragende Stärke des 1B ist seine schlichte Reichweite – es läuft, wo größere Modelle es schlicht nicht können. Ein Hinweis zur Lizenz: Es kommt unter der Llama Community Lizenz, die zwar Open-Weight ist, aber Metas eigene Bedingungen mitbringt – prüfe diese also, bevor du es in einem Produkt auslieferst.

Technische Daten

Parameter1.2B
Kontextfenster128K Token
AnbieterMeta
LizenzLlama Community
Veröffentlicht2024-09
Am besten fürChat

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.350.5 GB3 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.850.7 GB3 GBEmpfohlen
Q5_K_M5.650.8 GB3 GBHoch
Q8_08.51.3 GB4 GBNahezu Original
F16162.4 GB6 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.2 GB~0.9 GB
8K Token~0.4 GB~1.1 GB
32K Token~1.8 GB~2.5 GB
128K Token~7.1 GB~7.8 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~421 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~1178 tok/s
Apple M-series (base)100 GB/s~117 tok/s
Apple M-series Pro270 GB/s~315 tok/s
Apple M-series Max410 GB/s~479 tok/s
CPU only (dual-channel DDR5)60 GB/s~70 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run llama3.2:1b

Häufig gestellte Fragen

Llama 3.2 1B Systemanforderungen — Kann ich es lokal ausführen?