Kann ich Llama 3.3 70B lokal ausführen?
Llama 3.3 70B von Meta benötigt bei der empfohlenen 4-Bit-Quantisierung rund 64 GB RAM (42.8 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~8 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Llama 3.3 70B ist das Modell, zu dem man greift, wenn ein 8B einfach nicht klug genug ist und man die passende Hardware dafür hat. Es ist ein dichtes Chat-Modell mit 70,6 Milliarden Parametern, und der Speicherbedarf spiegelt das wider: Selbst mit einer 4-Bit-Quantisierung landet es bei rund 42.8 GB, und für etwas Spielraum beim Laden sollten es mindestens 64 GB Systemspeicher sein. Mit einer 2-Bit-Quantisierung schrumpft es auf etwa 29.6 GB, doch das realistische Zuhause für dieses Modell ist eine Apple-Silicon-Maschine mit viel RAM oder ein Multi-GPU-System, nicht eine einzelne Consumer-Karte.
Im Alltag ist die ehrliche Einschränkung die Geschwindigkeit. Auf einem M-Series Max liegst du bei 4-Bit bei etwa 8 tok/s — das ist lesbar, aber langsam genug, dass man jede lange Antwort spürt; auf einer CPU mit DDR5 kriecht es bei rund 1 tok/s dahin. Das Kontextfenster von 128K ist wirklich groß, doch es zu füllen ist teuer: Bei vollen 128K steigt der gesamte Speicherbedarf auf etwa 87.5 GB, weit über den 42.8 GB, die allein die Gewichte benötigen. Halte den Arbeitskontext moderat, sofern du nicht Speicher im Überfluss hast.
Beachte, dass die aufgeführte RTX 3060 und die RTX 4090 dieses Modell in 4-Bit schlicht nicht fassen — eine einzelne Mainstream-GPU fällt also aus. Gegenüber DeepSeek R1 70B, das die gleiche Parameterzahl hat, ist R1 der Reasoning-Spezialist und liegt bei schwerer, mehrstufiger Mathematik meist vorn, während Llama 3.3 70B das zuverlässigere, breit kompatible Allzweck-Chat-Modell ist. Seine herausragende Eigenschaft: nahezu Flaggschiff-Qualität im Dialog aus offenen Gewichten. Ein Vorbehalt: Die Llama-Community-Lizenz ist Open-Weight, nicht echtes Open Source — prüfe daher Metas Bedingungen vor jedem kommerziellen Einsatz.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 29.6 GB | 48 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 42.8 GB | 64 GB | Empfohlen |
| Q5_K_M | 5.65 | 49.9 GB | 64 GB | Hoch |
| Q8_0 | 8.5 | 75.0 GB | 96 GB | Nahezu Original |
| F16 | 16 | 141.2 GB | 192 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.4 GB | ~44.2 GB |
| 8K Token | ~2.8 GB | ~45.6 GB |
| 32K Token | ~11.2 GB | ~54.0 GB |
| 128K Token | ~44.7 GB | ~87.5 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Passt nicht in den VRAM |
| Apple M-series (base) | 100 GB/s | ~2 tok/s |
| Apple M-series Pro | 270 GB/s | ~5 tok/s |
| Apple M-series Max | 410 GB/s | ~8 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~1 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run llama3.3Quellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Meta.
github.comMeta — offizielle Seite
Offizielle Seite und Dokumentation von Meta.
llama.com