Kann ich Llama 3.1 70B lokal ausführen?
Llama 3.1 70B von Meta benötigt bei der empfohlenen 4-Bit-Quantisierung rund 64 GB RAM (42.8 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~8 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Llama 3.1 70B greift man, wenn Assistenten der 8B-Klasse ständig zu kurz greifen und man echte Hardware dafür übrig hat. Bei 4-Bit wiegt es rund 42.8 GB, und der entscheidende Punkt ist, worauf es nicht passt: Eine 12 GB RTX 3060 und sogar eine 24 GB RTX 4090 fallen beide raus, weil schon die Gewichte allein überlaufen. Realistisch ist das eine Maschine mit mindestens 64 GB, und ein Mac Studio mit reichlich Unified Memory ist das unkomplizierteste Single-Box-Zuhause dafür. Wer knausern muss, geht auf eine 2-Bit-Quantisierung bei etwa 29.6 GB runter — bezahlt das aber mit Qualität.
Im Alltag wirkt es bedächtig statt flott. Auf einem Apple M-Max landest du bei 4-Bit bei ungefähr 8 tok/s — lesbar, aber langsamer als du sprichst — und auf einer DDR5-CPU kriecht es mit rund 1 tok/s dahin, brauchbar für Batch-Jobs und sonst kaum etwas. Das Kontextfenster von 128K ist echt, hier aber teuer: Füllt man es, steigt der Gesamtspeicher auf etwa 87.5 GB, deutlich über der 64-GB-Grenze. Halte den Arbeitskontext bescheiden, sofern du keine Reserven hast, sonst beginnt die Maschine zu swappen und die ohnehin magere Geschwindigkeit bricht zusammen.
Innerhalb der eigenen Familie ist das das Schwergewicht: Llama 3.2 3B und 1B sind die Modelle, die man tatsächlich auf einem Laptop laufen lässt, während man 70B nimmt, wenn Antwortqualität über Geschwindigkeit steht. Geht es dir wirklich um schrittweises Reasoning, zieht ein gleich großes DeepSeek R1 70B auf genau dieser Achse in der Regel vorbei, während dieses Llama auf Chat getrimmt ist. Seine Stärke ist das breite, ausgereifte Tooling und verlässliche Allzweck-Ausgabe. Ein Vorbehalt: Die Llama-Community-Lizenz ist open-weight, nicht open-source — prüfe also Metas Bedingungen, bevor du es in ein kommerzielles Produkt einbaust.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 29.6 GB | 48 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 42.8 GB | 64 GB | Empfohlen |
| Q5_K_M | 5.65 | 49.9 GB | 64 GB | Hoch |
| Q8_0 | 8.5 | 75.0 GB | 96 GB | Nahezu Original |
| F16 | 16 | 141.2 GB | 192 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.4 GB | ~44.2 GB |
| 8K Token | ~2.8 GB | ~45.6 GB |
| 32K Token | ~11.2 GB | ~54.0 GB |
| 128K Token | ~44.7 GB | ~87.5 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Passt nicht in den VRAM |
| Apple M-series (base) | 100 GB/s | ~2 tok/s |
| Apple M-series Pro | 270 GB/s | ~5 tok/s |
| Apple M-series Max | 410 GB/s | ~8 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~1 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run llama3.1:70bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Meta.
github.comMeta — offizielle Seite
Offizielle Seite und Dokumentation von Meta.
llama.com