← Alle ModelleMODELL-CHECK

Kann ich Llama 3.1 70B lokal ausführen?

Llama 3.1 70B von Meta benötigt bei der empfohlenen 4-Bit-Quantisierung rund 64 GB RAM (42.8 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~8 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Llama 3.1 70B greift man, wenn Assistenten der 8B-Klasse ständig zu kurz greifen und man echte Hardware dafür übrig hat. Bei 4-Bit wiegt es rund 42.8 GB, und der entscheidende Punkt ist, worauf es nicht passt: Eine 12 GB RTX 3060 und sogar eine 24 GB RTX 4090 fallen beide raus, weil schon die Gewichte allein überlaufen. Realistisch ist das eine Maschine mit mindestens 64 GB, und ein Mac Studio mit reichlich Unified Memory ist das unkomplizierteste Single-Box-Zuhause dafür. Wer knausern muss, geht auf eine 2-Bit-Quantisierung bei etwa 29.6 GB runter — bezahlt das aber mit Qualität.

Im Alltag wirkt es bedächtig statt flott. Auf einem Apple M-Max landest du bei 4-Bit bei ungefähr 8 tok/s — lesbar, aber langsamer als du sprichst — und auf einer DDR5-CPU kriecht es mit rund 1 tok/s dahin, brauchbar für Batch-Jobs und sonst kaum etwas. Das Kontextfenster von 128K ist echt, hier aber teuer: Füllt man es, steigt der Gesamtspeicher auf etwa 87.5 GB, deutlich über der 64-GB-Grenze. Halte den Arbeitskontext bescheiden, sofern du keine Reserven hast, sonst beginnt die Maschine zu swappen und die ohnehin magere Geschwindigkeit bricht zusammen.

Innerhalb der eigenen Familie ist das das Schwergewicht: Llama 3.2 3B und 1B sind die Modelle, die man tatsächlich auf einem Laptop laufen lässt, während man 70B nimmt, wenn Antwortqualität über Geschwindigkeit steht. Geht es dir wirklich um schrittweises Reasoning, zieht ein gleich großes DeepSeek R1 70B auf genau dieser Achse in der Regel vorbei, während dieses Llama auf Chat getrimmt ist. Seine Stärke ist das breite, ausgereifte Tooling und verlässliche Allzweck-Ausgabe. Ein Vorbehalt: Die Llama-Community-Lizenz ist open-weight, nicht open-source — prüfe also Metas Bedingungen, bevor du es in ein kommerzielles Produkt einbaust.

Technische Daten

Parameter70.6B
Kontextfenster128K Token
AnbieterMeta
LizenzLlama Community
Veröffentlicht2024-07
Am besten fürChat

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3529.6 GB48 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8542.8 GB64 GBEmpfohlen
Q5_K_M5.6549.9 GB64 GBHoch
Q8_08.575.0 GB96 GBNahezu Original
F1616141.2 GB192 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.4 GB~44.2 GB
8K Token~2.8 GB~45.6 GB
32K Token~11.2 GB~54.0 GB
128K Token~44.7 GB~87.5 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/sPasst nicht in den VRAM
Apple M-series (base)100 GB/s~2 tok/s
Apple M-series Pro270 GB/s~5 tok/s
Apple M-series Max410 GB/s~8 tok/s
CPU only (dual-channel DDR5)60 GB/s~1 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run llama3.1:70b

Häufig gestellte Fragen

Llama 3.1 70B Systemanforderungen — Kann ich es lokal ausführen?