← Alle ModelleMODELL-CHECK

Kann ich Llama 3.3 70B lokal ausführen?

Llama 3.3 70B von Meta benötigt bei der empfohlenen 4-Bit-Quantisierung rund 64 GB RAM (42.8 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~8 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Llama 3.3 70B ist das Modell, zu dem man greift, wenn ein 8B einfach nicht klug genug ist und man die passende Hardware dafür hat. Es ist ein dichtes Chat-Modell mit 70,6 Milliarden Parametern, und der Speicherbedarf spiegelt das wider: Selbst mit einer 4-Bit-Quantisierung landet es bei rund 42.8 GB, und für etwas Spielraum beim Laden sollten es mindestens 64 GB Systemspeicher sein. Mit einer 2-Bit-Quantisierung schrumpft es auf etwa 29.6 GB, doch das realistische Zuhause für dieses Modell ist eine Apple-Silicon-Maschine mit viel RAM oder ein Multi-GPU-System, nicht eine einzelne Consumer-Karte.

Im Alltag ist die ehrliche Einschränkung die Geschwindigkeit. Auf einem M-Series Max liegst du bei 4-Bit bei etwa 8 tok/s — das ist lesbar, aber langsam genug, dass man jede lange Antwort spürt; auf einer CPU mit DDR5 kriecht es bei rund 1 tok/s dahin. Das Kontextfenster von 128K ist wirklich groß, doch es zu füllen ist teuer: Bei vollen 128K steigt der gesamte Speicherbedarf auf etwa 87.5 GB, weit über den 42.8 GB, die allein die Gewichte benötigen. Halte den Arbeitskontext moderat, sofern du nicht Speicher im Überfluss hast.

Beachte, dass die aufgeführte RTX 3060 und die RTX 4090 dieses Modell in 4-Bit schlicht nicht fassen — eine einzelne Mainstream-GPU fällt also aus. Gegenüber DeepSeek R1 70B, das die gleiche Parameterzahl hat, ist R1 der Reasoning-Spezialist und liegt bei schwerer, mehrstufiger Mathematik meist vorn, während Llama 3.3 70B das zuverlässigere, breit kompatible Allzweck-Chat-Modell ist. Seine herausragende Eigenschaft: nahezu Flaggschiff-Qualität im Dialog aus offenen Gewichten. Ein Vorbehalt: Die Llama-Community-Lizenz ist Open-Weight, nicht echtes Open Source — prüfe daher Metas Bedingungen vor jedem kommerziellen Einsatz.

Technische Daten

Parameter70.6B
Kontextfenster128K Token
AnbieterMeta
LizenzLlama Community
Veröffentlicht2024-12
Am besten fürChat

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3529.6 GB48 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8542.8 GB64 GBEmpfohlen
Q5_K_M5.6549.9 GB64 GBHoch
Q8_08.575.0 GB96 GBNahezu Original
F1616141.2 GB192 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.4 GB~44.2 GB
8K Token~2.8 GB~45.6 GB
32K Token~11.2 GB~54.0 GB
128K Token~44.7 GB~87.5 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/sPasst nicht in den VRAM
Apple M-series (base)100 GB/s~2 tok/s
Apple M-series Pro270 GB/s~5 tok/s
Apple M-series Max410 GB/s~8 tok/s
CPU only (dual-channel DDR5)60 GB/s~1 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run llama3.3

Häufig gestellte Fragen