← Alle ModelleMODELL-CHECK

Kann ich Llama 4 Scout lokal ausführen?

Llama 4 Scout von Meta benötigt bei der empfohlenen 4-Bit-Quantisierung rund 96 GB RAM (66.1 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~34 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Llama 4 Scout ist Metas Mixture-of-Experts-Modell, und der entscheidende Punkt ist die Lücke zwischen seinen beiden Größen. Es hat 109B Parameter insgesamt, leitet aber pro Token nur 17B davon aktiv an, läuft also mit dem Tempo eines 17B-Modells und beansprucht zugleich den Speicher der vollen 109B. Bei 4-Bit-Quantisierung sind das rund 66 GB auf der Festplatte, und zum Laden brauchst du mindestens 96 GB RAM oder Unified Memory. Das ist kein Modell für eine 24-GB-Consumer-GPU: Sowohl eine RTX 3060 als auch eine RTX 4090 passen es schlicht nicht. Realistisch braucht es eine Workstation oder einen voll ausgebauten Apple-Silicon-Rechner.

Auf einem Apple M Max mit genug Unified Memory läuft es bei 4-Bit mit etwa 34 Tokens pro Sekunde, also bequem schneller, als du liest, und völlig ausreichend für interaktiven Chat und seine Vision-Aufgaben. Auf der CPU mit DDR5 fällst du auf grob 5 Tokens pro Sekunde, brauchbar für Batch-Verarbeitung, aber zäh im Hin und Her. Der beworbene Kontext ist riesig, aber Vorsicht: Geht man in Richtung 128K Tokens, steigt der Gesamtspeicher auf etwa 120 GB, der lange Kontext ist also eine Frage des Hardware-Budgets, keine kostenlose Einstellung. Halte den genutzten Kontext moderat, sofern du keine Reserven übrig hast.

Gegenüber GPT-OSS 120B, dem anderen großen Modell dieser Klasse, ist Scout die multimodale Wahl, da es Bilder verarbeitet, während GPT-OSS beim reinen Reasoning meist die Nase vorn hat. Verglichen mit kleinen Geschwistern wie Llama 3.2 3B ist Scout eine völlig andere Liga: Jene laufen mit einem handytauglichen Footprint, dieses braucht einen Server. Seine herausragende Eigenschaft ist, ein wirklich schnelles, bildfähiges Modell in dieser Größenordnung zu sein. Ein Vorbehalt: Es wird unter der Llama Community License ausgeliefert, die Open-Weight ist, nicht Open-Source, prüfe also die Bedingungen, bevor du etwas Kommerzielles darauf aufbaust.

Technische Daten

Parameter109B (17B aktiv)
Kontextfenster10M Token
AnbieterMeta
LizenzLlama Community
Veröffentlicht2025-04
Am besten fürChat, Bilderkennung

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3545.6 GB64 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8566.1 GB96 GBEmpfohlen
Q5_K_M5.6577.0 GB128 GBHoch
Q8_08.5115.8 GB192 GBNahezu Original
F1616218.0 GB256 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.7 GB~67.8 GB
8K Token~3.4 GB~69.5 GB
32K Token~13.6 GB~79.7 GB
128K Token~54.3 GB~120.4 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/sPasst nicht in den VRAM
Apple M-series (base)100 GB/s~8 tok/s
Apple M-series Pro270 GB/s~22 tok/s
Apple M-series Max410 GB/s~34 tok/s
CPU only (dual-channel DDR5)60 GB/s~5 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run llama4:scout

Häufig gestellte Fragen

Llama 4 Scout Systemanforderungen — Kann ich es lokal ausführen?