Kann ich Llama 4 Scout lokal ausführen?
Llama 4 Scout von Meta benötigt bei der empfohlenen 4-Bit-Quantisierung rund 96 GB RAM (66.1 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~34 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Llama 4 Scout ist Metas Mixture-of-Experts-Modell, und der entscheidende Punkt ist die Lücke zwischen seinen beiden Größen. Es hat 109B Parameter insgesamt, leitet aber pro Token nur 17B davon aktiv an, läuft also mit dem Tempo eines 17B-Modells und beansprucht zugleich den Speicher der vollen 109B. Bei 4-Bit-Quantisierung sind das rund 66 GB auf der Festplatte, und zum Laden brauchst du mindestens 96 GB RAM oder Unified Memory. Das ist kein Modell für eine 24-GB-Consumer-GPU: Sowohl eine RTX 3060 als auch eine RTX 4090 passen es schlicht nicht. Realistisch braucht es eine Workstation oder einen voll ausgebauten Apple-Silicon-Rechner.
Auf einem Apple M Max mit genug Unified Memory läuft es bei 4-Bit mit etwa 34 Tokens pro Sekunde, also bequem schneller, als du liest, und völlig ausreichend für interaktiven Chat und seine Vision-Aufgaben. Auf der CPU mit DDR5 fällst du auf grob 5 Tokens pro Sekunde, brauchbar für Batch-Verarbeitung, aber zäh im Hin und Her. Der beworbene Kontext ist riesig, aber Vorsicht: Geht man in Richtung 128K Tokens, steigt der Gesamtspeicher auf etwa 120 GB, der lange Kontext ist also eine Frage des Hardware-Budgets, keine kostenlose Einstellung. Halte den genutzten Kontext moderat, sofern du keine Reserven übrig hast.
Gegenüber GPT-OSS 120B, dem anderen großen Modell dieser Klasse, ist Scout die multimodale Wahl, da es Bilder verarbeitet, während GPT-OSS beim reinen Reasoning meist die Nase vorn hat. Verglichen mit kleinen Geschwistern wie Llama 3.2 3B ist Scout eine völlig andere Liga: Jene laufen mit einem handytauglichen Footprint, dieses braucht einen Server. Seine herausragende Eigenschaft ist, ein wirklich schnelles, bildfähiges Modell in dieser Größenordnung zu sein. Ein Vorbehalt: Es wird unter der Llama Community License ausgeliefert, die Open-Weight ist, nicht Open-Source, prüfe also die Bedingungen, bevor du etwas Kommerzielles darauf aufbaust.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 45.6 GB | 64 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 66.1 GB | 96 GB | Empfohlen |
| Q5_K_M | 5.65 | 77.0 GB | 128 GB | Hoch |
| Q8_0 | 8.5 | 115.8 GB | 192 GB | Nahezu Original |
| F16 | 16 | 218.0 GB | 256 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.7 GB | ~67.8 GB |
| 8K Token | ~3.4 GB | ~69.5 GB |
| 32K Token | ~13.6 GB | ~79.7 GB |
| 128K Token | ~54.3 GB | ~120.4 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Passt nicht in den VRAM |
| Apple M-series (base) | 100 GB/s | ~8 tok/s |
| Apple M-series Pro | 270 GB/s | ~22 tok/s |
| Apple M-series Max | 410 GB/s | ~34 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~5 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run llama4:scoutQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Meta.
github.comMeta — offizielle Seite
Offizielle Seite und Dokumentation von Meta.
llama.com