← Alle ModelleMODELL-CHECK

Kann ich Gemma 4 31B lokal ausführen?

Gemma 4 31B von Google benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (18.6 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~19 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Gemma 4 31B ist Googles mittelgroßes Open-Weight-Modell mit 30,7B Parametern, ausgelegt auf Chat, Coding, Reasoning und Vision in einem Paket. Das ist kein Modell für unterwegs auf dem Laptop. Bei 4-Bit-Quantisierung wiegt es rund 18,6 GB, und du brauchst mindestens 32 GB RAM, um es überhaupt zu laden – eine 12-GB-Karte wie die RTX 3060 reicht schlicht nicht aus. Sein realistisches Zuhause ist eine 24-GB-GPU wie die RTX 4090 oder ein Apple-Silicon-Mac mit reichlich Unified Memory. Wer einen fähigen Allrounder will und die Hardware hat, ist hier in der Klasse, in der lokale Modelle wirklich brauchbar werden.

Im Alltag ist es eher angenehm als rasant. Auf einer RTX 4090 kannst du mit etwa 46 Token pro Sekunde bei 4-Bit rechnen – schnell genug, um beim Streaming mitzulesen; auf einem Apple M Max pendelt es sich näher bei 19 Token pro Sekunde ein, immer noch passend für interaktives Arbeiten. Reines CPU-Inferencing auf DDR5 fällt auf grob 3 Token pro Sekunde ab, was nur etwas für Geduldige ist. Das 256K-Kontextfenster ist großzügig, aber teuer: Schon Richtung 128K schluckt es rund 49,3 GB Gesamtspeicher. Behandle das volle Fenster also als Obergrenze und halte den Arbeitskontext schlank, sofern du keine Reserven übrig hast.

Gegen Qwen 3 30B-A3B, einen fast identischen Verwandten mit 30,5B, ist der Unterschied architektonisch: Qwens Mixture-of-Experts-Design läuft pro Token tendenziell leichter, während Gemma 4 31B ein dichtes Modell ist, das bei jedem Durchlauf sein volles Gewicht nutzt und bei Vision und breiter Instruktionsbefolgung in der Regel souveräner wirkt. Wer etwas deutlich Kleineres sucht, greift mit Gemma 3 4B zur leichteren Variante. Das Besondere hier ist die Breite: ein Modell für Chat, Code, Reasoning und Bilder, unter einer sauberen Apache-2.0-Lizenz, die du kommerziell und im Produktivbetrieb ohne anbieterspezifische Einschränkungen einsetzen kannst.

Technische Daten

Parameter30.7B
Kontextfenster256K Token
AnbieterGoogle
LizenzApache 2.0
Veröffentlicht2026-04
Am besten fürChat, Programmieren, Logisches Denken, Bilderkennung

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3512.9 GB24 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8518.6 GB32 GBEmpfohlen
Q5_K_M5.6521.7 GB32 GBHoch
Q8_08.532.6 GB48 GBNahezu Original
F161661.4 GB96 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.0 GB~19.6 GB
8K Token~1.9 GB~20.5 GB
32K Token~7.7 GB~26.3 GB
128K Token~30.7 GB~49.3 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~46 tok/s
Apple M-series (base)100 GB/s~5 tok/s
Apple M-series Pro270 GB/s~12 tok/s
Apple M-series Max410 GB/s~19 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run gemma4:31b

Häufig gestellte Fragen