← Alle ModelleMODELL-CHECK

Kann ich Gemma 3 4B lokal ausführen?

Gemma 3 4B von Google benötigt bei der empfohlenen 4-Bit-Quantisierung rund 6 GB RAM (2.6 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~117 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Gemma 3 4B ist Googles kleines Arbeitstier für alle, die einen leistungsfähigen lokalen Assistenten wollen, der zusätzlich Bilder versteht. Mit 4.3B Parametern liefert das Modell mehr, als man von einem 4B-Modell erwartet, und der Speicherbedarf ist winzig: Ein 4-Bit-Quant belegt rund 2.6 GB, und du brauchst nur etwa 6 GB RAM, um es auszuführen. Damit läuft es praktisch auf allem, was einen Puls hat: einer alten Laptop-GPU mit 8 GB, einem Apple-Silicon-Mac in der Basisvariante, sogar einer RTX 3060 mit 12 GB samt Luft nach oben. Wer Vision plus Chat ohne dicke Maschine sucht, hat hier den naheliegenden Einstiegspunkt.

Im Alltag fühlt es sich flott an. Auf einer RTX 3060 sind bei 4-Bit rund 117 Token pro Sekunde drin, auf einer RTX 4090 klettert das auf etwa 329 tok/s, sodass Antworten auf beiden Karten schneller streamen, als du lesen kannst. Ein Apple M Max liegt bei etwa 134 tok/s, und selbst reine CPU auf DDR5 schafft rund 20, was für kurze Prompts brauchbar ist. Das 128K-Kontextfenster ist echt, aber teuer: Füllst du es komplett, steigt der Gesamtspeicher auf etwa 15.3 GB. Halte auf einer kleinen GPU deinen Arbeitskontext daher bei ein paar Tausend Token oder greife zu einem kleineren Quant.

Gegen Qwen 3 4B ist der ehrliche Kompromiss klar: Qwen 3 hat bei Reasoning sowie strukturierten, mehrstufigen Aufgaben in der Regel die Nase vorn, während die Stärke von Gemma 3 4B bei Vision liegt. Nur wenige Modelle dieser Größe lesen Bilder wirklich, und genau das macht es zur ersten Wahl, wenn du auf bescheidener Hardware ein lokales multimodales Modell brauchst. Wird es dir zu klein, ist Gemma 3 12B der natürliche Schritt nach oben in derselben Familie. Ein Vorbehalt: Die Gemma-Lizenz ist Open-Weight, nicht Open-Source, und enthält Googles eigene Nutzungsbedingungen. Lies sie also, bevor du das Modell in einem Produkt auslieferst.

Technische Daten

Parameter4.3B
Kontextfenster128K Token
AnbieterGoogle
LizenzGemma
Veröffentlicht2025-03
Am besten fürChat, Bilderkennung

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.351.8 GB4 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.852.6 GB6 GBEmpfohlen
Q5_K_M5.653.0 GB6 GBHoch
Q8_08.54.6 GB8 GBNahezu Original
F16168.6 GB16 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.4 GB~3.0 GB
8K Token~0.8 GB~3.4 GB
32K Token~3.2 GB~5.8 GB
128K Token~12.7 GB~15.3 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~117 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~329 tok/s
Apple M-series (base)100 GB/s~33 tok/s
Apple M-series Pro270 GB/s~88 tok/s
Apple M-series Max410 GB/s~134 tok/s
CPU only (dual-channel DDR5)60 GB/s~20 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run gemma3

Häufig gestellte Fragen