Kann ich Gemma 3n E4B lokal ausführen?
Gemma 3n E4B von Google benötigt bei der empfohlenen 4-Bit-Quantisierung rund 8 GB RAM (4.7 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~126 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Gemma 3n E4B ist Googles kleines multimodales Modell für Chat und Vision und richtet sich gezielt an alle, die einen leistungsfähigen lokalen Assistenten wollen, der zusätzlich Bilder verarbeiten kann. Auf dem Papier hat es 7.8B Parameter, ist aber ein Mixture-of-Experts-Design: Pro Token werden nur etwa 4B aktiviert, sodass es spürbar schneller läuft, als seine Gesamtgröße vermuten lässt. In 4-Bit landet es bei rund 4.7 GB, passt damit bequem auf eine 8-GB-GPU wie eine RTX 3060 und liegt locker im Unified Memory jedes aktuellen Apple-Silicon-Macs. Der Haken bei MoE: Du musst trotzdem das gesamte Modell im Speicher halten, also plane unabhängig von der Zahl aktiver Experten mit mindestens 8 GB RAM.
Im Alltag fühlt es sich flott an. Auf einer RTX 3060 12GB sind in 4-Bit etwa 126 Tokens pro Sekunde drin, eine 4090 schiebt das auf rund 353 hoch, beides weit über Lesegeschwindigkeit; ein M-Series Max liegt bei etwa 144, und selbst reine CPU auf DDR5 schafft noch rund 21, brauchbar, wenn du es nicht eilig hast. Die Vision-Fähigkeit ist der eigentliche Grund, in dieser Größenklasse hierzu statt zu einem reinen Textmodell zu greifen. Der Kontext reicht bis 32K, komfortabel für Chat und Dokumenten-Q&A, aber kein Long-Context-Arbeitstier. Füllst du dieses Fenster, steigt der Gesamtspeicher auf rund 8.8 GB, halte den Arbeitskontext auf einer 8-GB-Karte also moderat.
Gegenüber Llama 3.1 8B, der naheliegenden reinen Textalternative in seiner Klasse, tauscht Gemma 3n E4B im Allgemeinen etwas reine Reasoning-Tiefe gegen zwei Dinge ein, die Llama bei diesem Footprint nicht bieten kann: natives Bildverständnis und den MoE-Geschwindigkeitsvorteil. Wenn du nur Text brauchst, ist Gemma 3 4B das leichtere Geschwistermodell und Llama 3.1 8B die sicherere Wahl für reinen Chat. Die Stärke von Gemma 3n E4B ist, ein wirklich nutzbares Vision-und-Chat-Modell zu sein, das noch in 8 GB passt. Ein Hinweis zur Lizenz: Die Gemma-Lizenz ist Open-Weight, nicht Open-Source, mit Googles eigenen Nutzungsbedingungen, lies sie also vor dem Ausliefern, auch wenn kommerzielle Nutzung erlaubt ist.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 3.3 GB | 6 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 4.7 GB | 8 GB | Empfohlen |
| Q5_K_M | 5.65 | 5.5 GB | 12 GB | Hoch |
| Q8_0 | 8.5 | 8.3 GB | 12 GB | Nahezu Original |
| F16 | 16 | 15.6 GB | 24 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.5 GB | ~5.2 GB |
| 8K Token | ~1.0 GB | ~5.7 GB |
| 32K Token | ~4.1 GB | ~8.8 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~126 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~353 tok/s |
| Apple M-series (base) | 100 GB/s | ~35 tok/s |
| Apple M-series Pro | 270 GB/s | ~95 tok/s |
| Apple M-series Max | 410 GB/s | ~144 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~21 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run gemma3nQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Google.
github.comGoogle — offizielle Seite
Offizielle Seite und Dokumentation von Google.
ai.google.dev