Kann ich Gemma 4 12B lokal ausführen?
Gemma 4 12B von Google benötigt bei der empfohlenen 4-Bit-Quantisierung rund 12 GB RAM (7.3 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~42 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Gemma 4 12B ist ein dichtes 12B-Modell mit Vision-Fähigkeit für Chat, Coding und Reasoning, gedacht für alle, die einen leistungsfähigen lokalen Assistenten wollen, der zusätzlich Bilder versteht. In 4-Bit-Quantisierung landet es bei rund 7.3 GB und passt damit auf eine 12-GB-Karte wie die RTX 3060, mit etwas Luft für Kontext, und liegt bequem im Unified Memory eines Apple-Silicon-Mac. Zum Laden braucht das Modell mindestens etwa 12 GB RAM. Wenn es eng wird, schrumpft der 2-Bit-Build auf grob 5 GB, allerdings erkaufst du dir den Platz mit Qualitätsverlust.
Im Alltag liefert es etwa 42 tok/s auf einer RTX 3060, schnell genug zum Mitlesen, und rund 48 tok/s auf einem M-Series Max. Eine RTX 4090 schiebt es über 100. Das Kontextfenster von 256K ist großzügig, aber behandle es als Reserve, nicht als Standard. Schon bei 128K Kontext klettert das Modell samt KV-Cache auf insgesamt rund 27.4 GB, deutlich mehr als eine einzelne 12-GB-Karte fasst. Du lagerst dann in den Systemspeicher aus oder wirst spürbar langsamer. Halte den Arbeitskontext auf Consumer-Hardware bei ein paar tausend Tokens.
Gegenüber dem leichteren Gemma 3 4B schlägt sich das 12B bei mehrstufigem Reasoning und beim Coding meist besser, was der Preis für den höheren Speicherbedarf ist; Gemma 3 4B ist die Wahl, wenn du eingeschränkt bist oder nur Chat und Vision brauchst. Das Besondere hier: Vision und solides Text-Reasoning stecken in einem Modell, das immer noch auf einer Mittelklasse-GPU läuft. Auch die Lizenz ist sauber: Apache 2.0 bedeutet, du darfst es kommerziell und produktiv einsetzen, ohne anbieterspezifische Einschränkungen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.0 GB | 8 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 7.3 GB | 12 GB | Empfohlen |
| Q5_K_M | 5.65 | 8.5 GB | 16 GB | Hoch |
| Q8_0 | 8.5 | 12.8 GB | 24 GB | Nahezu Original |
| F16 | 16 | 24.0 GB | 32 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.6 GB | ~7.9 GB |
| 8K Token | ~1.3 GB | ~8.6 GB |
| 32K Token | ~5.0 GB | ~12.3 GB |
| 128K Token | ~20.1 GB | ~27.4 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~42 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~118 tok/s |
| Apple M-series (base) | 100 GB/s | ~12 tok/s |
| Apple M-series Pro | 270 GB/s | ~32 tok/s |
| Apple M-series Max | 410 GB/s | ~48 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~7 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run gemma4:12bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Google.
github.comGoogle — offizielle Seite
Offizielle Seite und Dokumentation von Google.
ai.google.dev