Kann ich Gemma 3 27B lokal ausführen?
Gemma 3 27B von Google benötigt bei der empfohlenen 4-Bit-Quantisierung rund 24 GB RAM (16.6 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~21 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Gemma 3 27B ist das Modell, zu dem man greift, wenn ein Assistent der 8B-Klasse zu dünn wirkt und genug Speicher vorhanden ist. Es ist ein 27,4B-Chat-und-Vision-Modell von Google, das also Bilder genauso liest wie Text – und genau diese Fähigkeit ist der Hauptgrund, es einem reinen Textmodell gleicher Größe vorzuziehen. Mit einer 4-Bit-Quantisierung landet es bei rund 16,6 GB, weshalb eine 12-GB-Karte wie die RTX 3060 es schlicht nicht fasst; für komfortablen Betrieb solltest du mindestens 24 GB RAM oder Unified Memory einplanen. Eine RTX 4090 mit 24 GB oder ein M-Series-Mac mit reichlich Unified Memory ist sein natürlicher Platz.
Im Alltag wirkt es als deutlich fundierterer Gesprächspartner als die kleinen Modelle, und der multimodale Aspekt macht es wirklich nützlich, um Screenshots und Fotos zu beschreiben oder darüber zu schließen. Auf einer 4090 mit 4 Bit kannst du etwa 52 Tokens pro Sekunde erwarten, also schneller, als du liest; ein M-Max-Mac liegt eher bei 21 tok/s, immer noch sehr brauchbar, während reiner CPU-Betrieb auf DDR5 auf grob 3 tok/s fällt und eigentlich nur für Batch-Jobs taugt. Die 128K-Kontextlänge ist real, aber teuer: Sie voll auszunutzen treibt den Gesamtspeicher auf rund 45,8 GB, weit über das, was ein einzelnes 24-GB-Gerät hält – halte den genutzten Kontext also moderat, sofern du keine Reserven hast.
Innerhalb der eigenen Familie ist es das Schwergewicht; Gemma 3 4B ist die leichtere Wahl, wenn der Speicher knapp ist und du trotzdem Vision willst. Spannender ist der Vergleich mit Qwen 3.5 27B, einem nahezu gleich großen Modell mit dedizierten Stärken bei Reasoning und Coding; bei strukturierten Mathe- oder Code-Aufgaben hat es gegenüber Gemma meist die Nase vorn – Gemma 3 27B greifst du also eher für soliden Chat plus Bildverständnis als für anspruchsvolles Reasoning. Seine herausragende Eigenschaft ist diese Balance aus Vision und Chat bei einer handhabbaren Single-GPU-Größe. Ein Vorbehalt: Die Gemma-Lizenz ist open-weight, nicht open-source – lies also Googles Bedingungen, bevor du es in einem kommerziellen Produkt auslieferst.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 11.5 GB | 16 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 16.6 GB | 24 GB | Empfohlen |
| Q5_K_M | 5.65 | 19.4 GB | 32 GB | Hoch |
| Q8_0 | 8.5 | 29.1 GB | 48 GB | Nahezu Original |
| F16 | 16 | 54.8 GB | 96 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.9 GB | ~17.5 GB |
| 8K Token | ~1.8 GB | ~18.4 GB |
| 32K Token | ~7.3 GB | ~23.9 GB |
| 128K Token | ~29.2 GB | ~45.8 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~52 tok/s |
| Apple M-series (base) | 100 GB/s | ~5 tok/s |
| Apple M-series Pro | 270 GB/s | ~14 tok/s |
| Apple M-series Max | 410 GB/s | ~21 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run gemma3:27bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Google.
github.comGoogle — offizielle Seite
Offizielle Seite und Dokumentation von Google.
ai.google.dev