Kann ich Gemma 3 1B lokal ausführen?
Gemma 3 1B von Google benötigt bei der empfohlenen 4-Bit-Quantisierung rund 3 GB RAM (0.6 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~505 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Gemma 3 1B ist ein winziges Chat-Modell von Google, gemacht für die Fälle, in denen du einen lokalen Assistenten brauchst, der sofort lädt und praktisch überall läuft. Mit 4-Bit-Quantisierung sind es nur etwa 0,6 GB, und selbst ein 8-Bit-Build liegt bei rund 1,1 GB, sodass es mit reichlich Spielraum in 3 GB RAM passt. Das heißt: Es läuft auf einem alten Laptop, einem Gerät der Raspberry-Pi-Klasse oder einem Smartphone-Chip, ganz ohne dedizierte GPU. Wenn du etwas für schnellen Chat, Textentwürfe oder die Einbettung in eine App suchst, bei der jedes Megabyte zählt, ist das genau das richtige Modell.
Im Alltag ist das Aushängeschild die schiere Geschwindigkeit. Auf einer RTX 4090 schafft es rund 1413 Tokens pro Sekunde, und eine typischere RTX 3060 kommt immer noch auf etwa 505 tok/s, eine Apple M Max auf rund 575 tok/s. Selbst reine CPU auf DDR5 erreicht ungefähr 84 tok/s – schneller, als du lesen kannst. Das Kontextfenster umfasst 32K, und anders als bei größeren Modellen kannst du einen guten Teil davon günstig füllen: Bei den vollen 32K liegt das Ganze bei etwa 2,2 GB insgesamt, der Speicher ist hier also nie der limitierende Faktor.
Ehrlichkeit zur Größe ist wichtig: Mit 1B Parametern ist das kein Reasoning- oder Coding-Modell, und bei langen, mehrstufigen Anweisungen verliert es den roten Faden. Wenn du den Spielraum hast, kommt Gemma 3 4B in der Regel besser mit schwierigeren Prompts zurecht und bringt zusätzlich Vision mit, während Llama 3.2 1B die naheliegende Alternative gleicher Gewichtsklasse für reinen Chat ist, gegen die man vergleicht. Die herausragende Eigenschaft von Gemma 3 1B ist, dass es ungefähr das kleinste wirklich brauchbare Chat-Modell ist, das du betreiben kannst. Ein Vorbehalt: Es wird unter Googles Gemma-Lizenz ausgeliefert, die zwar Open-Weight ist, aber anbieterspezifische Bedingungen enthält – lies sie also, bevor du es kommerziell einsetzt.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.4 GB | 2 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 0.6 GB | 3 GB | Empfohlen |
| Q5_K_M | 5.65 | 0.7 GB | 3 GB | Hoch |
| Q8_0 | 8.5 | 1.1 GB | 3 GB | Nahezu Original |
| F16 | 16 | 2.0 GB | 4 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.2 GB | ~0.8 GB |
| 8K Token | ~0.4 GB | ~1.0 GB |
| 32K Token | ~1.6 GB | ~2.2 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~505 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~1413 tok/s |
| Apple M-series (base) | 100 GB/s | ~140 tok/s |
| Apple M-series Pro | 270 GB/s | ~379 tok/s |
| Apple M-series Max | 410 GB/s | ~575 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~84 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run gemma3:1bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Google.
github.comGoogle — offizielle Seite
Offizielle Seite und Dokumentation von Google.
ai.google.dev