Kann ich GPT-OSS 120B lokal ausführen?
GPT-OSS 120B von OpenAI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 96 GB RAM (70.8 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~113 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
GPT-OSS 120B ist OpenAIs großes Open-Weight-Release für alle, die ein Chat- und Reasoning-Modell auf Frontier-Niveau komplett auf eigener Hardware betreiben wollen. Es ist als Mixture-of-Experts ausgelegt: Obwohl das vollständige Modell 116.8B Parameter hat, sind pro Token nur etwa 5.1B aktiv. Genau dieser Kniff hält es für seine Größe schnell – doch beim Speicher darfst du dich davon nicht täuschen lassen: Du musst trotzdem das gesamte Modell im RAM halten. Bei 4-Bit-Quantisierung sind das rund 71 GB, und für komfortablen Betrieb solltest du etwa 96 GB Arbeitsspeicher einplanen. Das ist kein Modell für eine Laptop-GPU.
In der Praxis heißt das: Eine RTX 3060 oder selbst eine 4090 reicht schlicht nicht aus. Realistisch betreiben lässt es sich also nur auf einer Apple-Silicon-Maschine mit viel Speicher oder einem CPU-System mit großem RAM. Auf einem M-Max kannst du mit rund 113 tok/s rechnen, was sich für ein Modell dieser Größe wirklich flott anfühlt. Auf CPU mit DDR5 fällst du auf etwa 16 tok/s zurück – brauchbar für Batch-Aufgaben, aber zu langsam für interaktiven Chat. Das Kontextfenster von 128K ist großzügig, doch es vollständig zu füllen treibt den Gesamtspeicher bei maximalem Kontext auf rund 127 GB. Plane also Reserve ein und betrachte diese Obergrenze nicht als deine normale Arbeitsgröße.
Im Vergleich zu seinesgleichen setzt GPT-OSS 120B stark auf Chat und Reasoning statt auf Coding oder Vision. Etwas wie Mistral Small 4 119B bietet dir daher im selben Speicherbudget meist mehr Bandbreite, wenn du Code oder Bildeingaben brauchst. Sein kleiner Ableger GPT-OSS 20B ist die Wahl, sobald 96 GB RAM nicht infrage kommen. Das herausragende Merkmal ist hier die Lizenz: Apache 2.0 bedeutet, dass du es kommerziell und produktiv einsetzen kannst, ohne Auflagen des Anbieters – das ist auf diesem Leistungsniveau selten und ein echter Grund, sich dafür zu entscheiden.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 48.9 GB | 64 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 70.8 GB | 96 GB | Empfohlen |
| Q5_K_M | 5.65 | 82.5 GB | 128 GB | Hoch |
| Q8_0 | 8.5 | 124.1 GB | 192 GB | Nahezu Original |
| F16 | 16 | 233.6 GB | 256 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.8 GB | ~72.6 GB |
| 8K Token | ~3.5 GB | ~74.3 GB |
| 32K Token | ~14.0 GB | ~84.8 GB |
| 128K Token | ~56.1 GB | ~126.9 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Passt nicht in den VRAM |
| Apple M-series (base) | 100 GB/s | ~27 tok/s |
| Apple M-series Pro | 270 GB/s | ~74 tok/s |
| Apple M-series Max | 410 GB/s | ~113 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~16 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run gpt-oss:120bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von OpenAI.
github.comOpenAI — offizielle Seite
Offizielle Seite und Dokumentation von OpenAI.
openai.com