← Alle ModelleMODELL-CHECK

Kann ich GPT-OSS 120B lokal ausführen?

GPT-OSS 120B von OpenAI benötigt bei der empfohlenen 4-Bit-Quantisierung rund 96 GB RAM (70.8 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~113 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

GPT-OSS 120B ist OpenAIs großes Open-Weight-Release für alle, die ein Chat- und Reasoning-Modell auf Frontier-Niveau komplett auf eigener Hardware betreiben wollen. Es ist als Mixture-of-Experts ausgelegt: Obwohl das vollständige Modell 116.8B Parameter hat, sind pro Token nur etwa 5.1B aktiv. Genau dieser Kniff hält es für seine Größe schnell – doch beim Speicher darfst du dich davon nicht täuschen lassen: Du musst trotzdem das gesamte Modell im RAM halten. Bei 4-Bit-Quantisierung sind das rund 71 GB, und für komfortablen Betrieb solltest du etwa 96 GB Arbeitsspeicher einplanen. Das ist kein Modell für eine Laptop-GPU.

In der Praxis heißt das: Eine RTX 3060 oder selbst eine 4090 reicht schlicht nicht aus. Realistisch betreiben lässt es sich also nur auf einer Apple-Silicon-Maschine mit viel Speicher oder einem CPU-System mit großem RAM. Auf einem M-Max kannst du mit rund 113 tok/s rechnen, was sich für ein Modell dieser Größe wirklich flott anfühlt. Auf CPU mit DDR5 fällst du auf etwa 16 tok/s zurück – brauchbar für Batch-Aufgaben, aber zu langsam für interaktiven Chat. Das Kontextfenster von 128K ist großzügig, doch es vollständig zu füllen treibt den Gesamtspeicher bei maximalem Kontext auf rund 127 GB. Plane also Reserve ein und betrachte diese Obergrenze nicht als deine normale Arbeitsgröße.

Im Vergleich zu seinesgleichen setzt GPT-OSS 120B stark auf Chat und Reasoning statt auf Coding oder Vision. Etwas wie Mistral Small 4 119B bietet dir daher im selben Speicherbudget meist mehr Bandbreite, wenn du Code oder Bildeingaben brauchst. Sein kleiner Ableger GPT-OSS 20B ist die Wahl, sobald 96 GB RAM nicht infrage kommen. Das herausragende Merkmal ist hier die Lizenz: Apache 2.0 bedeutet, dass du es kommerziell und produktiv einsetzen kannst, ohne Auflagen des Anbieters – das ist auf diesem Leistungsniveau selten und ein echter Grund, sich dafür zu entscheiden.

Technische Daten

Parameter116.8B (5.1B aktiv)
Kontextfenster128K Token
AnbieterOpenAI
LizenzApache 2.0
Veröffentlicht2025-08
Am besten fürChat, Logisches Denken

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3548.9 GB64 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8570.8 GB96 GBEmpfohlen
Q5_K_M5.6582.5 GB128 GBHoch
Q8_08.5124.1 GB192 GBNahezu Original
F1616233.6 GB256 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.8 GB~72.6 GB
8K Token~3.5 GB~74.3 GB
32K Token~14.0 GB~84.8 GB
128K Token~56.1 GB~126.9 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/sPasst nicht in den VRAM
Apple M-series (base)100 GB/s~27 tok/s
Apple M-series Pro270 GB/s~74 tok/s
Apple M-series Max410 GB/s~113 tok/s
CPU only (dual-channel DDR5)60 GB/s~16 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run gpt-oss:120b

Häufig gestellte Fragen