Kann ich Nemotron 3 Super 120B-A12B lokal ausführen?
Nemotron 3 Super 120B-A12B von NVIDIA benötigt bei der empfohlenen 4-Bit-Quantisierung rund 96 GB RAM (72.8 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~48 tok/s auf einem Apple M-series Max.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
Nemotron 3 Super 120B-A12B ist NVIDIAs Mixture-of-Experts-Modell für alle, die Reasoning und Coding auf Frontier-Niveau auf eigener Hardware wollen und den nötigen Speicher dafür haben. Es trägt zwar 120B Parameter insgesamt, doch pro Token sind nur 12B aktiv, weshalb es deutlich schneller läuft, als seine Größe vermuten lässt, trotzdem aber Platz für das gesamte Modell verlangt. Genau das ist der Haken: Schon in 4-Bit-Quantisierung landet es bei rund 72.8 GB, und du brauchst mindestens 96 GB RAM, um es zu laden. Das ist kein Modell für eine 8-GB-GPU. Eine RTX 4090 mit 24 GB reicht nicht, und selbst eine 2-Bit-Variante mit etwa 50 GB bleibt unerreichbar. Ein Apple-Silicon-Rechner mit viel Unified Memory oder ein Server mit reichlich System-RAM ist die realistische Heimat dafür.
Im Alltag zahlt sich das MoE-Design aus. Auf einem Apple M Max kannst du mit rund 48 Tokens pro Sekunde rechnen, was sich für Chat, mehrstufiges Reasoning und Coding-Hilfe trotz des 120B-Labels wirklich interaktiv anfühlt. Schiebst du es mit DDR5 auf die CPU, fällst du auf etwa 7 Tokens pro Sekunde, brauchbar für Batch-Aufgaben, aber nicht für ein Live-Gespräch. Das Kontextfenster ist mit 1000K Tokens riesig, doch behandle das als Obergrenze, nicht als Einstellung, die du dauerhaft maximierst. Schon 128K zu füllen treibt den Gesamtspeicher auf rund 129.5 GB, sobald der KV-Cache einberechnet ist, sodass dir auf einem 96-GB-Rechner längst der Spielraum ausgeht, bevor du das beworbene Limit erreichst. Halte den Arbeitskontext maßvoll, sofern du nicht Speicher übrig hast.
Im Vergleich zu seinen nächsten Verwandten steht Nemotron 3 Super in interessanter Gesellschaft. Qwen 3.5 122B-A10B ist ein MoE ähnlicher Größe, das zusätzlich mit Bildern umgehen kann, was dieses Modell nicht beherrscht, sodass jenes bei Bildeingaben in der Regel die Nase vorn hat. Mistral Small 4 119B ist von der Größe her vergleichbar und ebenfalls multimodal. Falls deine Hardware nicht so weit reicht, ist das deutlich kleinere Nemotron 3 Nano 30B-A3B die schlanke Alternative derselben Familie und meist die pragmatische Wahl auf knapp ausgestatteten Maschinen. Supers herausragende Stärke ist es, Reasoning auf 120B-Niveau bei Geschwindigkeit auf 12B-Niveau zu liefern, für alle, die es hosten können. Ein Vorbehalt: Es wird unter der NVIDIA Open Model License ausgeliefert, prüfe also diese Bedingungen, bevor du dich kommerziell darauf verlässt, statt schlicht von klassischer Open-Source-Freiheit auszugehen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 50.3 GB | 96 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 72.8 GB | 96 GB | Empfohlen |
| Q5_K_M | 5.65 | 84.8 GB | 128 GB | Hoch |
| Q8_0 | 8.5 | 127.5 GB | 192 GB | Nahezu Original |
| F16 | 16 | 240.0 GB | 256 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~1.8 GB | ~74.6 GB |
| 8K Token | ~3.5 GB | ~76.3 GB |
| 32K Token | ~14.2 GB | ~87.0 GB |
| 128K Token | ~56.7 GB | ~129.5 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Passt nicht in den VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | Passt nicht in den VRAM |
| Apple M-series (base) | 100 GB/s | ~12 tok/s |
| Apple M-series Pro | 270 GB/s | ~32 tok/s |
| Apple M-series Max | 410 GB/s | ~48 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~7 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run nemotron-3-super:120b