← Alle ModelleMODELL-CHECK

Kann ich Nemotron 3 Nano 30B-A3B lokal ausführen?

Nemotron 3 Nano 30B-A3B von NVIDIA benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (19.2 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~160 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

Nemotron 3 Nano ist ein Mixture-of-Experts-Modell von NVIDIA für alle, die starken Chat, gutes Reasoning und solides Coding lokal nutzen wollen, ohne die vollen Kosten eines dichten Modells zu zahlen. Der Trick steckt im Namen: Es trägt insgesamt 31.6B Parameter, routet pro Token aber nur etwa 3.6B davon. Dadurch generiert es so schnell wie ein winziges Modell, denkt aber mit einem deutlich größeren. Was jeder MoE-Einsteiger schmerzhaft lernt: Du musst trotzdem das Ganze laden. Bei 4-Bit-Quantisierung sind das rund 19 GB an Gewichten, und du willst mindestens 32 GB RAM. Eine 12-GB-Karte wie die RTX 3060 fällt damit komplett raus.

Im Alltag zahlt sich der Active-Parameter-Trick wirklich aus. Auf einer RTX 4090 streamt das Modell mit rund 393 tok/s, was für ein derart fähiges Modell absurd schnell ist, und selbst ein Apple Silicon M Max liegt im Unified Memory bei etwa 160 tok/s. Reiner CPU-Betrieb auf DDR5 fällt auf rund 23 tok/s ab, brauchbar für Batch-Jobs, aber nicht für interaktiven Chat. Das Aushängeschild ist das Kontextfenster von 1.000K, aber behandle das als Plakatzahl: Schon bei 128K Kontext steigt der gesamte Speicherbedarf auf etwa 50 GB. Auf einer 32-GB-Maschine arbeitest du realistisch also mit einigen zehntausend Tokens, nicht mit einer Million.

Im Vergleich zur Konkurrenz ist Gemma 4 31B die flexiblere Wahl, wenn du Vision brauchst, denn Nemotron 3 Nano ist reines Text-Modell, und Granite 4.0 H Small ist eine dichte Alternative ähnlicher Größe, falls du dir die Speicher-Eigenheiten von MoE lieber ersparst. Was Nemotron am besten kann, ist Durchsatz pro Qualität: Nichts anderes in dieser Größenklasse generiert so schnell und bewältigt dabei noch mehrstufiges Reasoning. Eine Warnung, bevor du darauf aufbaust: Die NVIDIA Open Model-Lizenz ist Open-Weight, nicht echtes Open-Source. Lies die Bedingungen also genau, statt für den kommerziellen Einsatz Apache-artige Freiheiten anzunehmen.

Technische Daten

Parameter31.6B (3.6B aktiv)
Kontextfenster1M Token
AnbieterNVIDIA
LizenzNVIDIA Open Model
Veröffentlicht2025-12
Am besten fürChat, Logisches Denken, Programmieren

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3513.2 GB24 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8519.2 GB32 GBEmpfohlen
Q5_K_M5.6522.3 GB32 GBHoch
Q8_08.533.6 GB48 GBNahezu Original
F161663.2 GB96 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.0 GB~20.2 GB
8K Token~1.9 GB~21.1 GB
32K Token~7.8 GB~27.0 GB
128K Token~31.1 GB~50.3 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~393 tok/s
Apple M-series (base)100 GB/s~39 tok/s
Apple M-series Pro270 GB/s~105 tok/s
Apple M-series Max410 GB/s~160 tok/s
CPU only (dual-channel DDR5)60 GB/s~23 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run nemotron-3-nano:30b

Häufig gestellte Fragen