← Alle ModelleMODELL-CHECK

Kann ich OLMo 2 13B lokal ausführen?

OLMo 2 13B von Ai2 benötigt bei der empfohlenen 4-Bit-Quantisierung rund 12 GB RAM (8.3 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~37 tok/s auf einem NVIDIA RTX 3060 12GB.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

OLMo 2 13B ist das vollständig offene Chat-Modell von Ai2, und sein Reiz liegt ebenso sehr in der Herkunft wie in der Leistung: Gewichte, Trainingsdaten und das gesamte Rezept sind unter Apache 2.0 öffentlich, du kannst es also kommerziell einsetzen, ohne dir Gedanken über die Lizenzbedingungen zu machen. In 4-Bit-Quantisierung landet es bei rund 8.3 GB, was für eine 12-GB-Karte nach Abzug des Overheads etwas knapp ist, aber auf einer 16-GB-GPU oder im Unified Memory eines Apple-Silicon-Macs problemlos läuft. Wenn es eng wird, schrumpft die 2-Bit-Variante auf etwa 5.7 GB. Plane mit ungefähr 12 GB RAM als Untergrenze.

Im Alltag fühlt es sich wie ein solider, ausgeglichener Chat-Partner an. Auf einer RTX 3060 12 GB kannst du bei 4-Bit mit rund 37 Tokens pro Sekunde rechnen, bequem schneller als du liest, und eine 4090 treibt das auf etwa 103 tok/s. Ein M-series Max liegt bei knapp 42 tok/s. Worauf du immer achten solltest, ist das 4K-Kontextfenster, das nach den Maßstäben von 2024-2025 klein ausfällt. Selbst voll ausgereizt braucht das Modell nur etwa 9 GB insgesamt, aber du kannst ihm schlicht keine langen Dokumente oder ausufernde Chat-Verläufe füttern, ohne zu kürzen – behandle es also als Assistenten für kurze Wortwechsel.

Innerhalb seiner Größenklasse ist OLMo 2 13B die Wahl für offene Daten und nicht der Spitzenreiter bei der reinen Leistungsfähigkeit. Modelle wie Qwen 3 14B und Phi-4 14B liegen bei Reasoning und strukturierten Aufgaben meist vorn, und beide bringen deutlich größere Kontextfenster mit, falls dir lange Eingaben wichtig sind. Ministral 3 14B ergänzt Vision, was OLMo nicht bietet. Was OLMo dagegen liefert wie keines von ihnen, ist echte durchgängige Offenheit: Wenn dir wichtig ist, genau zu wissen, was in dein Modell eingeflossen ist, oder wenn du Forschung und Reproduzierbarkeitsarbeit machst, dann ist dies das Modell deiner Wahl. Apache 2.0 bedeutet keinerlei Nutzungsauflagen.

Technische Daten

Parameter13.7B
Kontextfenster4K Token
AnbieterAi2
LizenzApache 2.0
Veröffentlicht2024-11
Am besten fürChat

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.355.7 GB12 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.858.3 GB12 GBEmpfohlen
Q5_K_M5.659.7 GB16 GBHoch
Q8_08.514.6 GB24 GBNahezu Original
F161627.4 GB48 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~0.7 GB~9.0 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/s~37 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~103 tok/s
Apple M-series (base)100 GB/s~10 tok/s
Apple M-series Pro270 GB/s~28 tok/s
Apple M-series Max410 GB/s~42 tok/s
CPU only (dual-channel DDR5)60 GB/s~6 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Lokal ausführen

Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:

ollama run olmo2:13b

Häufig gestellte Fragen

OLMo 2 13B Systemanforderungen — Kann ich es lokal ausführen?