Kann ich OLMo 2 13B lokal ausführen?
OLMo 2 13B von Ai2 benötigt bei der empfohlenen 4-Bit-Quantisierung rund 12 GB RAM (8.3 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~37 tok/s auf einem NVIDIA RTX 3060 12GB.
Hardware-Signale werden ausgelesen…
Praxis-Notizen
OLMo 2 13B ist das vollständig offene Chat-Modell von Ai2, und sein Reiz liegt ebenso sehr in der Herkunft wie in der Leistung: Gewichte, Trainingsdaten und das gesamte Rezept sind unter Apache 2.0 öffentlich, du kannst es also kommerziell einsetzen, ohne dir Gedanken über die Lizenzbedingungen zu machen. In 4-Bit-Quantisierung landet es bei rund 8.3 GB, was für eine 12-GB-Karte nach Abzug des Overheads etwas knapp ist, aber auf einer 16-GB-GPU oder im Unified Memory eines Apple-Silicon-Macs problemlos läuft. Wenn es eng wird, schrumpft die 2-Bit-Variante auf etwa 5.7 GB. Plane mit ungefähr 12 GB RAM als Untergrenze.
Im Alltag fühlt es sich wie ein solider, ausgeglichener Chat-Partner an. Auf einer RTX 3060 12 GB kannst du bei 4-Bit mit rund 37 Tokens pro Sekunde rechnen, bequem schneller als du liest, und eine 4090 treibt das auf etwa 103 tok/s. Ein M-series Max liegt bei knapp 42 tok/s. Worauf du immer achten solltest, ist das 4K-Kontextfenster, das nach den Maßstäben von 2024-2025 klein ausfällt. Selbst voll ausgereizt braucht das Modell nur etwa 9 GB insgesamt, aber du kannst ihm schlicht keine langen Dokumente oder ausufernde Chat-Verläufe füttern, ohne zu kürzen – behandle es also als Assistenten für kurze Wortwechsel.
Innerhalb seiner Größenklasse ist OLMo 2 13B die Wahl für offene Daten und nicht der Spitzenreiter bei der reinen Leistungsfähigkeit. Modelle wie Qwen 3 14B und Phi-4 14B liegen bei Reasoning und strukturierten Aufgaben meist vorn, und beide bringen deutlich größere Kontextfenster mit, falls dir lange Eingaben wichtig sind. Ministral 3 14B ergänzt Vision, was OLMo nicht bietet. Was OLMo dagegen liefert wie keines von ihnen, ist echte durchgängige Offenheit: Wenn dir wichtig ist, genau zu wissen, was in dein Modell eingeflossen ist, oder wenn du Forschung und Reproduzierbarkeitsarbeit machst, dann ist dies das Modell deiner Wahl. Apache 2.0 bedeutet keinerlei Nutzungsauflagen.
Technische Daten
Größe nach Quantisierung
| Quantisierung | Bits/Gewicht | Download | Min. RAM | Qualität |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.7 GB | 12 GB | Spürbarer Verlust |
| Q4_K_MEmpfohlen | 4.85 | 8.3 GB | 12 GB | Empfohlen |
| Q5_K_M | 5.65 | 9.7 GB | 16 GB | Hoch |
| Q8_0 | 8.5 | 14.6 GB | 24 GB | Nahezu Original |
| F16 | 16 | 27.4 GB | 48 GB | Original |
Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →
Speicherbedarf nach Kontextlänge
| Kontext | KV-Cache (geschätzt) | Gesamtspeicher (Q4) |
|---|---|---|
| 4K Token | ~0.7 GB | ~9.0 GB |
Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.
Geschätzte Geschwindigkeit nach Hardware
| Hardware | Bandbreite | ~Geschwindigkeit |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~37 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~103 tok/s |
| Apple M-series (base) | 100 GB/s | ~10 tok/s |
| Apple M-series Pro | 270 GB/s | ~28 tok/s |
| Apple M-series Max | 410 GB/s | ~42 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.
Lokal ausführen
Der einfachste Weg ist Ollama — ein Befehl und Sie chatten:
ollama run olmo2:13bQuellen & Downloads
Ollama Library
Laden und starten Sie das Modell mit einem einzigen Befehl.
ollama.comHugging Face
Modellgewichte, Dateien und Lizenzdetails.
huggingface.coOffizielles GitHub-Repository
Quellcode, Releases und Issues von Ai2.
github.comAi2 — offizielle Seite
Offizielle Seite und Dokumentation von Ai2.
allenai.org