← Alle ModelleMODELL-CHECK

Kann ich EXAONE 4.5 33B lokal ausführen?

EXAONE 4.5 33B von LG AI Research benötigt bei der empfohlenen 4-Bit-Quantisierung rund 32 GB RAM (20.0 GB Download). Ihre Hardware wird unten geprüft — sofort, und nichts verlässt Ihren Browser. Rechnen Sie mit rund ~17 tok/s auf einem Apple M-series Max.

Hardware-Signale werden ausgelesen…

Praxis-Notizen

EXAONE 4.5 33B ist das Vision-und-Reasoning-Modell von LG AI Research, und mit 33B dichten Parametern spielt es klar in der Schwergewichtsklasse dessen, was sich selbst hosten lässt. Ein 4-Bit-Quant landet bei rund 20 GB und passt damit überhaupt nicht auf eine 12-GB-Karte wie eine RTX 3060; du brauchst eine 24-GB-GPU wie eine 4090 oder einen Mac mit reichlich Unified Memory. Das sinnvolle Minimum zum Laden liegt bei etwa 32 GB RAM. Das ist kein nebenbei laufendes Laptop-Modell. Es richtet sich an alle, die einen leistungsfähigen multimodalen Assistenten wollen und die passende Hardware dafür haben.

Im Alltag auf einer 4090 läuft es mit 4-Bit bei rund 43 Tokens pro Sekunde, was für Chat und das Lesen von Bildern komfortabel ist, aber spürbar schwerer als ein kleines 8B-Modell. Auf einem Apple M Max bewegst du dich bei etwa 17 Tokens pro Sekunde, nutzbar, aber bedächtiger, und auf der CPU mit DDR5 fällt es auf rund 3 Tokens pro Sekunde, was die Geduld strapaziert. Das 256K-Kontextfenster ist groß, doch der Haken ist der Speicher: schon bei 128K Kontext klettert der Gesamtbedarf auf etwa 51,7 GB, sodass eine 24-GB-Karte dich zwingt, den aktiven Kontext moderat zu halten.

Gegen Qwen3-VL 32B, den nächsten Vergleich in seiner Klasse, liefert EXAONE sich eher ein Kopf-an-Kopf-Rennen, als zu dominieren; Qwen3-VL bietet tendenziell breiteres Tooling und mehr Quant-Verfügbarkeit, während Qwen 3 32B die leichtere Wahl ist, wenn du nur Text-Reasoning brauchst. EXAONEs herausragende Stärke ist, ein wirklich starkes Modell aus Vision plus Reasoning in einem Paket von einem großen Lab zu sein. Der wichtige Vorbehalt ist die Lizenz: Es kommt unter der EXAONE License, die nicht-kommerziell (NC) ist, sodass du es nicht in Produktion oder in einem kommerziellen Produkt einsetzen darfst. Beschränke es auf Forschung, Prototyping und private Nutzung.

Technische Daten

Parameter33B
Kontextfenster256K Token
AnbieterLG AI Research
LizenzEXAONE License (NC)
Veröffentlicht2026-04
Am besten fürBilderkennung, Logisches Denken, Chat

Größe nach Quantisierung

QuantisierungBits/GewichtDownloadMin. RAMQualität
Q2_K3.3513.8 GB24 GBSpürbarer Verlust
Q4_K_MEmpfohlen4.8520.0 GB32 GBEmpfohlen
Q5_K_M5.6523.3 GB32 GBHoch
Q8_08.535.1 GB48 GBNahezu Original
F161666.0 GB96 GBOriginal

Die Größen sind Schätzungen aus Parameterzahl × Bits pro Gewicht; echte GGUF-Builds weichen leicht ab. · Daten aktualisiert: 2026-06-11 · So berechnen wir diese Zahlen →

Speicherbedarf nach Kontextlänge

KontextKV-Cache (geschätzt)Gesamtspeicher (Q4)
4K Token~1.0 GB~21.0 GB
8K Token~2.0 GB~22.0 GB
32K Token~7.9 GB~27.9 GB
128K Token~31.7 GB~51.7 GB

Der KV-Cache wächst mit der Kontextlänge — ein Modell, das bei 4K passt, kann bei 32K an die Speichergrenze stoßen. Die Schätzungen gehen von einem FP16-Cache mit Grouped-Query-Attention aus; der tatsächliche Verbrauch variiert je nach Runtime.

Geschätzte Geschwindigkeit nach Hardware

HardwareBandbreite~Geschwindigkeit
NVIDIA RTX 3060 12GB360 GB/sPasst nicht in den VRAM
NVIDIA RTX 4090 24GB1008 GB/s~43 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~11 tok/s
Apple M-series Max410 GB/s~17 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

Die Token-Generierung ist durch die Speicherbandbreite begrenzt: tok/s ≈ Bandbreite × 0,85 ÷ Modellgröße bei Q4. Reale Werte variieren je nach Runtime und Kontextlänge.

Häufig gestellte Fragen