Puis-je faire tourner EXAONE 4.5 33B ?
EXAONE 4.5 33B de LG AI Research demande environ 32 GB de RAM avec la quantisation 4 bits recommandée (20.0 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~17 tok/s sur un Apple M-series Max.
Lecture des signaux matériels…
Notes pratiques
EXAONE 4.5 33B est le modèle de vision et de raisonnement de LG AI Research, et avec ses 33B de paramètres denses, il se place clairement dans la catégorie poids lourd de ce que l'on peut auto-héberger. Une quantification 4-bit pèse environ 20 GB, donc il ne tiendra absolument pas sur une carte de 12 GB comme une RTX 3060 ; il vous faut un GPU de 24 GB tel qu'une 4090, ou un Mac doté d'une grande quantité de mémoire unifiée. Le minimum pour le charger raisonnablement est d'environ 32 GB de RAM. Ce n'est pas un modèle pour ordinateur portable d'appoint. Il s'adresse à ceux qui veulent un assistant multimodal performant et disposent du matériel pour le faire tourner.
Au quotidien sur une 4090, il tourne autour de 43 tokens par seconde en 4-bit, ce qui reste confortable pour discuter et analyser des images, même si c'est nettement plus lourd qu'un petit modèle 8B. Sur un Apple M Max, vous obtenez environ 17 tokens par seconde, utilisable mais plus posé, et sur CPU avec de la DDR5 cela chute à environ 3 tokens par seconde, de quoi mettre votre patience à l'épreuve. La fenêtre de contexte de 256K est vaste, mais le piège vient de la mémoire : même à 128K de contexte, l'empreinte totale grimpe à environ 51.7 GB, si bien qu'une carte de 24 GB vous oblige à garder un contexte de travail modeste.
Face à Qwen3-VL 32B, la comparaison la plus proche dans sa catégorie, EXAONE rend généralement coup pour coup plutôt qu'il ne domine ; Qwen3-VL tend à offrir un outillage et une disponibilité de quantifications plus larges, tandis que Qwen 3 32B reste le choix plus léger si vous n'avez besoin que de raisonnement textuel. La grande force d'EXAONE est d'être un modèle réellement solide alliant vision et raisonnement dans un seul ensemble, signé par un grand laboratoire. La réserve importante concerne la licence : il est distribué sous l'EXAONE License, qui est non commerciale, vous ne pouvez donc pas l'utiliser en production ni dans aucun produit commercial. Réservez-le à la recherche, au prototypage et à un usage personnel.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 13.8 GB | 24 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 20.0 GB | 32 GB | Recommandée |
| Q5_K_M | 5.65 | 23.3 GB | 32 GB | Élevée |
| Q8_0 | 8.5 | 35.1 GB | 48 GB | Quasi originale |
| F16 | 16 | 66.0 GB | 96 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~1.0 GB | ~21.0 GB |
| 8K tokens | ~2.0 GB | ~22.0 GB |
| 32K tokens | ~7.9 GB | ~27.9 GB |
| 128K tokens | ~31.7 GB | ~51.7 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | Ne tient pas dans la VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~43 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~11 tok/s |
| Apple M-series Max | 410 GB/s | ~17 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~3 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.