← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner EXAONE 4.5 33B ?

EXAONE 4.5 33B de LG AI Research demande environ 32 GB de RAM avec la quantisation 4 bits recommandée (20.0 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~17 tok/s sur un Apple M-series Max.

Lecture des signaux matériels…

Notes pratiques

EXAONE 4.5 33B est le modèle de vision et de raisonnement de LG AI Research, et avec ses 33B de paramètres denses, il se place clairement dans la catégorie poids lourd de ce que l'on peut auto-héberger. Une quantification 4-bit pèse environ 20 GB, donc il ne tiendra absolument pas sur une carte de 12 GB comme une RTX 3060 ; il vous faut un GPU de 24 GB tel qu'une 4090, ou un Mac doté d'une grande quantité de mémoire unifiée. Le minimum pour le charger raisonnablement est d'environ 32 GB de RAM. Ce n'est pas un modèle pour ordinateur portable d'appoint. Il s'adresse à ceux qui veulent un assistant multimodal performant et disposent du matériel pour le faire tourner.

Au quotidien sur une 4090, il tourne autour de 43 tokens par seconde en 4-bit, ce qui reste confortable pour discuter et analyser des images, même si c'est nettement plus lourd qu'un petit modèle 8B. Sur un Apple M Max, vous obtenez environ 17 tokens par seconde, utilisable mais plus posé, et sur CPU avec de la DDR5 cela chute à environ 3 tokens par seconde, de quoi mettre votre patience à l'épreuve. La fenêtre de contexte de 256K est vaste, mais le piège vient de la mémoire : même à 128K de contexte, l'empreinte totale grimpe à environ 51.7 GB, si bien qu'une carte de 24 GB vous oblige à garder un contexte de travail modeste.

Face à Qwen3-VL 32B, la comparaison la plus proche dans sa catégorie, EXAONE rend généralement coup pour coup plutôt qu'il ne domine ; Qwen3-VL tend à offrir un outillage et une disponibilité de quantifications plus larges, tandis que Qwen 3 32B reste le choix plus léger si vous n'avez besoin que de raisonnement textuel. La grande force d'EXAONE est d'être un modèle réellement solide alliant vision et raisonnement dans un seul ensemble, signé par un grand laboratoire. La réserve importante concerne la licence : il est distribué sous l'EXAONE License, qui est non commerciale, vous ne pouvez donc pas l'utiliser en production ni dans aucun produit commercial. Réservez-le à la recherche, au prototypage et à un usage personnel.

Caractéristiques

Paramètres33B
Fenêtre de contexte256K tokens
ÉditeurLG AI Research
LicenceEXAONE License (NC)
Sortie2026-04
Idéal pourVision, Raisonnement, Chat

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.3513.8 GB24 GBPerte sensible
Q4_K_MRecommandée4.8520.0 GB32 GBRecommandée
Q5_K_M5.6523.3 GB32 GBÉlevée
Q8_08.535.1 GB48 GBQuasi originale
F161666.0 GB96 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~1.0 GB~21.0 GB
8K tokens~2.0 GB~22.0 GB
32K tokens~7.9 GB~27.9 GB
128K tokens~31.7 GB~51.7 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/sNe tient pas dans la VRAM
NVIDIA RTX 4090 24GB1008 GB/s~43 tok/s
Apple M-series (base)100 GB/s~4 tok/s
Apple M-series Pro270 GB/s~11 tok/s
Apple M-series Max410 GB/s~17 tok/s
CPU only (dual-channel DDR5)60 GB/s~3 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Questions fréquentes