Puis-je faire tourner OLMo 2 13B ?
OLMo 2 13B de Ai2 demande environ 12 GB de RAM avec la quantisation 4 bits recommandée (8.3 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~37 tok/s sur un NVIDIA RTX 3060 12GB.
Lecture des signaux matériels…
Notes pratiques
OLMo 2 13B est le modèle de chat entièrement ouvert d'Ai2, et son intérêt tient autant à sa traçabilité qu'à ses performances : les poids, les données d'entraînement et la recette sont tous publics sous licence Apache 2.0, ce qui vous permet de l'utiliser commercialement sans vous poser de questions sur les conditions. En quantification 4-bit, il pèse environ 8.3 GB, un peu juste pour une carte 12 GB une fois la surcharge prise en compte, mais il tient sans problème sur un GPU 16 GB ou dans la mémoire unifiée d'un Mac Apple Silicon. Si vous êtes à l'étroit, la build 2-bit descend à environ 5.7 GB. Comptez sur un plancher d'environ 12 GB de RAM.
À l'usage quotidien, il se comporte comme un partenaire de chat solide et posé. Sur une RTX 3060 12 GB, attendez-vous à environ 37 tokens par seconde en 4-bit, soit nettement plus vite que votre vitesse de lecture, et une 4090 pousse jusqu'à environ 103 tok/s. Un Max de série M tourne autour de 42 tok/s. Le point à garder en tête, c'est la fenêtre de contexte de 4K, qui reste réduite au regard des standards 2024-2025. Même au maximum, le modèle ne réclame qu'environ 9 GB au total, mais vous ne pourrez tout simplement pas lui donner de longs documents ou des historiques de conversation étendus sans tronquer : traitez-le donc comme un assistant pour échanges courts.
Dans sa catégorie de taille, OLMo 2 13B est le choix de l'ouverture des données plutôt que le champion de la capacité brute. Des modèles comme Qwen 3 14B et Phi-4 14B le devancent généralement sur le raisonnement et les tâches structurées, et tous deux offrent des fenêtres de contexte bien plus larges si les entrées longues comptent pour vous. Ministral 3 14B ajoute la vision, ce que OLMo ne propose pas. Ce qu'OLMo apporte et qu'aucun d'eux n'offre, c'est une véritable ouverture de bout en bout : si vous tenez à savoir exactement ce qui est entré dans votre modèle, ou si vous faites de la recherche et de la reproductibilité, c'est celui vers lequel se tourner. Apache 2.0 signifie aucune contrainte d'usage.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 5.7 GB | 12 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 8.3 GB | 12 GB | Recommandée |
| Q5_K_M | 5.65 | 9.7 GB | 16 GB | Élevée |
| Q8_0 | 8.5 | 14.6 GB | 24 GB | Quasi originale |
| F16 | 16 | 27.4 GB | 48 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.7 GB | ~9.0 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~37 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~103 tok/s |
| Apple M-series (base) | 100 GB/s | ~10 tok/s |
| Apple M-series Pro | 270 GB/s | ~28 tok/s |
| Apple M-series Max | 410 GB/s | ~42 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~6 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run olmo2:13bSources et téléchargements