Puis-je faire tourner DeepSeek R1 1.5B ?
DeepSeek R1 1.5B de DeepSeek demande environ 3 GB de RAM avec la quantisation 4 bits recommandée (1.1 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~280 tok/s sur un NVIDIA RTX 3060 12GB.
Lecture des signaux matériels…
Notes pratiques
DeepSeek R1 1.5B est un modèle de raisonnement distillé, et le mot a son importance : il est conçu pour dérouler son raisonnement à voix haute face à un problème plutôt que pour bavarder avec aisance. Avec ses 1.8B de paramètres, il est minuscule. Une quantification en 4 bits tombe autour de 1.1 GB, et même la version 8 bits ne pèse que 1.9 GB, ce qui le fait tenir largement sous les 3 GB de RAM minimum. Autrement dit, il tourne partout : un vieux portable, une carte de la classe Raspberry Pi, un téléphone, ou comme assistant en arrière-plan qui touche à peine votre GPU. Récupérez-le avec ollama run deepseek-r1:1.5b et vous êtes opérationnel en quelques secondes.
À l'usage quotidien, il est vraiment rapide. Sur une RTX 3060, comptez environ 280 tokens par seconde, une 4090 grimpe à près de 785, et une puce Apple M-series Max se situe autour de 319 : la réponse visible dépend donc davantage de la durée de son raisonnement que de la vitesse brute. Même en CPU pur sur de la DDR5, il atteint à peu près 47 tokens par seconde. Le contexte de 128K est le piège : ce modèle consomme des tokens pour sa propre chaîne de pensée, et remplir cette fenêtre fait grimper la mémoire totale à environ 9.7 GB, bien au-delà de l'empreinte au repos. Gardez un contexte de travail modéré et laissez-le réfléchir par courtes salves.
Honnêtement, à cette taille, le raisonnement est aléatoire sur tout ce qui demande plusieurs étapes ; ses grands frères DeepSeek R1 7B et R1 8B sont bien plus fiables quand la réponse compte vraiment, et Qwen 3 1.7B est le meilleur choix si vous voulez surtout du chat classique plutôt qu'un raisonnement visible. Là où le 1.5B l'emporte, c'est l'accessibilité : c'est le moyen le plus léger de voir des traces de raisonnement à la R1 tourner en local, et il le fait sur du matériel où rien d'autre ne passe. La licence MIT est le bonus, totalement ouverte et libre d'usage commercial, sans aucune contrainte.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.8 GB | 3 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 1.1 GB | 3 GB | Recommandée |
| Q5_K_M | 5.65 | 1.3 GB | 4 GB | Élevée |
| Q8_0 | 8.5 | 1.9 GB | 4 GB | Quasi originale |
| F16 | 16 | 3.6 GB | 6 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.3 GB | ~1.4 GB |
| 8K tokens | ~0.5 GB | ~1.6 GB |
| 32K tokens | ~2.1 GB | ~3.2 GB |
| 128K tokens | ~8.6 GB | ~9.7 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~280 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~785 tok/s |
| Apple M-series (base) | 100 GB/s | ~78 tok/s |
| Apple M-series Pro | 270 GB/s | ~210 tok/s |
| Apple M-series Max | 410 GB/s | ~319 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~47 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run deepseek-r1:1.5bSources et téléchargements
Ollama Library
Téléchargez et lancez le modèle avec une seule commande.
ollama.comHugging Face
Poids du modèle, fichiers et détails de la licence.
huggingface.coDépôt GitHub officiel
Code source, releases et issues de DeepSeek.
github.comDeepSeek — page officielle
Page officielle et documentation de DeepSeek.
deepseek.com