← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner DeepSeek R1 1.5B ?

DeepSeek R1 1.5B de DeepSeek demande environ 3 GB de RAM avec la quantisation 4 bits recommandée (1.1 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~280 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

DeepSeek R1 1.5B est un modèle de raisonnement distillé, et le mot a son importance : il est conçu pour dérouler son raisonnement à voix haute face à un problème plutôt que pour bavarder avec aisance. Avec ses 1.8B de paramètres, il est minuscule. Une quantification en 4 bits tombe autour de 1.1 GB, et même la version 8 bits ne pèse que 1.9 GB, ce qui le fait tenir largement sous les 3 GB de RAM minimum. Autrement dit, il tourne partout : un vieux portable, une carte de la classe Raspberry Pi, un téléphone, ou comme assistant en arrière-plan qui touche à peine votre GPU. Récupérez-le avec ollama run deepseek-r1:1.5b et vous êtes opérationnel en quelques secondes.

À l'usage quotidien, il est vraiment rapide. Sur une RTX 3060, comptez environ 280 tokens par seconde, une 4090 grimpe à près de 785, et une puce Apple M-series Max se situe autour de 319 : la réponse visible dépend donc davantage de la durée de son raisonnement que de la vitesse brute. Même en CPU pur sur de la DDR5, il atteint à peu près 47 tokens par seconde. Le contexte de 128K est le piège : ce modèle consomme des tokens pour sa propre chaîne de pensée, et remplir cette fenêtre fait grimper la mémoire totale à environ 9.7 GB, bien au-delà de l'empreinte au repos. Gardez un contexte de travail modéré et laissez-le réfléchir par courtes salves.

Honnêtement, à cette taille, le raisonnement est aléatoire sur tout ce qui demande plusieurs étapes ; ses grands frères DeepSeek R1 7B et R1 8B sont bien plus fiables quand la réponse compte vraiment, et Qwen 3 1.7B est le meilleur choix si vous voulez surtout du chat classique plutôt qu'un raisonnement visible. Là où le 1.5B l'emporte, c'est l'accessibilité : c'est le moyen le plus léger de voir des traces de raisonnement à la R1 tourner en local, et il le fait sur du matériel où rien d'autre ne passe. La licence MIT est le bonus, totalement ouverte et libre d'usage commercial, sans aucune contrainte.

Caractéristiques

Paramètres1.8B
Fenêtre de contexte128K tokens
ÉditeurDeepSeek
LicenceMIT
Sortie2025-01
Idéal pourRaisonnement

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.350.8 GB3 GBPerte sensible
Q4_K_MRecommandée4.851.1 GB3 GBRecommandée
Q5_K_M5.651.3 GB4 GBÉlevée
Q8_08.51.9 GB4 GBQuasi originale
F16163.6 GB6 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.3 GB~1.4 GB
8K tokens~0.5 GB~1.6 GB
32K tokens~2.1 GB~3.2 GB
128K tokens~8.6 GB~9.7 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~280 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~785 tok/s
Apple M-series (base)100 GB/s~78 tok/s
Apple M-series Pro270 GB/s~210 tok/s
Apple M-series Max410 GB/s~319 tok/s
CPU only (dual-channel DDR5)60 GB/s~47 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run deepseek-r1:1.5b

Questions fréquentes

Configuration requise pour DeepSeek R1 1.5B — Puis-je le faire tourner en local ?