← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner DeepSeek R1 8B ?

DeepSeek R1 8B de DeepSeek demande environ 8 GB de RAM avec la quantisation 4 bits recommandée (4.9 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~63 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

DeepSeek R1 8B est un modèle pensé d'abord pour le raisonnement, pas un assistant de conversation généraliste, et c'est un point à garder en tête avant de le télécharger. C'est un modèle dense de 8B : en 4-bit il pèse environ 4.9 GB et tient sur un GPU de 8 GB avec de la marge ; le minimum annoncé de 8 GB de RAM le rend exploitable sur un PC de bureau modeste ou n'importe quel Mac Apple Silicon à mémoire unifiée. La licence MIT, c'est la partie simple : usage commercial, en production, sans aucune contrainte du fournisseur. À sortir quand vous voulez un modèle qui réfléchit à un problème plutôt qu'un modèle qui se contente de répondre vite.

Au quotidien, il paraît rapide pour sa taille sur du vrai matériel. Une RTX 3060 12GB atteint environ 63 tok/s, une puce M-series Max autour de 72 tok/s, et une 4090 à peu près 177 tok/s, donc le streaming ne crée jamais de goulot d'étranglement. Sur CPU en DDR5, on tombe à environ 11 tok/s : correct pour une requête ponctuelle, mais pas pour une boucle de travail. Le vrai bémol, c'est l'habitude du raisonnement explicite : R1 pense à voix haute, donc il consomme le contexte plus vite qu'un simple modèle de chat. La fenêtre de 128K est bien réelle, mais la remplir fait monter la mémoire totale à environ 21.7 GB ; gardez donc un contexte de travail raisonnable sauf si vous avez de la marge.

Pour être honnête sur son positionnement, c'est un modèle de raisonnement distillé, pas un cerveau de pointe glissé dans une petite boîte. Face à Llama 3.1 8B, il échange en général le poli conversationnel et la maturité de l'outillage contre un raisonnement étape par étape plus solide ; et les DeepSeek R1 7B et 1.5B plus légers existent si vous voulez descendre en taille, au prix de la profondeur. Sa vraie force, c'est cette trace de raisonnement visible, réellement utile en maths, en logique et en débogage, là où l'on veut voir le cheminement. Si vous voulez surtout du chat décontracté et rapide, un modèle 8B optimisé pour le chat reste le meilleur choix par défaut ; mais si vous voulez un modèle local qui raisonne, R1 8B mérite sa place.

Caractéristiques

Paramètres8B
Fenêtre de contexte128K tokens
ÉditeurDeepSeek
LicenceMIT
Sortie2025-01
Idéal pourRaisonnement

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.353.4 GB6 GBPerte sensible
Q4_K_MRecommandée4.854.9 GB8 GBRecommandée
Q5_K_M5.655.7 GB12 GBÉlevée
Q8_08.58.5 GB16 GBQuasi originale
F161616.0 GB24 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.5 GB~5.4 GB
8K tokens~1.0 GB~5.9 GB
32K tokens~4.2 GB~9.1 GB
128K tokens~16.8 GB~21.7 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~63 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~177 tok/s
Apple M-series (base)100 GB/s~18 tok/s
Apple M-series Pro270 GB/s~47 tok/s
Apple M-series Max410 GB/s~72 tok/s
CPU only (dual-channel DDR5)60 GB/s~11 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run deepseek-r1:8b

Questions fréquentes