← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner SmolLM2 1.7B ?

SmolLM2 1.7B de Hugging Face demande environ 3 GB de RAM avec la quantisation 4 bits recommandée (1.0 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~297 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

SmolLM2 1.7B est fait pour les cas où Llama 8B est démesuré : un modèle de chat vraiment minuscule que vous pouvez exécuter à peu près partout. En 4-bit, il pèse environ 1 GB, et il suffit d'à peu près 3 GB de RAM pour le charger avec sa marge de travail. Il tourne donc sur un Mac M1 d'entrée de gamme, un laptop bon marché, une carte de la classe Raspberry Pi, ou n'importe quel téléphone récent ayant un peu de place. Il est sous licence Apache 2.0, ce qui veut dire que vous pouvez l'utiliser commercialement et en production sans aucune contrainte côté fournisseur. Voyez-le comme le modèle que vous embarquez, pas celui avec lequel vous discutez toute la journée.

À l'usage quotidien, ce qui marque, c'est le débit brut. Sur un RTX 3060, il génère environ 297 tokens par seconde, un M Max grimpe à près de 338, et un 4090 atteint à peu près 831, bien plus vite que vous ne pouvez lire. Même sur un simple CPU DDR5, il tient autour de 49 tokens par seconde, ce qui reste parfaitement exploitable pour des réponses courtes sans aucun GPU. La vraie limite, c'est la fenêtre de contexte de 8K. C'est petit selon les standards actuels : très bien pour les questions isolées, la classification et les résumés courts, mais incapable de tenir un long document. La mémoire n'est pas un souci ici : même en remplissant les 8K, on ne dépasse qu'environ 1.5 GB au total.

Soyons honnêtes sur ce que vous apporte un 1.7B. Il gère le chat léger, la mise en forme et le suivi d'instructions simples, mais il flanche sur le raisonnement multi-étapes et les tâches de code plus longues. Qwen 3 1.7B le devance généralement sur les prompts plus difficiles et structurés, et DeepSeek R1 1.5B s'en sort mieux quand vous avez réellement besoin d'un raisonnement en chaîne de pensée (chain-of-thought) plutôt que de réponses rapides. Face à Llama 3.2 1B, il échange un peu de poids supplémentaire contre une sortie plus stable. Son atout phare, c'est l'efficacité : un assistant entièrement ouvert, utilisable commercialement, qui tourne vite sur du matériel qu'aucun autre modèle aussi capable ne pourrait viser. Tournez-vous vers lui quand l'empreinte compte plus que la profondeur.

Caractéristiques

Paramètres1.7B
Fenêtre de contexte8K tokens
ÉditeurHugging Face
LicenceApache 2.0
Sortie2024-11
Idéal pourChat

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.350.7 GB3 GBPerte sensible
Q4_K_MRecommandée4.851.0 GB3 GBRecommandée
Q5_K_M5.651.2 GB3 GBÉlevée
Q8_08.51.8 GB4 GBQuasi originale
F16163.4 GB6 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.3 GB~1.3 GB
8K tokens~0.5 GB~1.5 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~297 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~831 tok/s
Apple M-series (base)100 GB/s~82 tok/s
Apple M-series Pro270 GB/s~223 tok/s
Apple M-series Max410 GB/s~338 tok/s
CPU only (dual-channel DDR5)60 GB/s~49 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run smollm2

Questions fréquentes