Puis-je faire tourner Gemma 3 1B ?
Gemma 3 1B de Google demande environ 3 GB de RAM avec la quantisation 4 bits recommandée (0.6 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~505 tok/s sur un NVIDIA RTX 3060 12GB.
Lecture des signaux matériels…
Notes pratiques
Gemma 3 1B est un tout petit modèle de chat signé Google, pensé pour les cas où l'on veut un assistant local qui se charge instantanément et tourne quasiment partout. En quantification 4 bits, il ne pèse qu'environ 0.6 GB, et même une version 8 bits reste autour de 1.1 GB : il tient donc dans 3 GB de RAM avec de la marge. Concrètement, il fonctionne sur un vieux portable, un appareil de type Raspberry Pi ou une puce de téléphone, sans jamais solliciter de GPU dédié. Pour du chat rapide, de la rédaction de brouillons ou une intégration dans une application où chaque mégaoctet compte, c'est le modèle vers lequel se tourner.
À l'usage quotidien, l'argument phare reste la vitesse brute. Sur une RTX 4090, il atteint environ 1413 tok/s, et une RTX 3060 plus courante tient encore près de 505 tok/s, avec un Apple M Max autour de 575 tok/s. Même en pur CPU sur de la DDR5, il gère à peu près 84 tok/s, soit plus vite que vous ne lisez. La fenêtre de contexte est de 32K, et contrairement aux modèles plus gros, vous pouvez en remplir une bonne partie sans vous ruiner : à 32K complets, l'ensemble occupe environ 2.2 GB au total, si bien que la mémoire n'est jamais le facteur limitant ici.
Soyons honnêtes sur sa taille : avec 1B de paramètres, ce n'est ni un modèle de raisonnement ni un modèle de code, et il perdra le fil sur de longues instructions en plusieurs étapes. Si vous avez la marge, Gemma 3 4B gère en général les requêtes plus difficiles et ajoute la vision, tandis que Llama 3.2 1B est l'alternative évidente à poids équivalent pour comparer sur du chat simple. La grande force de Gemma 3 1B, c'est d'être à peu près le plus petit modèle de chat réellement utilisable que vous puissiez faire tourner. Une réserve : il est distribué sous la licence Gemma de Google, à poids ouverts mais assortie de conditions propres au fournisseur, à lire donc avant tout déploiement commercial.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 0.4 GB | 2 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 0.6 GB | 3 GB | Recommandée |
| Q5_K_M | 5.65 | 0.7 GB | 3 GB | Élevée |
| Q8_0 | 8.5 | 1.1 GB | 3 GB | Quasi originale |
| F16 | 16 | 2.0 GB | 4 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.2 GB | ~0.8 GB |
| 8K tokens | ~0.4 GB | ~1.0 GB |
| 32K tokens | ~1.6 GB | ~2.2 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~505 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~1413 tok/s |
| Apple M-series (base) | 100 GB/s | ~140 tok/s |
| Apple M-series Pro | 270 GB/s | ~379 tok/s |
| Apple M-series Max | 410 GB/s | ~575 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~84 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run gemma3:1bSources et téléchargements
Ollama Library
Téléchargez et lancez le modèle avec une seule commande.
ollama.comHugging Face
Poids du modèle, fichiers et détails de la licence.
huggingface.coDépôt GitHub officiel
Code source, releases et issues de Google.
github.comGoogle — page officielle
Page officielle et documentation de Google.
ai.google.dev