Puis-je faire tourner Gemma 3 4B ?
Gemma 3 4B de Google demande environ 6 GB de RAM avec la quantisation 4 bits recommandée (2.6 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~117 tok/s sur un NVIDIA RTX 3060 12GB.
Lecture des signaux matériels…
Notes pratiques
Gemma 3 4B est le petit cheval de trait de Google, pensé pour qui veut un assistant local compétent capable, en prime, de comprendre les images. Avec ses 4,3 milliards de paramètres, il fait mieux que ce qu'on attend d'un modèle 4B, et son empreinte reste minuscule : une quantification 4 bits pèse environ 2.6 GB, et il suffit d'environ 6 GB de RAM pour le faire tourner. Autrement dit, il tient sur presque n'importe quel matériel un peu vivant : un vieux GPU portable de 8 GB, un Mac Apple Silicon d'entrée de gamme, voire un RTX 3060 de 12 GB avec de la marge. Si vous voulez la vision en plus du chat sans grosse machine, c'est le point de départ évident.
À l'usage quotidien, il est rapide. Sur un RTX 3060, comptez environ 117 tok/s en 4 bits, et sur un RTX 4090 cela grimpe à environ 329 tok/s : dans les deux cas, les réponses défilent plus vite que vous ne lisez. Un Apple M Max tourne autour de 134 tok/s, et même en CPU pur sur DDR5 il atteint environ 20 tok/s, ce qui reste exploitable pour des prompts courts. La fenêtre de contexte de 128K est bien réelle, mais coûteuse : remplissez-la entièrement et la mémoire totale grimpe à environ 15.3 GB. Sur un petit GPU, limitez donc votre contexte de travail à quelques milliers de tokens, ou passez à une quantification plus légère.
Face à Qwen 3 4B, l'arbitrage honnête est clair : Qwen 3 garde généralement l'avantage sur le raisonnement et les tâches structurées en plusieurs étapes, tandis que le point fort de Gemma 3 4B reste la vision. Peu de modèles aussi petits lisent vraiment les images, et cela seul en fait le bon choix quand il vous faut un modèle multimodal local sur du matériel modeste. Si vous le dépassez, Gemma 3 12B est la montée en gamme naturelle dans la même famille. Une réserve : la licence Gemma est à poids ouverts (open-weight), pas open-source, et impose les conditions d'utilisation propres à Google ; lisez-les donc avant de l'intégrer à un produit.
Caractéristiques
Taille selon la quantisation
| Quantisation | Bits/poids | Téléchargement | RAM min. | Qualité |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.8 GB | 4 GB | Perte sensible |
| Q4_K_MRecommandée | 4.85 | 2.6 GB | 6 GB | Recommandée |
| Q5_K_M | 5.65 | 3.0 GB | 6 GB | Élevée |
| Q8_0 | 8.5 | 4.6 GB | 8 GB | Quasi originale |
| F16 | 16 | 8.6 GB | 16 GB | Originale |
Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →
Mémoire nécessaire selon la longueur de contexte
| Contexte | Cache KV (est.) | Mémoire totale (Q4) |
|---|---|---|
| 4K tokens | ~0.4 GB | ~3.0 GB |
| 8K tokens | ~0.8 GB | ~3.4 GB |
| 32K tokens | ~3.2 GB | ~5.8 GB |
| 128K tokens | ~12.7 GB | ~15.3 GB |
Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.
Vitesse estimée selon le matériel
| Matériel | Bande passante | ~Vitesse |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~117 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~329 tok/s |
| Apple M-series (base) | 100 GB/s | ~33 tok/s |
| Apple M-series Pro | 270 GB/s | ~88 tok/s |
| Apple M-series Max | 410 GB/s | ~134 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~20 tok/s |
La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.
Le faire tourner en local
Le chemin le plus simple est Ollama — une commande et vous discutez :
ollama run gemma3Sources et téléchargements
Ollama Library
Téléchargez et lancez le modèle avec une seule commande.
ollama.comHugging Face
Poids du modèle, fichiers et détails de la licence.
huggingface.coDépôt GitHub officiel
Code source, releases et issues de Google.
github.comGoogle — page officielle
Page officielle et documentation de Google.
ai.google.dev