← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner Gemma 3 4B ?

Gemma 3 4B de Google demande environ 6 GB de RAM avec la quantisation 4 bits recommandée (2.6 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~117 tok/s sur un NVIDIA RTX 3060 12GB.

Lecture des signaux matériels…

Notes pratiques

Gemma 3 4B est le petit cheval de trait de Google, pensé pour qui veut un assistant local compétent capable, en prime, de comprendre les images. Avec ses 4,3 milliards de paramètres, il fait mieux que ce qu'on attend d'un modèle 4B, et son empreinte reste minuscule : une quantification 4 bits pèse environ 2.6 GB, et il suffit d'environ 6 GB de RAM pour le faire tourner. Autrement dit, il tient sur presque n'importe quel matériel un peu vivant : un vieux GPU portable de 8 GB, un Mac Apple Silicon d'entrée de gamme, voire un RTX 3060 de 12 GB avec de la marge. Si vous voulez la vision en plus du chat sans grosse machine, c'est le point de départ évident.

À l'usage quotidien, il est rapide. Sur un RTX 3060, comptez environ 117 tok/s en 4 bits, et sur un RTX 4090 cela grimpe à environ 329 tok/s : dans les deux cas, les réponses défilent plus vite que vous ne lisez. Un Apple M Max tourne autour de 134 tok/s, et même en CPU pur sur DDR5 il atteint environ 20 tok/s, ce qui reste exploitable pour des prompts courts. La fenêtre de contexte de 128K est bien réelle, mais coûteuse : remplissez-la entièrement et la mémoire totale grimpe à environ 15.3 GB. Sur un petit GPU, limitez donc votre contexte de travail à quelques milliers de tokens, ou passez à une quantification plus légère.

Face à Qwen 3 4B, l'arbitrage honnête est clair : Qwen 3 garde généralement l'avantage sur le raisonnement et les tâches structurées en plusieurs étapes, tandis que le point fort de Gemma 3 4B reste la vision. Peu de modèles aussi petits lisent vraiment les images, et cela seul en fait le bon choix quand il vous faut un modèle multimodal local sur du matériel modeste. Si vous le dépassez, Gemma 3 12B est la montée en gamme naturelle dans la même famille. Une réserve : la licence Gemma est à poids ouverts (open-weight), pas open-source, et impose les conditions d'utilisation propres à Google ; lisez-les donc avant de l'intégrer à un produit.

Caractéristiques

Paramètres4.3B
Fenêtre de contexte128K tokens
ÉditeurGoogle
LicenceGemma
Sortie2025-03
Idéal pourChat, Vision

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.351.8 GB4 GBPerte sensible
Q4_K_MRecommandée4.852.6 GB6 GBRecommandée
Q5_K_M5.653.0 GB6 GBÉlevée
Q8_08.54.6 GB8 GBQuasi originale
F16168.6 GB16 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.4 GB~3.0 GB
8K tokens~0.8 GB~3.4 GB
32K tokens~3.2 GB~5.8 GB
128K tokens~12.7 GB~15.3 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/s~117 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~329 tok/s
Apple M-series (base)100 GB/s~33 tok/s
Apple M-series Pro270 GB/s~88 tok/s
Apple M-series Max410 GB/s~134 tok/s
CPU only (dual-channel DDR5)60 GB/s~20 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run gemma3

Questions fréquentes

Configuration requise pour Gemma 3 4B — Puis-je le faire tourner en local ?