← Tous les modèlesTEST DU MODÈLE

Puis-je faire tourner GPT-OSS 20B ?

GPT-OSS 20B de OpenAI demande environ 24 GB de RAM avec la quantisation 4 bits recommandée (12.7 GB à télécharger). Votre matériel est vérifié ci-dessous — instantanément, rien ne quitte votre navigateur. Comptez environ ~160 tok/s sur un Apple M-series Max.

Lecture des signaux matériels…

Notes pratiques

GPT-OSS 20B est le modèle de raisonnement à poids ouverts d'OpenAI, et l'essentiel à comprendre, c'est qu'il s'agit d'un mixture-of-experts : sur ses 20.9B paramètres au total, seuls 3.6B s'activent par token. Il tourne donc bien plus vite qu'un modèle dense de 20B, mais il faut quand même garder l'ensemble en mémoire. En quantification 4 bits, il pèse environ 12.7 GB, et le plancher réaliste se situe autour de 24 GB de RAM. Il ne tient pas sur une carte 12 GB comme une RTX 3060 : concrètement, comptez sur un GPU de 24 GB type 4090, ou un Mac Apple Silicon doté d'une mémoire unifiée généreuse.

À l'usage quotidien, il paraît rapide pour sa taille, et c'est tout l'intérêt du MoE. Sur une RTX 4090, attendez-vous à environ 393 tokens par seconde, et sur une puce M-series Max à peu près 160 tok/s, dans les deux cas bien au-delà de la vitesse de lecture. En CPU seul sur de la DDR5, on retombe à environ 23 tok/s, utilisable pour des traitements par lots mais pas pour du chat interactif. La fenêtre de contexte de 128K est confortable, mais c'est elle qui grignote la mémoire en silence : remplissez-la entièrement et l'usage total grimpe à environ 38.5 GB une fois le cache KV chargé. Gardez un contexte de travail modeste sauf si vous avez de la marge, ou passez à la version q2 autour de 8.8 GB.

Il est conçu pour le chat et le raisonnement plutôt que pour le code : pour de la programmation, un modèle comme Codestral 22B vous rendra généralement de meilleurs services, et Mistral Small 3.1 24B est le choix à privilégier si vous voulez aussi de la vision. Son point fort, c'est la qualité de raisonnement pour seulement 3.6B paramètres actifs, et si vous cherchez plus de marge, le grand frère GPT-OSS 120B applique la même recette à plus grande échelle. La licence est Apache 2.0 : il est donc réellement libre d'utilisation, y compris en usage commercial et en production, sans aucune contrainte propre au fournisseur.

Caractéristiques

Paramètres20.9B (3.6B actifs)
Fenêtre de contexte128K tokens
ÉditeurOpenAI
LicenceApache 2.0
Sortie2025-08
Idéal pourChat, Raisonnement

Taille selon la quantisation

QuantisationBits/poidsTéléchargementRAM min.Qualité
Q2_K3.358.8 GB16 GBPerte sensible
Q4_K_MRecommandée4.8512.7 GB24 GBRecommandée
Q5_K_M5.6514.8 GB24 GBÉlevée
Q8_08.522.2 GB32 GBQuasi originale
F161641.8 GB64 GBOriginale

Les tailles sont estimées à partir du nombre de paramètres × bits par poids ; les builds GGUF réels varient légèrement. · Données mises à jour: 2026-06-11 · Comment nous calculons ces chiffres →

Mémoire nécessaire selon la longueur de contexte

ContexteCache KV (est.)Mémoire totale (Q4)
4K tokens~0.8 GB~13.5 GB
8K tokens~1.6 GB~14.3 GB
32K tokens~6.5 GB~19.2 GB
128K tokens~25.8 GB~38.5 GB

Le cache KV grossit avec la longueur du contexte — un modèle qui tient à 4K peut manquer de mémoire à 32K. Les estimations supposent un cache FP16 avec grouped-query attention ; l'usage réel varie selon le runtime.

Vitesse estimée selon le matériel

MatérielBande passante~Vitesse
NVIDIA RTX 3060 12GB360 GB/sNe tient pas dans la VRAM
NVIDIA RTX 4090 24GB1008 GB/s~393 tok/s
Apple M-series (base)100 GB/s~39 tok/s
Apple M-series Pro270 GB/s~105 tok/s
Apple M-series Max410 GB/s~160 tok/s
CPU only (dual-channel DDR5)60 GB/s~23 tok/s

La génération de tokens est limitée par la bande passante mémoire : tok/s ≈ bande passante × 0,85 ÷ taille du modèle en Q4. Les chiffres réels varient selon le runtime et la longueur du contexte.

Le faire tourner en local

Le chemin le plus simple est Ollama — une commande et vous discutez :

ollama run gpt-oss:20b

Questions fréquentes