Gemma 3 4Bは動く?
GoogleのGemma 3 4Bは、推奨の4bit量子化で約6 GBのRAMが必要です(ダウンロードは2.6 GB)。あなたのハードウェアを下で即チェック — データは一切ブラウザの外に出ません。 NVIDIA RTX 3060 12GBならおよそ ~117 tok/s が目安です。
ハードウェア情報を読み取っています…
実際の使用メモ
Gemma 3 4B は、画像も理解できる有能なローカルアシスタントを求める人に向けた Google の小型主力モデルです。4.3B パラメータながら 4B クラスの想定を超える実力を持ち、フットプリントは非常に小さく抑えられています。4-bit 量子化なら約 2.6 GB、動作に必要な RAM はおよそ 6 GB 程度です。つまり、古い 8 GB のノート PC 向け GPU、エントリークラスの Apple Silicon Mac、さらには 12 GB の RTX 3060 でも余裕を持って動く、ほぼあらゆる環境に収まります。重いマシンなしでビジョンとチャットを両立させたいなら、ここが分かりやすい出発点になります。
日常的に使うと、その速さを実感できます。RTX 3060 では 4-bit で約 117 tok/s、RTX 4090 ではおよそ 329 tok/s まで伸びるため、どちらでも読む速度より速く応答がストリーミングされます。Apple M Max では約 134 tok/s、DDR5 搭載の純粋な CPU 実行でも約 20 tok/s 出るので、短いプロンプトなら実用的です。128K のコンテキストウィンドウは実在しますが、コストは高めです。完全に埋めると合計メモリは約 15.3 GB まで増えるため、小型 GPU では実作業のコンテキストを数千トークンに抑えるか、より小さい量子化に切り替えてください。
Qwen 3 4B との比較では、トレードオフは明快です。推論や構造化されたマルチステップのタスクでは概して Qwen 3 に分があり、一方で Gemma 3 4B の強みはビジョンにあります。これほど小さいモデルで本当に画像を読めるものは少なく、その点だけでも、控えめなハードウェアでローカルなマルチモーダルモデルが必要なときの有力な選択肢になります。手狭になってきたら、同じファミリーの Gemma 3 12B が自然なステップアップ先です。ひとつ注意点として、Gemma のライセンスはオープンソースではなくオープンウェイトで、Google 独自の利用規約が伴います。製品に組み込む前に必ず内容を確認してください。
スペック
量子化別サイズ
| 量子化 | ビット/重み | ダウンロード | 必要RAM | 品質 |
|---|---|---|---|---|
| Q2_K | 3.35 | 1.8 GB | 4 GB | 劣化が目立つ |
| Q4_K_M推奨 | 4.85 | 2.6 GB | 6 GB | 推奨 |
| Q5_K_M | 5.65 | 3.0 GB | 6 GB | 高品質 |
| Q8_0 | 8.5 | 4.6 GB | 8 GB | ほぼ原品質 |
| F16 | 16 | 8.6 GB | 16 GB | オリジナル |
サイズはパラメータ数×ビット/重みからの推定値です。実際のGGUFビルドとは多少異なります。 · データ更新日: 2026-06-11 · 数値の算出方法 →
コンテキスト長別の必要メモリ
| コンテキスト | KVキャッシュ(推定) | 合計メモリ(Q4) |
|---|---|---|
| 4K トークン | ~0.4 GB | ~3.0 GB |
| 8K トークン | ~0.8 GB | ~3.4 GB |
| 32K トークン | ~3.2 GB | ~5.8 GB |
| 128K トークン | ~12.7 GB | ~15.3 GB |
KVキャッシュはコンテキスト長に比例して増えます — 4Kで収まるモデルでも32Kではメモリ不足になることがあります。推定はgrouped-query attention使用時のFP16キャッシュを前提としており、実際の使用量はランタイムによって異なります。
ハードウェア別の推定速度
| ハードウェア | 帯域幅 | 速度の目安 |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | ~117 tok/s |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~329 tok/s |
| Apple M-series (base) | 100 GB/s | ~33 tok/s |
| Apple M-series Pro | 270 GB/s | ~88 tok/s |
| Apple M-series Max | 410 GB/s | ~134 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~20 tok/s |
トークン生成はメモリ帯域幅に律速されます:tok/s ≈ 帯域幅 × 0.85 ÷ Q4でのモデルサイズ。実際の数値はランタイムやコンテキスト長によって変わります。
ローカルで動かす
いちばん簡単なのはOllama — コマンド1つでチャットを始められます:
ollama run gemma3