← モデル一覧へモデルチェック

Qwen 3.5 4Bは動く?

AlibabaのQwen 3.5 4Bは、推奨の4bit量子化で約6 GBのRAMが必要です(ダウンロードは2.4 GB)。あなたのハードウェアを下で即チェック — データは一切ブラウザの外に出ません。 NVIDIA RTX 3060 12GBならおよそ ~126 tok/s が目安です。

ハードウェア情報を読み取っています…

実際の使用メモ

Qwen 3.5 4B は、ハードウェアにほとんど負荷をかけずに動く実用的なローカルアシスタントが欲しい人向けに作られた、小型で密(dense)なモデルです。4-bit 量子化ではサイズが約 2.4 GB に収まるため、ほぼすべての最新 GPU に余裕を持って載り、Apple Silicon Mac のユニファイドメモリ上でも快適に動作します。最小要件が 6 GB RAM なので、少し古いノート PC でも動かせます。さらにチャットだけでなくビジョン(画像)処理にも対応しており、このサイズでは珍しい特徴です。ライセンスは Apache 2.0 で、商用利用も本番(production)環境での利用も制約なしに行えます。

日常利用では十分に高速です。RTX 4090 では毎秒およそ 353 tok/s、ミドルレンジの RTX 3060 でも約 126 tok/s 出るため、どちらも読む速度をはるかに上回ります。M シリーズの Max は 144 tok/s あたりで、DDR5 上の CPU のみでも、気長に待てるなら約 21 tok/s を確保できます。256K のコンテキストウィンドウは余裕がありますが、これは標準値ではなく余裕分(ヘッドルーム)と捉えてください。ウィンドウを埋めるほどメモリ消費は急激に増え、128K コンテキストでは合計フットプリントが約 14.7 GB に達します。これは多くのコンシューマー向けカードの容量を超えるため、メモリに余裕がない限り作業コンテキストは控えめに保ってください。

同じファミリー内では、スマートフォンや組み込み(embedded)用途に向いた小型の Qwen 3 1.7B や 0.6B のかなり上に位置します。これらは主力アシスタントというより、そうした用途に適したモデルです。Phi-4 Mini 3.8B と比べると、Qwen 3.5 4B はビジョン対応とより長いコンテキストのおかげで全般に守備範囲が広く感じられ、一方の Phi-4 Mini は範囲を絞った推論タスクで健闘します。ここで際立つのは、このフットプリントが生む価値です。完全に自由なライセンスの下、控えめなハードウェアで高速に動くマルチモーダルな 4B というのは稀な組み合わせであり、軽量なローカル構成における手軽な定番(デフォルト)の選択肢になっています。

スペック

パラメータ数4B
コンテキスト長256K トークン
開発元Alibaba
ライセンスApache 2.0
公開日2026-03
得意分野チャット, 画像認識

量子化別サイズ

量子化ビット/重みダウンロード必要RAM品質
Q2_K3.351.7 GB4 GB劣化が目立つ
Q4_K_M推奨4.852.4 GB6 GB推奨
Q5_K_M5.652.8 GB6 GB高品質
Q8_08.54.3 GB8 GBほぼ原品質
F16168.0 GB12 GBオリジナル

サイズはパラメータ数×ビット/重みからの推定値です。実際のGGUFビルドとは多少異なります。 · データ更新日: 2026-06-11 · 数値の算出方法 →

コンテキスト長別の必要メモリ

コンテキストKVキャッシュ(推定)合計メモリ(Q4)
4K トークン~0.4 GB~2.8 GB
8K トークン~0.8 GB~3.2 GB
32K トークン~3.1 GB~5.5 GB
128K トークン~12.3 GB~14.7 GB

KVキャッシュはコンテキスト長に比例して増えます — 4Kで収まるモデルでも32Kではメモリ不足になることがあります。推定はgrouped-query attention使用時のFP16キャッシュを前提としており、実際の使用量はランタイムによって異なります。

ハードウェア別の推定速度

ハードウェア帯域幅速度の目安
NVIDIA RTX 3060 12GB360 GB/s~126 tok/s
NVIDIA RTX 4090 24GB1008 GB/s~353 tok/s
Apple M-series (base)100 GB/s~35 tok/s
Apple M-series Pro270 GB/s~95 tok/s
Apple M-series Max410 GB/s~144 tok/s
CPU only (dual-channel DDR5)60 GB/s~21 tok/s

トークン生成はメモリ帯域幅に律速されます:tok/s ≈ 帯域幅 × 0.85 ÷ Q4でのモデルサイズ。実際の数値はランタイムやコンテキスト長によって変わります。

ローカルで動かす

いちばん簡単なのはOllama — コマンド1つでチャットを始められます:

ollama run qwen3.5:4b

よくある質問