Qwen3-Next 80B-A3B çalıştırabilir miyim?
Alibaba imzalı Qwen3-Next 80B-A3B, önerilen 4-bit nicemlemede yaklaşık 64 GB RAM ister (48.5 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~192 tok/s bekleyebilirsin.
Donanım sinyallerin okunuyor…
Gerçek dünya notları
Qwen3-Next 80B-A3B, Alibaba'nın bir mixture-of-experts (uzman karışımı) modeli ve manşetteki sayı işe yarar biçimde yanıltıcı: toplam 80B parametresi var ama her token için bunların yalnızca yaklaşık 3B'sini yönlendiriyor. Yani küçük bir modelin hızında üretim yaparken büyük bir modelin bilgisinden faydalanıyor. İşin püf noktası bellek. Modelin tamamını yine de RAM ya da VRAM'de tutman gerekiyor; dolayısıyla 4-bit niceleme (quant) ile yaklaşık 48.5 GB seviyesinde bile çalıştırmak için en az 64 GB lazım. Bu da tek bir tüketici GPU'sunu devre dışı bırakıp seni yüksek bellekli bir makineye yönlendiriyor.
Pratikte bu, oyuncu GPU'su değil, Apple Silicon ya da iş istasyonu modeli. Yeterli unified memory'ye sahip bir M Max üzerinde saniyede kabaca 192 token akıtıyor; bu, 80B sınıfı bir model için gerçekten hızlı ve insanların ona yönelmesinin başlıca sebebi. 12 GB'lık bir RTX 3060 ya da 24 GB'lık bir RTX 4090 modeli yükleyemiyor bile. DDR5 ile CPU üzerindeysen yaklaşık 28 tok/s ile yine çalıştırabilirsin; daha yavaş ama toplu işler için iş görür. 256K bağlam gerçek, ama açgözlü: 128K'ya doğru yüklendiğinde toplam bellek yaklaşık 95.8 GB'a çıkabiliyor, o yüzden doldurmadan önce pay bırak.
Bariz yoğun (dense) karşılaştırma olan Llama 3.1 70B ile kıyasladığında, Qwen3-Next boyutuna göre belirgin biçimde daha hızlı hissettiriyor; çünkü her adımda yalnızca 3B parametre aktifken Llama'nın 70B'nin tamamını çalıştırması gerekiyor. Sohbet ve akıl yürütmedeki kalite rekabetçi, ancak yoğun 70B modeller en zorlu çok adımlı promptlarda hâlâ üstünlüğü koruyabiliyor. Öne çıkan özelliği bu hız-boyut oranı: belleği barındıracak gücün varsa, küçük model gecikmesinde büyük model genişliği. Lisansı Apache 2.0, yani sağlayıcıya özgü bağlayıcı koşullar olmadan ticari olarak ve üretimde özgürce kullanabilirsin.
Teknik özellikler
Nicemlemeye göre boyut
| Nicemleme | Bit/ağırlık | İndirme | Min RAM | Kalite |
|---|---|---|---|---|
| Q2_K | 3.35 | 33.5 GB | 48 GB | Belirgin kayıp |
| Q4_K_MÖnerilen | 4.85 | 48.5 GB | 64 GB | Önerilen |
| Q5_K_M | 5.65 | 56.5 GB | 96 GB | Yüksek |
| Q8_0 | 8.5 | 85.0 GB | 128 GB | Orijinale yakın |
| F16 | 16 | 160.0 GB | 256 GB | Orijinal |
Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →
Bağlam uzunluğuna göre bellek ihtiyacı
| Bağlam | KV önbelleği (tahmini) | Toplam bellek (Q4) |
|---|---|---|
| 4K token | ~1.5 GB | ~50.0 GB |
| 8K token | ~3.0 GB | ~51.5 GB |
| 32K token | ~11.8 GB | ~60.3 GB |
| 128K token | ~47.3 GB | ~95.8 GB |
KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.
Donanıma göre tahmini hız
| Donanım | Bant genişliği | ~Hız |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | VRAM'e sığmaz |
| NVIDIA RTX 4090 24GB | 1008 GB/s | VRAM'e sığmaz |
| Apple M-series (base) | 100 GB/s | ~47 tok/s |
| Apple M-series Pro | 270 GB/s | ~126 tok/s |
| Apple M-series Max | 410 GB/s | ~192 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~28 tok/s |
Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.
Yerel çalıştır
En kolay yol Ollama — tek komutla sohbete başla:
ollama run qwen3-next:80b