← Tüm modellerMODEL TESTİ

Qwen3-Next 80B-A3B çalıştırabilir miyim?

Alibaba imzalı Qwen3-Next 80B-A3B, önerilen 4-bit nicemlemede yaklaşık 64 GB RAM ister (48.5 GB indirme). Donanımın aşağıda anında test ediliyor — hiçbir şey tarayıcından çıkmaz. Apple M-series Max üzerinde yaklaşık ~192 tok/s bekleyebilirsin.

Donanım sinyallerin okunuyor…

Gerçek dünya notları

Qwen3-Next 80B-A3B, Alibaba'nın bir mixture-of-experts (uzman karışımı) modeli ve manşetteki sayı işe yarar biçimde yanıltıcı: toplam 80B parametresi var ama her token için bunların yalnızca yaklaşık 3B'sini yönlendiriyor. Yani küçük bir modelin hızında üretim yaparken büyük bir modelin bilgisinden faydalanıyor. İşin püf noktası bellek. Modelin tamamını yine de RAM ya da VRAM'de tutman gerekiyor; dolayısıyla 4-bit niceleme (quant) ile yaklaşık 48.5 GB seviyesinde bile çalıştırmak için en az 64 GB lazım. Bu da tek bir tüketici GPU'sunu devre dışı bırakıp seni yüksek bellekli bir makineye yönlendiriyor.

Pratikte bu, oyuncu GPU'su değil, Apple Silicon ya da iş istasyonu modeli. Yeterli unified memory'ye sahip bir M Max üzerinde saniyede kabaca 192 token akıtıyor; bu, 80B sınıfı bir model için gerçekten hızlı ve insanların ona yönelmesinin başlıca sebebi. 12 GB'lık bir RTX 3060 ya da 24 GB'lık bir RTX 4090 modeli yükleyemiyor bile. DDR5 ile CPU üzerindeysen yaklaşık 28 tok/s ile yine çalıştırabilirsin; daha yavaş ama toplu işler için iş görür. 256K bağlam gerçek, ama açgözlü: 128K'ya doğru yüklendiğinde toplam bellek yaklaşık 95.8 GB'a çıkabiliyor, o yüzden doldurmadan önce pay bırak.

Bariz yoğun (dense) karşılaştırma olan Llama 3.1 70B ile kıyasladığında, Qwen3-Next boyutuna göre belirgin biçimde daha hızlı hissettiriyor; çünkü her adımda yalnızca 3B parametre aktifken Llama'nın 70B'nin tamamını çalıştırması gerekiyor. Sohbet ve akıl yürütmedeki kalite rekabetçi, ancak yoğun 70B modeller en zorlu çok adımlı promptlarda hâlâ üstünlüğü koruyabiliyor. Öne çıkan özelliği bu hız-boyut oranı: belleği barındıracak gücün varsa, küçük model gecikmesinde büyük model genişliği. Lisansı Apache 2.0, yani sağlayıcıya özgü bağlayıcı koşullar olmadan ticari olarak ve üretimde özgürce kullanabilirsin.

Teknik özellikler

Parametre80B (3B aktif)
Bağlam penceresi256K token
SağlayıcıAlibaba
LisansApache 2.0
Çıkış2025-09
En iyi olduğu alanSohbet, Akıl yürütme

Nicemlemeye göre boyut

NicemlemeBit/ağırlıkİndirmeMin RAMKalite
Q2_K3.3533.5 GB48 GBBelirgin kayıp
Q4_K_MÖnerilen4.8548.5 GB64 GBÖnerilen
Q5_K_M5.6556.5 GB96 GBYüksek
Q8_08.585.0 GB128 GBOrijinale yakın
F1616160.0 GB256 GBOrijinal

Boyutlar parametre sayısı × ağırlık başına bit üzerinden tahmindir; gerçek GGUF sürümleri biraz farklı olabilir. · Veri güncellemesi: 2026-06-11 · Bu sayıları nasıl hesaplıyoruz? →

Bağlam uzunluğuna göre bellek ihtiyacı

BağlamKV önbelleği (tahmini)Toplam bellek (Q4)
4K token~1.5 GB~50.0 GB
8K token~3.0 GB~51.5 GB
32K token~11.8 GB~60.3 GB
128K token~47.3 GB~95.8 GB

KV önbelleği bağlam uzunluğuyla büyür — 4K'da sığan model 32K'da belleği doldurabilir. Tahminler grouped-query attention ile FP16 önbellek varsayar; gerçek kullanım çalışma ortamına göre değişir.

Donanıma göre tahmini hız

DonanımBant genişliği~Hız
NVIDIA RTX 3060 12GB360 GB/sVRAM'e sığmaz
NVIDIA RTX 4090 24GB1008 GB/sVRAM'e sığmaz
Apple M-series (base)100 GB/s~47 tok/s
Apple M-series Pro270 GB/s~126 tok/s
Apple M-series Max410 GB/s~192 tok/s
CPU only (dual-channel DDR5)60 GB/s~28 tok/s

Token üretimi bellek bant genişliğiyle sınırlıdır: tok/s ≈ bant genişliği × 0,85 ÷ Q4 model boyutu. Gerçek değerler çalışma ortamına ve bağlam uzunluğuna göre değişir.

Yerel çalıştır

En kolay yol Ollama — tek komutla sohbete başla:

ollama run qwen3-next:80b

Sık sorulan sorular