¿Puedo ejecutar Command R 35B?
Command R 35B, de Cohere, necesita alrededor de 32 GB de RAM con la cuantización recomendada de 4 bits (descarga de 21.2 GB). Tu hardware se comprueba abajo — al instante, nada sale de tu navegador. Espera alrededor de ~16 tok/s en un Apple M-series Max.
Leyendo las señales de tu hardware…
Notas del mundo real
Command R 35B es el caballo de batalla de Cohere para RAG y chat, y exige más al hardware que los modelos de 7-8B con los que la mayoría empieza. En 4 bits pesa unos 21 GB, así que la RTX 3060 de 12 GB queda descartada por completo, y necesitas al menos 32 GB de RAM de sistema para cargarlo con holgura. Su sitio natural es una tarjeta de 24 GB como una RTX 4090, o un Mac con Apple Silicon y memoria unificada de sobra. Baja a una cuantización de 2 bits (unos 15 GB) solo si vas muy justo y aceptas la pérdida de calidad.
En el día a día es estable más que ágil. En una RTX 4090 puedes esperar alrededor de 40 tokens por segundo en 4 bits, que fluye más rápido de lo que lees; en un M-series Max se queda cerca de 16 tok/s, usable pero notablemente más pausado; y en una CPU con DDR5 hablas de unos 2 tok/s, terreno que pone a prueba la paciencia. La ventana de contexto de 128K es realmente grande, pero usarla sale caro: si la llenas, la memoria total sube a unos 54 GB, así que salvo que tengas un equipo de 48 GB o más, mantén el contexto de trabajo moderado y reserva la ventana completa para documentos largos ocasionales.
Frente a lo que hay hoy, se le nota su edad de 2024. Los modelos Qwen 3.5 y 3.6 35B-A3B de la lista relacionada son diseños MoE que en general se sienten más rápidos y fuertes en razonamiento y programación, donde Command R nunca puso el foco. Su rasgo distintivo sigue siendo aquello para lo que Cohere lo construyó: chat con generación aumentada por recuperación y citas, donde tiende a ceñirse a la fuente en lugar de divagar. Eso sí, una advertencia tajante: los pesos son CC-BY-NC, así que esto es solo para uso no comercial. Puedes ejecutarlo en proyectos personales e investigación, pero no puedes incluirlo en un producto ni en ningún servicio de pago.
Especificaciones
Tamaño por cuantización
| Cuantización | Bits/peso | Descarga | RAM mínima | Calidad |
|---|---|---|---|---|
| Q2_K | 3.35 | 14.7 GB | 24 GB | Pérdida notable |
| Q4_K_MRecomendada | 4.85 | 21.2 GB | 32 GB | Recomendada |
| Q5_K_M | 5.65 | 24.7 GB | 48 GB | Alta |
| Q8_0 | 8.5 | 37.2 GB | 48 GB | Casi original |
| F16 | 16 | 70.0 GB | 96 GB | Original |
Los tamaños son estimaciones de número de parámetros × bits por peso; las builds GGUF reales varían un poco. · Datos actualizados: 2026-06-11 · Cómo calculamos estos números →
Memoria necesaria según la longitud de contexto
| Contexto | Caché KV (est.) | Memoria total (Q4) |
|---|---|---|
| 4K tokens | ~1.0 GB | ~22.2 GB |
| 8K tokens | ~2.0 GB | ~23.2 GB |
| 32K tokens | ~8.1 GB | ~29.3 GB |
| 128K tokens | ~32.6 GB | ~53.8 GB |
La caché KV crece con la longitud del contexto — un modelo que cabe a 4K puede quedarse sin memoria a 32K. Las estimaciones asumen una caché en FP16 con grouped-query attention; el uso real varía según el runtime.
Velocidad estimada según el hardware
| Hardware | Ancho de banda | ~Velocidad |
|---|---|---|
| NVIDIA RTX 3060 12GB | 360 GB/s | No cabe en la VRAM |
| NVIDIA RTX 4090 24GB | 1008 GB/s | ~40 tok/s |
| Apple M-series (base) | 100 GB/s | ~4 tok/s |
| Apple M-series Pro | 270 GB/s | ~11 tok/s |
| Apple M-series Max | 410 GB/s | ~16 tok/s |
| CPU only (dual-channel DDR5) | 60 GB/s | ~2 tok/s |
La generación de tokens está limitada por el ancho de banda de la memoria: tok/s ≈ ancho de banda × 0,85 ÷ tamaño del modelo en Q4. Las cifras reales varían según el runtime y la longitud del contexto.
Ejecútalo en local
El camino más fácil es Ollama — un comando y ya estás chateando:
ollama run command-r