TL;DR
POCKET-Darwin-180B-GGUF es la versión cuantizada del modelo abierto Darwin-180B-RSI, pensada para correr sin GPU. Puntos clave para quien va a desplegarlo:
- Pesa 111 GB en GGUF (el original en BF16 ocupa 360 GB) y se ejecuta con llama.cpp.
- Hasta 21 tokens por segundo solo en CPU (1 socket, 16 hilos, 78.8 GB de RAM usada). En un portátil con RTX 5060 de 8 GB y 32 GB de RAM: 4.17 tok/s.
- Misma precisión que el original: en MMLU-Pro (2,000 preguntas) ambos miden 87.65%, aunque el modelo esté en 4 bits.
- Arquitectura MoE: 180B de parámetros totales, pero solo unos 3B activos por token (10 de 512 expertos).
- Se descargan 4 archivos y arranca con una sola línea de comando.
Este artículo explica por qué funciona y cómo ponerlo en marcha.
¿Por qué un modelo de 180B cabe en un portátil?
La respuesta corta: la mayor parte del modelo no se usa en cada paso.
Darwin-180B-RSI es un modelo de mezcla de expertos (Mixture of Experts, MoE). Tiene 512 redes "expertas", pero para generar cada token un enrutador selecciona solo 10. De los 180,000 millones de parámetros, apenas unos 3,000 millones intervienen en el cálculo de cada token.
Esto cambia por completo las cuentas de despliegue. En un modelo denso de 180B tendrías que mover los 180B de parámetros por la memoria en cada token. Con MoE, el trabajo aritmético por token se parece más al de un modelo de 3B, aunque la capacidad total siga siendo la de un modelo enorme. El cuello de botella deja de ser el cómputo y pasa a ser dónde guardas los pesos y a qué velocidad los lees.
Ahí entra la cuantización. El original en BF16 ocupa 360 GB. La versión POCKET se construye sobre una cuantización de 4 bits ya validada por la comunidad, y solo la parte que el entrenamiento de autosuperación de VIDRAFT realmente modificó (alrededor del 3% del volumen total) se mantiene en alta precisión. El resultado: 111 GB en disco, repartidos en 4 archivos GGUF.
Con 111 GB tienes dos caminos:
- Mini PC con 128 GB de RAM: el modelo entero entra en memoria y corre sin GPU.
- Portátil con 32 GB de RAM: no cabe entero, así que llama.cpp lee desde SSD mediante mapeo de memoria (mmap) los expertos que hace falta en cada momento. Más lento, pero funciona.
¿Cómo lo ejecuto con llama.cpp? (paso a paso)
GGUF es el formato que usa llama.cpp, el motor de inferencia de código abierto. No necesitas cuenta en la nube ni servidor con GPU. Necesitas una build reciente de llama.cpp (b11048 o posterior) y espacio en disco para los 111 GB.
Primero, descarga los archivos del repositorio en Hugging Face:
# Instala el cliente de Hugging Face
pip install -U "huggingface_hub[cli]"
# Descarga los 4 archivos GGUF (111 GB en total)
hf download FINAL-Bench/POCKET-Darwin-180B-GGUF \
--local-dir ./pocket-darwin-180b \
--include "*.gguf"
Luego compila llama.cpp (si aún no la tienes) y lanza la inferencia:
# Compilar llama.cpp (build b11048 o superior)
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build --config Release
# Ejecutar solo en CPU
./build/bin/llama-cli \
--model ../pocket-darwin-180b/pocket-darwin-180b-Q4.gguf \
--threads 16 \
--ctx-size 8192 \
--prompt "Explica en tres frases qué es una arquitectura MoE."
Notas prácticas de ingeniería:
-
--threads: ajusta al número de hilos físicos de tu CPU. En el servidor de prueba (16 hilos) se obtuvieron de 18.4 a 21.0 tok/s. - mmap: llama.cpp mapea el archivo por defecto, así que en máquinas con poca RAM los pesos se leen desde SSD bajo demanda. Un SSD NVMe rápido ayuda mucho aquí.
-
Servidor HTTP: usa
llama-serveren lugar dellama-clisi quieres exponer un endpoint compatible con la API de chat.
Un apunte importante: este modelo se distribuye como GGUF para llama.cpp. Verifica la compatibilidad de la versión del motor antes de integrarlo en otras herramientas de escritorio.
¿Pierde precisión al comprimir a 4 bits?
Esta es la pregunta que todo ingeniero hace antes de confiar en una versión cuantizada. La respuesta medida: no, al menos en el banco de pruebas principal.
En MMLU-Pro, un examen de conocimiento general de 2,000 preguntas, comparando pregunta por pregunta:
| Versión | MMLU-Pro |
|---|---|
| Original (BF16) | 87.65% |
| POCKET (4 bits) | 87.65% |
Idéntico. La cuantización agresiva no degradó la tasa de acierto en ese conjunto.
Además, hay una señal interesante sobre el efecto de la autosuperación (RSI). En SuperGPQA, un conjunto de 1,000 preguntas de ciencia de nivel de posgrado que no se usó en el entrenamiento, se comparó solo la parte modificada por RSI contra la misma versión de 4 bits del modelo base:
- Modelo base (4 bits): 59.10%
- POCKET (4 bits): 61.55%
Una mejora de 2.45 puntos, estadísticamente significativa. Y lo hizo usando alrededor de 13% menos tokens por pregunta: razona de forma más concisa y deja de reverificar la respuesta una vez que ya la tiene. Un desarrollador externo verificó este resultado archivo por archivo en una discusión pública.
¿Para qué casos sirve un modelo de alto nivel sin conexión?
El caso de uso que ordena todo lo anterior es claro: entornos donde los datos no pueden salir a la nube. Defensa, finanzas y sector público tienen reglas que prohíben enviar datos a servidores externos. POCKET-Darwin-180B corre dentro de un servidor local o un mini PC, sin conexión a internet, sin que ningún dato cruce la frontera de la organización.
La comparación de coste también pesa. Un servidor con 8 GPU H100 ronda cifras de cientos de miles de dólares. Un portátil gamer de gama media con 8 GB de memoria gráfica y 32 GB de RAM cuesta una fracción mínima de eso. No es la misma velocidad, pero para cargas de trabajo por lotes o inferencia local, la ecuación cambia por completo.
Preguntas frecuentes (FAQ)
¿Qué hardware mínimo necesito?
Para correr el modelo completo en memoria, un mini PC con 128 GB de RAM sin GPU. Con 32 GB de RAM funciona vía mmap desde SSD, a menor velocidad (4.17 tok/s medidos en un portátil con RTX 5060 de 8 GB). Un SSD NVMe rápido es muy recomendable.
¿Cuánto espacio en disco ocupa?
Son 4 archivos GGUF que suman 111 GB. Deja margen adicional para la caché del sistema operativo.
¿Por qué 180B de parámetros corren tan rápido en CPU?
Por la arquitectura MoE: solo 10 de 512 expertos se activan por token, lo que equivale a unos 3B de parámetros activos. El cómputo por token es bajo; el reto real es la lectura de pesos desde disco o RAM.
¿Puedo usarlo con Ollama o LM Studio?
El modelo está publicado y probado para llama.cpp (build b11048 o superior). Antes de usarlo con otras herramientas, confirma que su versión del motor soporta esta arquitectura y cuantización.
¿La cuantización de 4 bits lo vuelve menos fiable?
En MMLU-Pro, la tasa de acierto es idéntica a la del original (87.65% en ambos). La parte modificada por el entrenamiento de autosuperación se conserva en alta precisión, lo que ayuda a preservar la calidad.
¿Dónde lo descargo?
En Hugging Face (huggingface.co/FINAL-Bench/POCKET-Darwin-180B-GGUF) y en ModelScope (modelscope.cn/models/FINAL-Bench/POCKET-Darwin-180B-GGUF). El modelo original está en huggingface.co/FINAL-Bench/Darwin-180B-RSI.
Cierre
Lo interesante de POCKET-Darwin-180B no es solo que un modelo de 180B corra sin GPU, sino el conjunto de decisiones de ingeniería que lo hacen posible: MoE para reducir el cómputo por token, cuantización de 4 bits que preserva la precisión, y GGUF más llama.cpp para desplegar con una sola línea de comando. La combinación acerca un modelo de nivel puntero al hardware que ya tienes sobre la mesa.
Top comments (0)