Un agente de 27.000 millones de parámetros en 7,89 GB
Underdog, el asistente local de Conway Research, ha publicado Saluki 27B: una versión cuantizada a 2 bits de Qwen3.8-27B que ocupa 7,89 GB en formato GGUF. El modelo original en BF16 necesita unos 54 GB. La reducción ronda el 85 % y permite ejecutar un modelo competente en equipos con menos memoria.
Saluki funciona con una compilación estándar de llama.cpp y descarga todas las capas a la GPU. Algunos modelos compactos dependen de formatos de empaquetado especiales y requieren una bifurcación concreta del runtime; según Underdog, para poner Saluki en marcha no hace falta instalar una versión modificada.
La cuantización de Underdog prioriza las llamadas a herramientas: la capacidad de invocar funciones, consultar servicios o encadenar acciones, en lugar de limitarse a redactar respuestas. Para un agente, un modelo que escribe con soltura pero falla al llamar una herramienta puede ser menos útil que otro más torpe con la prosa y fiable en la ejecución.
Saluki se distribuye con licencia Apache 2.0. También hay complementos de visión opcionales de 629 o 928 MB, que se descargan aparte y no forman parte de los 7,89 GB del archivo principal. Aunque la arquitectura base de Qwen3.8-27B admite 262.144 tokens de contexto, Underdog no especifica el límite efectivo de Saluki. No se le pueden atribuir sin más todas las capacidades anunciadas para el modelo original.
La compresión tiene un coste: los datos publicados muestran pérdidas claras en matemáticas y razonamiento de varios pasos. El interés de Saluki no es ofrecer el modelo original sin sacrificios, sino hacer que uno de esa familia quepa en menos de ocho gigabytes y conservar —o incluso mejorar, en algunas pruebas— una función concreta que suele degradarse al reducir tanto el tamaño.
¿Cómo encaja tanta compresión en tan poco espacio?
Saluki parte de Qwen3.8-27B, un modelo denso de 27.000 millones de parámetros del equipo Qwen. Su arquitectura combina 64 capas, atención lineal Gated DeltaNet y atención con compuertas. Underdog aplicó un proceso de cuantización en varias etapas, aunque la receta final sigue siendo parcialmente opaca.
Uno de los ingredientes es el trabajo de ISTA-DASLab: Qwen3.8-27B-GSQ-RCO-GGUF. GSQ aprende rejillas escalares de baja precisión para cada tensor, en vez de aplicar una única representación a todo el modelo. RCO asigna tipos de cuantización distintos a los tensores bajo un presupuesto fijo de tamaño, para apretar más donde se puede y conservar precisión donde conviene.
La versión más pequeña de ISTA citada en la comparación, IQ2_XS, ocupa 8,4 GB y promedia 2,50 bits por peso. Underdog tomó ese punto de partida y realizó otra pasada hasta llegar a 7,89 GB, con un formato que llama IQ2-mix y una etiqueta imatrix. La imatrix utiliza información sobre activaciones para orientar la cuantización y puede ayudar a preservar el comportamiento del modelo, pero el material publicado no detalla el procedimiento completo que produjo esta variante.
Underdog no ha publicado todos los pasos de su ajuste de compresión, lo que limita cuánto puede aprender o reproducir la comunidad. La licencia abierta permite usar y redistribuir el modelo, pero no hace que cada decisión técnica sea transparente o replicable.
La información disponible tampoco precisa cuánto cambia el consumo de memoria real según el contexto, el backend o el número de capas que se mantienen en la GPU. El archivo pesa 7,89 GB, pero el proceso en ejecución puede necesitar memoria adicional para la caché, los buffers y el contexto. Por eso, el tamaño del archivo no garantiza que cualquier tarjeta con 8 GB vaya a ejecutarlo con soltura y una ventana de contexto enorme.
La parte llamativa: herramientas y llamadas en paralelo
Underdog separa sus resultados en pruebas propias, ejecutadas en el mismo entorno, y puntuaciones públicas del modelo completo. La distinción importa: cuando cambian los prompts, los evaluadores o la configuración, las cifras dejan de medir lo mismo.
En Underdog Bench, un conjunto de 120 tareas basado en BFCL v4 y congelado antes de la prueba, Saluki obtuvo 88 puntos frente a 84 de Qwen3.8-27B completo. La evaluación se hizo con el modo de razonamiento desactivado y temperatura cero. PrismML Bonsai 2 logró 70 en esa misma comparación publicada por Underdog, aunque el dato no permite declarar un ganador universal entre productos evaluados con métodos y entornos distintos.
En llamadas paralelas a herramientas, Saluki alcanzó 42 puntos en 100 tareas de BFCL v4 con el verificador oficial, frente a 35 del modelo completo. Es un 120 % del resultado de referencia según la proporción entre ambas puntuaciones. No significa que Saluki sea un 20 % mejor en cualquier uso de herramientas: superó al original en esa prueba concreta, centrada en una capacidad pertinente para agentes.
El resultado refleja una decisión de ingeniería: conservar la coordinación de herramientas antes que perseguir una imitación perfecta del modelo grande. Los siete puntos pueden importar en una aplicación que emita varias llamadas en una interacción, pero no se deben extrapolar a otros esquemas de funciones, APIs o prompts. Los agentes también pueden fallar por detalles menos visibles que una puntuación de benchmark.
La prueba de SWE-bench Verified, con 50 incidencias de software, ofrece una imagen menos favorable: Saluki resolvió 30 y Qwen completo, 33. La diferencia recuerda que una buena puntuación en llamadas paralelas no convierte automáticamente al modelo en mejor programador. Entender la tarea, editar código y verificar la solución son problemas relacionados, pero no intercambiables.
Matemáticas: el precio aparece rápido
En nueve benchmarks, Underdog informa de una retención media del 96 % frente a Qwen3.8-27B. El promedio puede disimular diferencias importantes entre habilidades; los resultados desglosados muestran que las pruebas de matemáticas competitivas y razonamiento de varios pasos son un punto débil.
En AIME 2025, con un promedio de cuatro intentos, Saluki obtuvo 79,2 frente a 96,7 del modelo completo, alrededor del 82 % de la puntuación de referencia. En AIME 2026 marcó 80 frente a 94,6, cerca del 85 %. MBPP+ cayó de 83,9 a 78,0 y MuSR, de 79,6 a 67,5. La magnitud de la pérdida varía según la tarea.
También hay resultados favorables. En IFEval, bajo el protocolo prompt-loose, Saluki alcanzó 93,5 frente a 91,5; en IFBench, 72,7 frente a 71,0. En esas mediciones, seguir instrucciones no se deterioró y hasta mejoró. La cuantización puede alterar comportamientos de forma desigual, y los resultados también dependen del muestreo y del protocolo de evaluación.
Para problemas matemáticos difíciles, Saluki no parece un sustituto directo del modelo completo. Para ejecutar un asistente local con llamadas a herramientas y un presupuesto de memoria ajustado, el balance puede ser más razonable. La cifra de «96 % de retención» no explica por sí sola qué capacidades funcionarán en cada uso.
Las comparaciones con puntuaciones públicas también requieren cuidado: no todas se generaron con el mismo arnés ni en condiciones idénticas, y los resultados pueden variar con el formato de los prompts, el número de intentos y los criterios de corrección. Underdog ofrece comparaciones controladas para algunos datos y, para otros, pone sus cifras junto a resultados publicados. No son mediciones equivalentes.
¿Saluki, Bonsai o el modelo completo?
Una comparación relevante para quien busca una versión pequeña de Qwen3.8-27B es PrismML Bonsai 2. Bonsai ocupa 5,95 GB y comunica una retención del 98,2 % frente a FP16 en 14 benchmarks en modo de razonamiento. También publica mejores resultados en matemáticas: 95,00 en AIME25. Sobre el papel, es más pequeño y obtiene mejores resultados en varias tareas exigentes.
Bonsai requiere la bifurcación de llama.cpp de PrismML, porque llama.cpp estándar rechaza sus formatos de empaquetado. Saluki, en cambio, está pensado para funcionar con llama.cpp sin modificaciones. Esa diferencia puede ser relevante para mantener una aplicación, actualizar dependencias o reproducir un entorno en varios equipos sin versiones especiales.
ISTA-DASLab ofrece otra referencia: su archivo IQ2_XS pesa 8,4 GB, frente a los 7,89 GB de Saluki. En la tabla comparativa aparece con una retención anunciada del 100,3 % de recuperación zero-shot y del 98,2 % respecto a FP16 en 14 benchmarks. Son métricas del proveedor, no una comparación universal con las pruebas de Underdog: las puntuaciones de distintas organizaciones no necesariamente proceden del mismo examen, corrector o protocolo.
La elección depende de la prioridad. Saluki puede resultar atractivo para un agente compacto, compatible con llama.cpp estándar y con buenos resultados en tool calling. Bonsai puede convenir si se priorizan el tamaño o el razonamiento matemático y se acepta su runtime propio. El Qwen completo sigue siendo la opción menos arriesgada cuando hay memoria suficiente y el razonamiento pesa más que la portabilidad.
Para desarrollo, conviene probar Saluki en el flujo real antes de llevarlo a producción. Hay que medir llamadas correctas, argumentos mal formados, reintentos y coste de contexto con las herramientas previstas, y comprobar la memoria en ejecución, sobre todo si se añade visión. El archivo cabe en menos de ocho gigabytes; el sistema completo puede necesitar más.
Una mejora útil, con letra pequeña
Saluki 27B comprime un modelo denso de 27.000 millones de parámetros a 7,89 GB y conserva un rendimiento sólido en tareas de agente. En dos pruebas de llamadas a herramientas obtuvo resultados superiores a Qwen completo. La compatibilidad con llama.cpp estándar y la licencia Apache 2.0 refuerzan su utilidad práctica.
La retención media del 96 % no debe ocultar los 79,2 frente a 96,7 de AIME 2025, la caída en MuSR ni los tres casos menos resueltos en SWE-bench Verified. El buen resultado en llamadas paralelas tampoco demuestra que cualquier agente vaya a funcionar mejor: el rendimiento depende de la aplicación, las herramientas disponibles y la evaluación de las respuestas.
El proceso final de Underdog no está documentado por completo. Esto no invalida las pruebas ni el archivo, pero deja preguntas sobre cómo se obtuvo la variante IQ2-mix y qué parte del resultado puede reproducirse con los materiales disponibles. La licencia es un buen comienzo; publicar la receta técnica completa permitiría entender mejor el método.
Saluki parece una opción seria para desarrollo local cuando la prioridad es ejecutar agentes con poca memoria, especialmente si importa usar el runtime estándar. Para razonamiento complejo o programación asistida en la que cada acierto cuenta, conviene probar el modelo completo o comparar Bonsai bajo el mismo conjunto de tareas antes de cambiar.
