ZGCM-1: un modelo abierto de 7B para matemáticas y búsqueda agéntica
Un 7B denso entrenado desde cero, con 256K de contexto y receta de entrenamiento abierta, dice competir en matemáticas y búsqueda agéntica con modelos mucho mayores.
Un modelo denso de 7.000 millones de parámetros, entrenado desde cero, con ventana de 256K tokens y una receta de entrenamiento publicada entera. Eso es lo que describe ZGCM-1 en el preprint arXiv:2609.13356, subido el 15 de septiembre. La premisa del trabajo es explícita y algo incómoda para la carrera de escalado: un modelo compacto no puede memorizar la web abierta, así que tiene que compensar acoplando razonamiento interno deliberado con uso activo de herramientas externas.
Dicho de otra forma: en vez de intentar saberlo todo, el modelo se entrena para saber cuándo buscar. Es una apuesta que encaja con lo que ya hace cualquiera que trabaje con agentes: el valor no está en el parámetro, está en la llamada a la herramienta correcta en el momento correcto.
La receta, que es lo interesante
El paper no se vende por el tamaño sino por la eficiencia del proceso, y ahí destacan tres piezas. La primera es el co-diseño de arquitectura y sistema: atención intercalada entre ventana deslizante con compuertas y atención completa, más un optimizador Muon estable en FP8. La segunda es el currículo progresivo, con escalado de contexto en tres etapas, 16K, 64K y 256K, en lugar de entrenar directamente en la ventana larga. La tercera es el mid-training con MDP, donde las trazas de interacción se reformulan como procesos de decisión de Markov, que es la forma limpia de decir que el modelo aprende de sesiones de uso de herramientas y no solo de texto plano.
El detalle del currículo progresivo merece atención. Entrenar en 16K, luego 64K y finalmente 256K abarata el proceso y estabiliza el comportamiento en contexto largo, que es justo donde un agente sufre: una sesión de búsqueda con veinte llamadas a herramientas llena la ventana muy rápido, y la degradación en la parte media del contexto se nota más que en una tarea de resumen.
Un laboratorio operado por agentes
La parte que más conversación va a generar no es técnica del modelo, sino de proceso. Los autores describen un flujo de I+D donde enjambres de agentes gestionan de forma autónoma la operación del clúster, la curación de datos y la evaluación diagnóstica rápida. Es decir, agentes cuidando el entrenamiento de un modelo que a su vez está optimizado para usar herramientas.
Como afirmación es llamativa y, en un preprint, imposible de verificar desde fuera. Pero apunta a algo que ya se ve en equipos pequeños: la ventaja competitiva empieza a estar en la automatización del propio ciclo experimental, no solo en la GPU disponible.
Qué dice de resultados y qué falta
Sobre evaluación, el abstract es prudente en lo general y ambicioso en lo específico: ZGCM-1-7B sería competitivo dentro de su familia de 7B en benchmarks generales y, en varias suites de razonamiento matemático y búsqueda agéntica, seguiría siendo competitivo frente a modelos frontera de órdenes de magnitud mayores. El resumen público se corta justo ahí, sin la cifra final.
Con eso sobre la mesa, la lectura sensata es la de siempre con un preprint recién subido: números autoreportados, sin revisión por pares, sin evaluación independiente y sin detalle en el abstract sobre licencia, pesos o datos publicados. Lo que se puede contrastar hoy es la receta descrita, no el resultado.
Conviene también un apunte sobre el término abierto. En el abstract el modelo se define como fully open, algo que en la práctica cubre desde pesos con licencia permisiva hasta el paquete completo con datos y código de entrenamiento. Son cosas muy distintas para quien quiere reproducir o desplegar, y es lo primero que hay que mirar en el repositorio antes de sacar conclusiones.
Para quién es útil
Para quien monte agentes locales, un 7B denso con 256K de contexto y entrenamiento orientado a uso de herramientas es exactamente el perfil que interesa: cabe en hardware razonable y está pensado para llamar a MCP servers, buscadores o ejecutores de código en lugar de responder de memoria. Para equipos de investigación, el valor está en la receta: currículo por etapas, FP8 estable y reformulación de trazas en MDP son decisiones reutilizables aunque el modelo no cumpla lo que promete.
Lo seguiremos de cerca por la parte abierta, que es donde un trabajo así aporta de verdad: si la receta se reproduce, vale más que el checkpoint. Si no, será otro 7B con buenas tablas.
Fuentes
Seguir leyendo
Probabilistic Focal Search: azar para mover la cota inferior
Un trabajo en arXiv añade una moneda al aire a Focal Search: parte de las expansiones van al nodo de menor f para que la cota inferior avance y FOCAL crezca.
OpenDiscoveryTrace: 558 trazas para auditar agentes científicos
OpenDiscoveryTrace publica 558 trayectorias completas de agentes científicos con nueve campos por paso, para auditar el razonamiento y no solo el resultado final.
NormReact: los LLM esperan más castigo social que las personas
Un estudio con 450 escenarios de transgresión mide si los modelos anticipan quién sanciona y cómo. Seis LLM predicen sanciones donde las personas no harían nada.