Un método de poda de redes basado en la métrica de Fisher
Un paper de arXiv deriva la poda de parámetros como distancia geodésica en el espacio de modelos y bate a la poda por magnitud en MNIST y CIFAR-10.
La poda por magnitud, es decir borrar los pesos más pequeños y reentrenar, lleva décadas siendo el método por defecto por una razón poco elegante: es trivial de implementar y funciona. Un paper publicado el 16 de septiembre en arXiv (arXiv:2609.16129) sostiene que ese criterio no es una heurística arbitraria sino el primer escalón de una jerarquía, y que subir un escalón mejora los resultados en todas las combinaciones de arquitectura y conjunto de datos que los autores prueban.
El planteamiento parte de una observación geométrica. Podar un parámetro es ponerlo a cero, y poner un parámetro a cero equivale a desplazar el modelo hasta la hipersuperficie en la que ese parámetro se anula. La pregunta deja de ser cuál es el peso más pequeño y pasa a ser cuál es el desplazamiento más corto hasta esa hipersuperficie.
La jerarquía que sale de la geometría
"Corto" en el espacio de modelos no se mide en unidades de peso, se mide con la métrica de información de Fisher, que pondera cada dirección por cuánto cambia la distribución de salida del modelo al moverse en ella. La distancia mínima al hiperplano de poda es entonces una distancia geodésica bajo esa métrica, y esa distancia es la que refleja el cambio real en el modelo y en su rendimiento.
De ahí sale lo interesante del trabajo: analizando aproximaciones progresivamente más fieles de esa geodésica aparece un orden natural de optimalidad. La aproximación más burda reproduce la poda por magnitud de toda la vida. La siguiente corresponde a usar solo la información de Fisher local. Y por encima quedan los esquemas nuevos que propone el paper. Dicho de otra forma, el método clásico no era una ocurrencia: era el caso degenerado de algo mejor.
Qué prueban
El protocolo experimental es más completo que la media en literatura de poda:
1. Dos familias de arquitectura: redes totalmente conectadas y vision transformers.
2. Dos conjuntos de datos: MNIST y CIFAR-10.
3. El rango completo de poda, del 0 al 100 por ciento, y no solo el tramo cómodo.
4. Cinco semillas aleatorias por configuración.
El resultado que reportan es que el método supera a la poda por magnitud y a la basada solo en información de Fisher local en todas las combinaciones de arquitectura y conjunto de datos consideradas, en precisión. El resumen publicado en arXiv se corta antes de detallar la segunda métrica que evalúan, así que ese dato habrá que buscarlo en el PDF.
Barrer el rango completo de poda importa más de lo que parece. Muchos trabajos del área reportan solo el punto dulce, ese 50 a 90 por ciento donde casi cualquier criterio aguanta, y esconden lo que pasa en los extremos.
Lo que el paper no prueba
MNIST y CIFAR-10 son bancos de pruebas pequeños. Que el orden de optimalidad se mantenga en un vision transformer sobre CIFAR-10 no garantiza que aguante en un modelo de lenguaje de miles de millones de parámetros, donde la poda estructurada y la cuantización compiten por el mismo presupuesto de memoria y donde el reentrenamiento posterior cuesta dinero de verdad.
Queda también la pregunta del coste. La matriz de Fisher completa es cuadrática en el número de parámetros, motivo por el que en la práctica todo el mundo usa la diagonal. Si la jerarquía de aproximaciones sube en calidad pero también en coste de cómputo, el escalón útil dependerá del presupuesto de cada equipo.
Para quién es útil
Esto no se aplica mañana a un despliegue de Claude vía API: ahí no se poda nada, los pesos son de Anthropic. El público real son los equipos que entrenan o afinan modelos propios y necesitan meterlos en dispositivos con memoria limitada, y quien investiga compresión y quiere un marco teórico en lugar de un catálogo de trucos.
Nos gusta el tipo de paper que no propone un truco nuevo sino un marco donde el truco anterior queda explicado, porque suele envejecer mejor. Dicho eso, entre MNIST y un modelo en producción hay varios órdenes de magnitud, y esa distancia también hay que medirla.
Fuentes
Seguir leyendo
ZGCM-1: un modelo abierto de 7B para matemáticas y búsqueda agéntica
Un 7B denso entrenado desde cero, con 256K de contexto y receta de entrenamiento abierta, dice competir en matemáticas y búsqueda agéntica con modelos mucho mayores.
Probabilistic Focal Search: azar para mover la cota inferior
Un trabajo en arXiv añade una moneda al aire a Focal Search: parte de las expansiones van al nodo de menor f para que la cota inferior avance y FOCAL crezca.
OpenDiscoveryTrace: 558 trazas para auditar agentes científicos
OpenDiscoveryTrace publica 558 trayectorias completas de agentes científicos con nueve campos por paso, para auditar el razonamiento y no solo el resultado final.