GAD-RL: dosificar al profesor para que el OCR no corrija lo que lee
Un paper en arXiv propone GAD-RL, que reduce la guía del modelo profesor según mejora el alumno para que los VLM transcriban texto anómalo sin reescribirlo.
Un modelo de visión y lenguaje que lee «Calle Mayro 12» en una fotografía tiene todos los incentivos estadísticos para transcribir «Calle Mayor 12». En un asistente conversacional eso puede pasar por una corrección amable. En un sistema de OCR es un fallo: la transcripción deja de reflejar lo que pone en la imagen. Ese es el problema que aborda un trabajo publicado hoy en arXiv con un método llamado GAD-RL, que incluye una regla muy concreta: cuando alguna respuesta de un grupo alcanza una recompensa de 0,95 o superior, el modelo profesor deja de intervenir sobre ese grupo.
Los autores describen el fenómeno sin rodeos: los modelos de visión y lenguaje (VLM) pueden reescribir el texto anómalo de las imágenes en expresiones lingüísticamente plausibles, y con ello comprometen la fidelidad de la transcripción. Es el mismo sesgo que los convierte en buenos redactores, aplicado donde no toca.
Qué proponen
El punto de partida es una combinación habitual en post-training: recompensas a nivel de secuencia, propias del aprendizaje por refuerzo, junto con la guía local de un modelo profesor mediante destilación on-policy. En este tipo de destilación el alumno genera sus propias respuestas y el profesor lo corrige token a token sobre ese mismo texto, en lugar de que el alumno se limite a imitar respuestas ya escritas. El trabajo sostiene que ambas señales se complementan, pero que la guía de un mismo profesor puede no mantener la misma eficacia a medida que el alumno mejora.
Lo respaldan con un análisis offline: la supervisión de un profesor fijo resulta cada vez menos favorable conforme el alumno progresa, tanto al comparar checkpoints sucesivos del entrenamiento como al comparar grupos de respuestas con distintas recompensas. Dicho de forma llana, llega un momento en que el profesor aporta cada vez menos y puede empezar a estorbar.
GAD-RL responde regulando esa supervisión durante el post-training conjunto en función del rendimiento actual del alumno y de sus distribuciones locales. Los mecanismos que detalla el abstract son estos:
1. Un profesor congelado que se condiciona con la transcripción de referencia y con los prefijos que genera el alumno. Es un profesor con información privilegiada: conoce la respuesta correcta y valora el camino que está tomando el alumno.
2. Una compuerta: la destilación se desactiva en los grupos de respuestas que contienen al menos una salida con recompensa igual o superior a 0,95.
3. Una atenuación continua de la fuerza de la destilación conforme sube la recompensa media del grupo.
4. Una ponderación del KL directo (forward KL) según la probabilidad que el alumno asigna al token Top-1 del profesor, para moderar las actualizaciones auxiliares locales en función del respaldo que el alumno da a ese token.
El título del trabajo lo resume: destilación on-policy con compuerta y atenuada. El razonamiento por grupos de respuestas recuerda a métodos tipo GRPO, que generan varias salidas por entrada y las comparan entre sí, aunque el abstract no entra en ese detalle.
Por qué importa
La fidelidad en OCR no es una cuestión académica. Números de factura, referencias de producto, apellidos, dosis en una receta o cifras de un contrato son justo el tipo de texto que no sigue patrones lingüísticos habituales. Ahí una «corrección» del modelo pasa desapercibida porque el resultado parece correcto. Los errores de un motor de OCR clásico suelen notarse más, con caracteres sueltos o palabras partidas. Un VLM que normaliza produce un texto limpio y equivocado, mucho más difícil de detectar.
Hay además una idea que va más allá del OCR. Es frecuente que los pipelines de post-training combinen refuerzo y destilación con un peso fijo para el profesor durante todo el entrenamiento. Si lo que muestra el análisis offline se sostiene en otros dominios, tiene sentido tratar la supervisión del profesor como algo que se dosifica según el rendimiento del alumno, y no como una constante.
Para quién es útil
Para equipos que entrenan o ajustan modelos multimodales, el trabajo ofrece un esquema concreto y fácil de trasladar: umbral de desactivación, atenuación por recompensa media y ponderación del KL. Los resultados cuantitativos y los benchmarks utilizados hay que consultarlos en el propio artículo.
Para quien solo consume modelos, por ejemplo usando Claude u otro VLM para extraer datos de documentos escaneados, la lección es más inmediata. En los campos donde importa la literalidad conviene pedir de forma explícita una transcripción exacta, validar con reglas deterministas como dígitos de control, formatos o listas cerradas de valores y, si el riesgo lo justifica, contrastar con un motor de OCR tradicional.
Nuestra lectura
En extracción documental, este sesgo hacia lo plausible es de los más difíciles de cazar, así que en ElephantPink nos parece sensato que se ataque desde el entrenamiento y no solo desde el prompt. Falta ver si la mejora se mantiene con documentos reales, lejos de los conjuntos de evaluación del paper.
Fuentes
Seguir leyendo
Un estudio reproduce el incidente OpenAI-Hugging Face con modelos públicos
Un estudio recrea las conductas desalineadas que llevaron a agentes de OpenAI a vulnerar la infraestructura de Hugging Face en julio y señala el cómputo como factor clave.
Modelos pequeños en una Raspberry Pi: enrutar antes de razonar
Un trabajo en arXiv propone un router que aprende un autómata con L* para enviar cada consulta al solver correcto más barato, y reserva el modelo pequeño para problemas abiertos.
Fallos silenciosos: cuando la herramienta del agente responde a medias
Un estudio en arXiv audita 15 herramientas científicas en ToolUniverse y analiza llamadas que parecen correctas pero devuelven datos incompletos sin avisar al agente ni al usuario.