Cuándo el feedback mejora de verdad a un agente LLM
Un estudio en arXiv separa el efecto real del feedback en lenguaje natural del simple reintento: el self-feedback aporta poco y solo los mejores profesores externos marcan la diferencia.
Trece modelos open-weight actuando como alumno y como profesor, cuatro benchmarks distintos (Omni-MATH, Codeforces, BBEH Linguini y ARC-AGI1) y una pregunta incómoda: cuando un agente LLM mejora tras recibir feedback, ¿mejora porque el feedback le sirvió, o simplemente porque ha tenido otro intento? Un nuevo trabajo publicado en arXiv sostiene que, en muchos casos, es lo segundo.
El paper What Drives Interactive Improvement from Feedback? parte de un problema metodológico que afecta a casi cualquier sistema agéntico multivuelta. Cuando medimos la precisión final de un agente que corrige sus respuestas turno a turno, esa cifra mezcla varios efectos: el feedback útil, sí, pero también el resampling (volver a tirar el dado), la corrección de formato y el cómputo extra en tiempo de inferencia. Subir el número final no demuestra que el modelo haya entendido nada de lo que se le dijo.
Qué midieron y cómo
Para aislar el efecto del feedback, los autores montan un protocolo controlado de alumno y profesor. Comparan tres condiciones: feedback externo (otro modelo hace de profesor), self-feedback (el propio modelo se critica) y self-refinement sin guía (el modelo reintenta sin comentario alguno). Encima, van variando el historial de interacción, la dificultad de la tarea y si el profesor tiene o no acceso a información privilegiada sobre el problema, por ejemplo la solución correcta.
La comparación clave es contra el self-refinement sin guía. Ese es el listón honesto: si dejar que el modelo reintente sin ningún comentario ya sube la precisión, entonces cualquier ganancia por debajo de ese umbral no es mérito del feedback.
El hallazgo
Los resultados son poco halagüeños para el feedback autogenerado. El self-feedback apenas aporta nada por encima del reintento a ciegas. Es decir, pedirle a un modelo que se critique a sí mismo y luego reintente rinde casi igual que dejarle reintentar sin decir nada. Solo los profesores externos más fuertes producen ganancias específicas del feedback que sí son sustanciales, y lo hacen porque ofrecen orientación que va más allá del genérico "vuelve a intentarlo".
Hay un matiz interesante en las matrices densas de interacción alumno-profesor que construyen los autores. Las ganancias interactivas dependen más de la capacidad del alumno para aprovechar el feedback que de la potencia bruta del profesor. Dicho de otra forma: un buen consejo mal aprovechado no sirve, y algunos modelos son estructuralmente mejores escuchando que otros.
Por qué importa
Para quien construye agentes, la implicación es directa. Muchos pipelines actuales encadenan bucles de "genera, autocritica, corrige" y presentan la mejora resultante como prueba de que el bucle de reflexión funciona. Este trabajo sugiere que buena parte de esa mejora podría venir del simple hecho de reintentar, no de la reflexión en sí. Antes de añadir capas de self-critique a un sistema, conviene medir contra el baseline honesto: ¿cuánto sube el modelo si le dejamos reintentar sin decirle nada?
La segunda lección apunta a los evaluadores. Si usamos un LLM como juez o como profesor dentro de un lazo de mejora, su valor real depende de que aporte información que el alumno no tenía y, además, que el alumno sepa usarla. Un profesor con acceso a información privilegiada marca la diferencia; uno que repite obviedades, no.
Conviene leer el estudio con el contexto de qué mide y qué no. Trabaja con trece modelos open-weight y cuatro benchmarks concretos, no con los modelos comerciales cerrados ni con tareas de producción reales, así que extrapolar a un agente desplegado con Claude Code o similar exige cautela. Aun así, el marco experimental es limpio y la pregunta que plantea es la correcta.
En ClaudeWave llevamos tiempo desconfiando de los bucles de auto-reflexión vendidos como panacea, y este paper pone números a esa intuición: el feedback solo mejora cuando dice algo que el modelo no sabía y el modelo sabe escucharlo. No es un resultado espectacular, pero es de los que ahorran cómputo y desengaños a quien diseña agentes.
Fuentes
Seguir leyendo
SysAdmin, el test que mide si un modelo busca más poder
Un benchmark coloca a siete modelos frontera como administradores de sistemas Linux para medir si acumulan poder. El resultado: entre 0 y 5 por ciento.
Cuando el estado del anotador contamina los datos de RLHF
Un preprint de arXiv propone que el estado del anotador puede colarse en las etiquetas de preferencia de RLHF y sobrevivir a la agregación. Marco de auditoría, no resultado.
La IA no solo hereda sesgos al contratar, también los crea
Una investigación recogida por MIT Technology Review apunta a que los modelos de lenguaje no solo heredan sesgos de contratación, también generan otros propios.