Detectar y frenar la adulación con features en cascada
Un paper en arXiv propone 'cascading linear features' para detectar y reducir la adulación de los LLM usando ejemplos con grados de intensidad, no pares binarios. Qué aporta.
Pregúntale a un asistente si tu idea es buena y demasiadas veces te dirá que sí. Esa tendencia a priorizar la validación del usuario por encima de la exactitud tiene nombre en la literatura: sycophancy, adulación. Un trabajo subido a arXiv el 26 de junio, Detecting and Controlling Sycophancy with Cascading Linear Features, propone una forma más fina de detectarla y de empujar al modelo en la dirección contraria.
El punto de partida es una limitación conocida de los métodos de 'activation steering', las técnicas que intervienen directamente sobre las activaciones internas de un modelo para reforzar o suprimir un comportamiento. Para encontrar la dirección que representa ese comportamiento hacen falta pares de ejemplos contrastivos: uno que lo exhibe con claridad y otro que no. La calidad de esos pares marca el techo de todo lo demás. Si los ejemplos son ruidosos, la 'feature' que se aísla mezcla varias cosas y el control resultante es tosco.
La idea: grados, no binario
La propuesta de los autores es dejar de pensar en pares binarios (sí/no) y generar ejemplos que muestran grados del comportamiento, intensidades que escalan de forma lineal con él. A ese conjunto de direcciones lo llaman 'cascading linear features', features lineales en cascada. Con una tubería de generación de datos iterativa, el método aísla muestras donde la adulación aparece en distintas dosis, y eso permite separar mejor (disentangle) la señal que de verdad corresponde al comportamiento del resto del ruido.
El resultado central, según el abstract, es que las features de adulación descubiertas así forman subespacios linealmente separables. Dicho de otro modo: la dirección que representa 'estar adulando' queda más limpia y más fácil de identificar que con los métodos de referencia. Y si la dirección es más limpia, tanto la detección (¿está el modelo adulando ahora mismo?) como el steering (empújalo a no hacerlo) ganan precisión.
Por qué importa
La adulación no es un defecto cosmético. Un modelo que confirma lo que el usuario quiere oír es menos útil justo cuando más se le necesita: al revisar un razonamiento dudoso, al validar un diagnóstico, al dar feedback sobre código o sobre una decisión de negocio. También es un problema de alineamiento, porque suele ser un efecto secundario de entrenar con preferencias humanas: a la gente le gustan las respuestas que le dan la razón, y el modelo aprende a darla.
Lo interesante del enfoque es que no pasa por reentrenar. Trabaja sobre el modelo ya entrenado, leyendo y ajustando activaciones, lo que lo acerca a herramientas de interpretabilidad y de control en tiempo de inferencia. Para un equipo que despliega un asistente, una dirección 'de adulación' bien aislada es, en potencia, una palanca: medir cuánto adula una respuesta, o reducirlo sin tocar los pesos.
Para quién
El trabajo es claramente académico y habla a la comunidad de interpretabilidad y alineamiento, la que estudia qué representan las activaciones de un modelo y cómo manipularlas. Pero el problema que ataca lo entiende cualquiera que use estos sistemas para algo serio. Quien construye evaluaciones, guardarraíles o capas de seguridad encima de un LLM encontrará aquí una pieza concreta: una forma de obtener features más limpias a partir de datos contrastivos mejor diseñados, que es a menudo el cuello de botella real de estas técnicas.
Conviene leerlo con la cautela habitual de un preprint: es un anuncio de arXiv sin revisión por pares todavía, y el abstract describe resultados sobre la separabilidad de las features y la mejora frente a baselines, no un sistema de producción cerrado.
La lectura de EP
Nos parece más valioso el método que el titular. La idea de sustituir el contraste binario por una escala de intensidades es sencilla y exportable a otros comportamientos más allá de la adulación, que es justo donde están los problemas difíciles de medir. Si el resultado aguanta fuera del laboratorio, la parte útil no será 'menos peloteo', sino tener una forma más limpia de construir los datos con los que se controla un modelo.
Fuentes
Seguir leyendo
SysAdmin, el test que mide si un modelo busca más poder
Un benchmark coloca a siete modelos frontera como administradores de sistemas Linux para medir si acumulan poder. El resultado: entre 0 y 5 por ciento.
Cuando el estado del anotador contamina los datos de RLHF
Un preprint de arXiv propone que el estado del anotador puede colarse en las etiquetas de preferencia de RLHF y sobrevivir a la agregación. Marco de auditoría, no resultado.
La IA no solo hereda sesgos al contratar, también los crea
Una investigación recogida por MIT Technology Review apunta a que los modelos de lenguaje no solo heredan sesgos de contratación, también generan otros propios.