Constructive Alignment: alinear la IA con preferencias que cambian
Un paper en arXiv propone Constructive Alignment: dejar de tratar las preferencias humanas como fijas y gestionar como la IA moldea su evolucion en el tiempo.
La mayoria de propuestas para alinear modelos de IA parten de una idea comoda: que las preferencias humanas son un objetivo fijo que basta con inferir y optimizar. Un nuevo articulo en arXiv sostiene que esa premisa choca con la evidencia. Las preferencias no son estables: se construyen, cambian y se ordenan por capas a medida que interactuamos, sobre todo con tecnologias que se adaptan a nosotros.
El trabajo, titulado Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction, propone dar la vuelta al problema. En lugar de tratar la alineacion como la satisfaccion de preferencias estaticas, la plantea como un problema de control sobre trayectorias de preferencias que evolucionan en el tiempo.
Que cambia respecto al enfoque habitual
El marco dominante en alineacion asume que existe algo asi como la voluntad real del usuario, oculta pero estable, que el sistema debe descubrir. Los autores replican que esa voluntad no espera ahi fuera intacta: se forma en parte durante la propia interaccion. Cuando un sistema es persistente, personalizado y esta integrado en la vida social, participa en decidir a que prestamos atencion, que valoramos y que acabamos aprobando.
Para formalizarlo, el paper modela las preferencias como variables de estado por capas que evolucionan bajo la interaccion con la IA. Toma prestadas herramientas de la economia del comportamiento, la psicologia y la teoria social constructivista, y las traduce a un marco de teoria de control. En ese marco, las acciones del sistema y el propio diseno de la interaccion influyen a la vez en el estado del mundo y en el estado evaluativo de la persona, es decir, en como juzga y que desea.
Por que esto importa
La conclusion mas incomoda del planteamiento es directa: alinear no consiste solo en controlar el comportamiento del modelo, sino en regular como el modelo influye en la evolucion de las preferencias humanas. Dicho de otro modo, un asistente que optimiza el compromiso puede estar cumpliendo a la perfeccion las preferencias que el mismo ha ayudado a moldear, y aun asi dejar a la persona peor de lo que estaba.
Es un problema que quien haya usado redes sociales reconoce enseguida. Un feed puede satisfacer con exactitud lo que pides clic a clic y, al mismo tiempo, ir cambiando lo que pides. Trasladar esa dinamica a asistentes conversacionales que recuerdan, personalizan y acompanan durante meses eleva la apuesta. La pregunta deja de ser solo hace lo que quiero y pasa a ser en que me esta convirtiendo lo que hace.
Para quien es util
El articulo es teorico y no ofrece un metodo listo para implementar, algo que conviene tener claro antes de leerlo. Su valor esta en el encuadre. A quien disena sistemas de alineacion, RLHF o mecanismos de feedback le da un vocabulario para nombrar un riesgo que las metricas de satisfaccion inmediata no capturan. A quien trabaja en politica y gobernanza de IA le ofrece un argumento formal para exigir que se evaluen los efectos a largo plazo, no solo la respuesta puntual.
Tambien conecta con debates que ya estan sobre la mesa: la personalizacion excesiva, los asistentes que refuerzan sesgos del usuario o los sistemas que priorizan la retencion. Poner todo eso bajo un marco de teoria de control es un intento de pasar de la intuicion a algo medible.
Nuestra lectura
Nos parece un encuadre valioso precisamente porque incomoda. Reconocer que un sistema moldea las preferencias que dice servir obliga a evaluar la alineacion en el tiempo y no en una sola respuesta, y eso es dificil de medir. El riesgo del planteamiento es el contrario: si la IA debe regular como evolucionan nuestras preferencias, alguien decide hacia donde, y esa decision no es tecnica sino politica. El paper abre la pregunta correcta; quien la responda tendra que ser mas explicito sobre quien sostiene el mando.
Fuentes
Seguir leyendo
SysAdmin, el test que mide si un modelo busca más poder
Un benchmark coloca a siete modelos frontera como administradores de sistemas Linux para medir si acumulan poder. El resultado: entre 0 y 5 por ciento.
Cuando el estado del anotador contamina los datos de RLHF
Un preprint de arXiv propone que el estado del anotador puede colarse en las etiquetas de preferencia de RLHF y sobrevivir a la agregación. Marco de auditoría, no resultado.
La IA no solo hereda sesgos al contratar, también los crea
Una investigación recogida por MIT Technology Review apunta a que los modelos de lenguaje no solo heredan sesgos de contratación, también generan otros propios.