Un paper cuestiona las comparaciones por pares en el alineamiento de IA
Un estudio en arXiv formaliza el pluralismo interno y detecta dos fallos en las comparaciones por pares, la base de métodos de alineamiento como RLHF y del feedback binario.
Proporcionalidad, igualitarismo y trato igual: según un paper publicado en arXiv el 7 de julio de 2026, estas prioridades son inherentemente globales y las comparaciones por pares, la herramienta estándar para aprender preferencias humanas en alineamiento de IA y diseño participativo, no consiguen capturarlas. El trabajo, disponible como arXiv:2607.02672, formaliza un concepto que los autores llaman pluralismo interno y del que se derivan dos fallos concretos de este tipo de datos.
El método en cuestión es omnipresente. Cuando un anotador elige entre dos respuestas de un modelo, cuando una plataforma pregunta cuál de dos opciones prefieres o cuando un proceso participativo pide ordenar alternativas de dos en dos, se están usando comparaciones locales por pares. El propio abstract sitúa el problema en dos contextos: el diseño participativo y el alineamiento de sistemas automatizados. Sobre esos datos se construyen los modelos de recompensa que guían técnicas como RLHF, con las que se entrenan los principales modelos de lenguaje actuales.
Dos supuestos que casi nadie cuestiona
Los autores señalan que este método asume dos cosas sin decirlo: que las comparaciones locales son evidencia suficiente sobre cómo quiere una persona que se comporte una regla de decisión automatizada, y que la gente siempre puede responder a esas comparaciones de forma decidida. El paper investiga qué pasa cuando ambas suposiciones chocan con el pluralismo interno: la idea de que una misma persona evalúa las reglas de decisión según varias prioridades que considera legítimas a la vez.
No hace falta irse muy lejos para verlo. Alguien puede querer que un sistema de reparto sea proporcional al mérito y, al mismo tiempo, que nadie quede por debajo de un mínimo. Ambas prioridades son razonables, ambas son suyas, y en muchos casos concretos entran en conflicto.
Dónde fallan las comparaciones locales
Con un modelo formal de estas preferencias pluralistas, el paper identifica dos fallos distintos. El primero: prioridades como la proporcionalidad, el igualitarismo o el trato igual son globales por naturaleza. Lo que implican en un caso depende de lo que ocurre en el resto de casos, así que ninguna cantidad de comparaciones locales basta para capturarlas. El segundo: incluso cuando las prioridades sí se pueden representar localmente, la tensión entre prioridades fuertemente arraigadas genera conflicto interno, y forzar una respuesta produce distorsiones de comportamiento potencialmente costosas en los datos.
Qué implica para el alineamiento de LLMs
La lectura para el ecosistema de modelos de lenguaje es directa. Los pipelines de alineamiento basados en preferencias, desde RLHF hasta las variantes con jueces automáticos, heredan estas limitaciones si su materia prima son elecciones binarias forzadas. Los modelos actuales, incluidos los de Anthropic y otros laboratorios, se entrenan en parte con comparaciones de este tipo. Si una parte de los anotadores responde con conflicto interno, el modelo de recompensa no está aprendiendo una preferencia limpia sino el residuo de una tensión que el formato de la pregunta no deja expresar.
Esto no invalida los métodos actuales, pero sí acota lo que pueden prometer. Y conecta con una conversación más amplia sobre alineamiento pluralista que la comunidad investigadora lleva tiempo abriendo: cómo diseñar sistemas que representen valores múltiples y en tensión en lugar de aplanarlos en una única función de recompensa.
Para quién es útil
El paper interesa a investigadores de alineamiento, pero también a perfiles más aplicados: equipos que recogen feedback de usuarios con pulgares arriba y abajo, productos que hacen tests A/B sobre comportamiento de asistentes, y proyectos de diseño participativo o civic tech que agregan preferencias ciudadanas. En todos esos casos, el formato de la pregunta condiciona qué valores llegan a los datos y cuáles se quedan fuera.
En ElephantPink trabajamos a diario con sistemas ajustados mediante preferencias humanas, y este tipo de trabajo teórico nos parece necesario: antes de discutir si un modelo está bien alineado, conviene saber qué pueden y qué no pueden medir los datos con los que se alinea.
Fuentes
Seguir leyendo
SysAdmin, el test que mide si un modelo busca más poder
Un benchmark coloca a siete modelos frontera como administradores de sistemas Linux para medir si acumulan poder. El resultado: entre 0 y 5 por ciento.
Cuando el estado del anotador contamina los datos de RLHF
Un preprint de arXiv propone que el estado del anotador puede colarse en las etiquetas de preferencia de RLHF y sobrevivir a la agregación. Marco de auditoría, no resultado.
La IA no solo hereda sesgos al contratar, también los crea
Una investigación recogida por MIT Technology Review apunta a que los modelos de lenguaje no solo heredan sesgos de contratación, también generan otros propios.