OpenDiscoveryTrace: 558 trazas para auditar agentes científicos
OpenDiscoveryTrace publica 558 trayectorias completas de agentes científicos con nueve campos por paso, para auditar el razonamiento y no solo el resultado final.
Un benchmark que solo mira el resultado final no distingue entre un modelo que razona y otro que acierta por casualidad. Esa es la premisa de OpenDiscoveryTrace, publicado en arXiv el 11 de septiembre: un conjunto de datos público con 558 trayectorias completas de agentes científicos donde lo que se guarda no es la hipótesis, el código o el paper producido, sino cada paso del proceso que llevó hasta ahí. Los autores lo plantean como respuesta a un hueco concreto: sin proceso no se puede auditar la metodología ni diagnosticar por qué falla un agente.
El formato es lo interesante. Cada paso queda registrado con nueve campos: pensamiento, llamada a herramienta, observación, errores, disparadores de revisión y confianza autodeclarada, entre otros. Las trayectorias cubren 124 tareas científicas repartidas en descubrimiento de fármacos, ciencia de materiales, genómica y análisis de literatura científica. A eso se suman 60 trayectorias variantes con recuperación en vivo, es decir, con acceso a información externa durante la ejecución.
Qué modelos hay dentro
El reparto está equilibrado a propósito. Tres modelos comerciales de gama alta, uno de Anthropic, uno de Google y uno de OpenAI en las versiones que estaban disponibles cuando se ejecutaron las tareas, aportan 124 trayectorias cada uno y cubren todos los dominios y niveles de dificultad. Los cuatro de pesos abiertos (Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini y Qwen2.5-1.5B) aportan 30 cada uno. Ese desequilibrio no parece un descuido sino una decisión de presupuesto: con siete modelos y 124 tareas, la cobertura total habría multiplicado el coste sin aportar demasiado en la franja pequeña. Quien quiera comparar proveedores concretos tendrá que ir al paper y mirar la tabla, porque el interés del conjunto no está en el ranking.
Por qué importa auditar el proceso
La utilidad práctica está en el diagnóstico. Con solo el output final, un fallo es un fallo y poco más: no se sabe si el modelo eligió mal la herramienta, interpretó mal una observación, ignoró un error o se quedó sin presupuesto de pasos. Con la traza completa se puede separar el error de método del error de ejecución, y comparar cómo reacciona cada modelo cuando algo sale mal a mitad de camino. El campo de disparadores de revisión es especialmente revelador: mide si el agente se corrige cuando la evidencia lo contradice o si sigue adelante con la hipótesis inicial.
Hay un detalle que conviene no pasar por alto: la confianza autodeclarada. Pedirle a un modelo que puntúe su propia seguridad en cada paso produce una señal ruidosa, pero registrada a lo largo de cientos de trayectorias permite algo que con un resultado final es imposible: comprobar si esa confianza sube justo antes de los errores o si acompaña de verdad a los aciertos. Es una calibración barata de medir cuando la traza ya existe.
El análisis piloto que acompaña al conjunto de datos se apoya en 363 trayectorias evaluadas por un LLM como juez, un método con sesgos conocidos y que los propios autores presentan como preliminar. Conviene leerlo por lo que es: una primera pasada sobre un material que se publica precisamente para que otros lo analicen mejor y con otras métricas.
Para quién es útil
Para quien evalúa agentes, sean científicos o no, el valor está más en el formato que en el contenido. Una traza de nueve campos por paso es una plantilla razonable para instrumentar cualquier agente propio: si registras pensamiento, llamada, observación, error y confianza, ya tienes con qué depurar cuando algo se tuerce en producción. En Claude Code esa instrumentación se puede montar con hooks en PostToolUse volcando cada llamada a un fichero, sin tocar la lógica del agente ni añadir dependencias.
Nos interesa menos qué modelo queda por delante que la idea de fondo: medir agentes solo por el resultado es medir la suerte junto con el método, y luego no hay forma de saber cuál de las dos se está premiando. Publicar trazas completas es incómodo porque expone los caminos feos, y justo por eso es el tipo de trabajo que hace falta ver más a menudo.
Fuentes
Seguir leyendo
NormReact: los LLM esperan más castigo social que las personas
Un estudio con 450 escenarios de transgresión mide si los modelos anticipan quién sanciona y cómo. Seis LLM predicen sanciones donde las personas no harían nada.
OpenAI, los problemas del milenio y el listón de la prueba
OpenAI dice que sus agentes han resuelto uno de los Problemas del Milenio. El anuncio llegó envuelto en acusaciones, y ahí está lo interesante para quien trabaja con agentes.
Serializar el estado como hipergrafo mejora los world models
HyperWorld compara cuatro formas de serializar el estado en world models textuales: las hiperaristas centradas en entidades ganan en modelos de 0,5B a 1,5B.