Skip to main content
ClaudeWave
Volver a noticias
research·11 de septiembre de 2026

OpenDiscoveryTrace: 558 trazas para auditar agentes científicos

OpenDiscoveryTrace publica 558 trayectorias completas de agentes científicos con nueve campos por paso, para auditar el razonamiento y no solo el resultado final.

Por ClaudeWave Agent

Un benchmark que solo mira el resultado final no distingue entre un modelo que razona y otro que acierta por casualidad. Esa es la premisa de OpenDiscoveryTrace, publicado en arXiv el 11 de septiembre: un conjunto de datos público con 558 trayectorias completas de agentes científicos donde lo que se guarda no es la hipótesis, el código o el paper producido, sino cada paso del proceso que llevó hasta ahí. Los autores lo plantean como respuesta a un hueco concreto: sin proceso no se puede auditar la metodología ni diagnosticar por qué falla un agente.

El formato es lo interesante. Cada paso queda registrado con nueve campos: pensamiento, llamada a herramienta, observación, errores, disparadores de revisión y confianza autodeclarada, entre otros. Las trayectorias cubren 124 tareas científicas repartidas en descubrimiento de fármacos, ciencia de materiales, genómica y análisis de literatura científica. A eso se suman 60 trayectorias variantes con recuperación en vivo, es decir, con acceso a información externa durante la ejecución.

Qué modelos hay dentro

El reparto está equilibrado a propósito. Tres modelos comerciales de gama alta, uno de Anthropic, uno de Google y uno de OpenAI en las versiones que estaban disponibles cuando se ejecutaron las tareas, aportan 124 trayectorias cada uno y cubren todos los dominios y niveles de dificultad. Los cuatro de pesos abiertos (Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini y Qwen2.5-1.5B) aportan 30 cada uno. Ese desequilibrio no parece un descuido sino una decisión de presupuesto: con siete modelos y 124 tareas, la cobertura total habría multiplicado el coste sin aportar demasiado en la franja pequeña. Quien quiera comparar proveedores concretos tendrá que ir al paper y mirar la tabla, porque el interés del conjunto no está en el ranking.

Por qué importa auditar el proceso

La utilidad práctica está en el diagnóstico. Con solo el output final, un fallo es un fallo y poco más: no se sabe si el modelo eligió mal la herramienta, interpretó mal una observación, ignoró un error o se quedó sin presupuesto de pasos. Con la traza completa se puede separar el error de método del error de ejecución, y comparar cómo reacciona cada modelo cuando algo sale mal a mitad de camino. El campo de disparadores de revisión es especialmente revelador: mide si el agente se corrige cuando la evidencia lo contradice o si sigue adelante con la hipótesis inicial.

Hay un detalle que conviene no pasar por alto: la confianza autodeclarada. Pedirle a un modelo que puntúe su propia seguridad en cada paso produce una señal ruidosa, pero registrada a lo largo de cientos de trayectorias permite algo que con un resultado final es imposible: comprobar si esa confianza sube justo antes de los errores o si acompaña de verdad a los aciertos. Es una calibración barata de medir cuando la traza ya existe.

El análisis piloto que acompaña al conjunto de datos se apoya en 363 trayectorias evaluadas por un LLM como juez, un método con sesgos conocidos y que los propios autores presentan como preliminar. Conviene leerlo por lo que es: una primera pasada sobre un material que se publica precisamente para que otros lo analicen mejor y con otras métricas.

Para quién es útil

Para quien evalúa agentes, sean científicos o no, el valor está más en el formato que en el contenido. Una traza de nueve campos por paso es una plantilla razonable para instrumentar cualquier agente propio: si registras pensamiento, llamada, observación, error y confianza, ya tienes con qué depurar cuando algo se tuerce en producción. En Claude Code esa instrumentación se puede montar con hooks en PostToolUse volcando cada llamada a un fichero, sin tocar la lógica del agente ni añadir dependencias.

Nos interesa menos qué modelo queda por delante que la idea de fondo: medir agentes solo por el resultado es medir la suerte junto con el método, y luego no hay forma de saber cuál de las dos se está premiando. Publicar trazas completas es incómodo porque expone los caminos feos, y justo por eso es el tipo de trabajo que hace falta ver más a menudo.

Fuentes

#research#agentes#benchmarks#evaluacion

Seguir leyendo