Un DAG de proceso lleva a los agentes LLM del 0% al 100% en CDISC
Cinco modelos frontera fallaron al generar un dataset ADSL válido en 11 intentos. Con una topología DAG y Claude Sonnet 4.6, el mismo trabajo sale completo.
Once intentos, cinco modelos frontera, cero datasets válidos. Ese es el punto de partida de GxP-Agent, un trabajo publicado en arXiv el 19 de agosto que mide algo muy concreto: qué pasa cuando le pides a un LLM que convierta un protocolo de ensayo clínico en un dataset listo para análisis bajo estándares CDISC. La respuesta, en modo single shot, es que ninguno de los cinco modelos produjo un dataset ADSL válido. Ni uno.
Conviene entender por qué esa tarea es tan hostil. La programación de ensayos clínicos es el cuello de botella de cualquier envío regulatorio: hay que transformar datos crudos en tablas normalizadas siguiendo un estándar cerrado, con reglas de derivación que dependen unas de otras y con trazabilidad auditable. No se trata de generar código bonito, sino código que un revisor de la FDA pueda reproducir. Un fallo en una variable derivada temprano contamina todo lo que viene después, y el modelo no tiene forma de saberlo si escupe el fichero entero de una sentada.
Qué cambia la topología
La propuesta de los autores no es un modelo mejor ni un prompt más largo. Es una topología. GxP-Agent codifica el orden del proceso regulatorio como un grafo dirigido acíclico (DAG) y parte la generación monolítica del dataset en 15 nodos de dominio. Cada nodo lo ejecuta un agente worker con contexto de skills de pharmaverse (el ecosistema de paquetes R para farma), pasa por una validation gate y, si falla, entra en reintento condicional.
Dicho de otro modo: el sistema no le pide al modelo que resuelva el problema completo. Le pide que resuelva un trozo cuyas dependencias ya están satisfechas, y comprueba el resultado antes de dejarlo avanzar. El orden no lo improvisa el LLM, lo impone el grafo.
Los números
Los autores construyen CDISC-Bench, un benchmark de ejecución levantado sobre el envío piloto de la FDA CDISCPilot01: 254 sujetos y 49 variables ADSL de referencia. Sobre ese banco de pruebas, los resultados que publican son estos:
1. GxP-Agent con Claude Sonnet 4.6: 100% de coincidencia estructural (49/49 variables, 254 registros correctos) en tres ejecuciones independientes.
2. Mejor baseline con retrieval aumentado: 59,2%.
3. Todos los enfoques de agente único y de multiagente plano: 0%.
El dato que más nos interesa es otro. Con el mismo DAG, GPT-4.1 llega al 59,2% de media, muy por encima de lo que ese modelo saca por su cuenta en la misma tarea. La topología no solo mejora al modelo fuerte, también rescata al débil. Eso apunta a que buena parte del fallo no era capacidad de razonamiento sino ausencia de estructura de ejecución.
Hay que leer el resultado con cuidado. Coincidencia estructural no equivale a corrección clínica firmada, tres ejecuciones son tres ejecuciones y un único envío piloto no cubre la variedad real de protocolos. CDISC-Bench lo presentan los propios autores en el mismo paper, así que todavía no hay terceros replicando los números.
Para quién es útil
Si trabajas en farma o en una CRO, la lectura práctica es directa: el problema no se arregla esperando al siguiente modelo. Se arregla modelando el proceso que ya tienes documentado, porque en un entorno GxP ese proceso está documentado por obligación, y convirtiéndolo en grafo de ejecución con gates de validación.
Y si no trabajas en farma, el patrón se traslada igual. Cualquier flujo con dependencias duras y validación objetiva encaja: cierres contables, migraciones de datos, informes regulados, pipelines ETL con reglas de negocio. Los ingredientes ya están en Claude Code: subagentes para los nodos, skills para el contexto de dominio de cada uno, hooks para las validation gates. Lo que aporta el paper es la disciplina de ordenar todo eso con un DAG explícito en vez de dejar que un orquestador decida sobre la marcha.
En ElephantPink venimos viendo lo mismo en integraciones bastante menos reguladas: los sistemas multiagente que aguantan en producción son los que tienen el orden escrito fuera del modelo. Este trabajo no descubre esa idea, pero la mide con un número difícil de ignorar, del 0% al 100% sin cambiar de modelo.
Fuentes
Seguir leyendo
Gobernanza en runtime: el modelo propone, el runtime decide
Un paper de arXiv mide 6.300 ejecuciones y encuentra 79 filtraciones de riesgo con gobernanza por prompt. Con un boundary en runtime, los efectos peligrosos caen a cero.
IntegrityBench: los LLM fallan un tercio de decisiones bajo presión
IntegrityBench somete a 18 variantes de modelos frontera a 36 tareas pareadas bajo cinco niveles de presión. En el pico fallan una de cada tres decisiones de integridad.
Las técnicas de alineamiento como herramienta de censura
Un position paper en arXiv sostiene que las técnicas de alineamiento son tecnología de doble uso y que el mismo tooling que evita daños sirve para censurar.