Distribird: priors bayesianos extraídos de la literatura
Una app agéntica que construye priors informados leyendo papers en lugar de asumir distribuciones uniformes. Probada en 24 parámetros de 10 dominios con tres modelos open weight.
Pese a décadas de trabajo metodológico, casi todo el que calibra un modelo bayesiano de procesos acaba tirando de priors uniformes. No por convicción estadística, sino porque construir un prior informado a partir de la literatura es lento y exige a la vez dominio del campo y soltura estadística. Ese diagnóstico, tan poco glamuroso como cierto, abre Distribird, publicado el 13 de agosto en arXiv.
La propuesta es acotada y comprobable: se le pasa el nombre de un parámetro, su descripción física y el contexto de dominio, y una tubería multiagente busca en la literatura, extrae los valores reportados, los pondera por relevancia de dominio y ajusta una distribución de probabilidad eligiendo modelo por AIC. Los autores lo evalúan sobre 24 parámetros repartidos en 10 dominios científicos.
Qué lo separa de un chatbot con buscador
Cuatro decisiones de diseño, y ninguna es el modelo de lenguaje:
1. La ponderación por relevancia de dominio. No todos los valores publicados pesan igual, y esa es precisamente la parte que un investigador hace a mano y que rara vez documenta.
2. El ajuste por selección de modelo con AIC, en lugar de asumir que toda incertidumbre es normal o lognormal porque es lo cómodo.
3. Un fallback explícito a alternativas no informativas cuando la literatura no da para más. El sistema admite que no sabe en vez de inventar un prior estrecho.
4. El reporte de la evidencia detrás de cada prior y de su nivel de confianza.
Ese último punto es el que nos parece más importante. Un prior sin procedencia es una decisión metodológica escondida dentro de un paper. Si la herramienta devuelve el número junto con las fuentes que lo sostienen y una confianza declarada, el revisor puede discutirlo. Si devuelve solo el número, se ha automatizado el atajo, no el trabajo.
Modelos de pesos abiertos, no APIs
La evaluación compara tres modelos open weight: Qwen3.6 27B, Gemma 4 31B y un tercero cuyo nombre queda cortado en el resumen público de arXiv. La elección no es casual. Un pipeline científico que depende de una API propietaria envejece mal: el modelo cambia bajo los pies, el resultado deja de ser reproducible y los datos salen de la institución. Con pesos abiertos, la calibración de hace dos años se puede volver a correr tal cual.
Para quién es útil
Para modelización de procesos con parámetros físicamente interpretables: hidrología, agronomía, ecología, epidemiología, farmacocinética, ingeniería de materiales. Los propios autores acotan el ámbito, y hacen bien: esto no sirve para una red neuronal cuyos pesos individuales no significan nada, ni para parámetros que nadie ha publicado nunca.
El patrón, más allá del paper
Distribird es también un ejemplo limpio de algo que en el ecosistema Claude se monta a diario con subagentes y MCP servers: una etapa por agente, salida estructurada en cada una y un artefacto verificable al final. Buscar, extraer, ponderar y ajustar son cuatro trabajos distintos, y separarlos permite auditar dónde falló cuando el resultado no cuadra. La diferencia práctica está entre "el sistema propone 0,35" y "el sistema propone 0,35 a partir de estas seis fuentes, con este ajuste y esta confianza".
Lo que queda por ver
El resumen público se corta antes de los resultados, así que no sabemos cómo se comportan los tres modelos entre sí ni cuánto se alejan los priors generados de los que construiría un experto. Y hay un riesgo de fondo que ninguna herramienta resuelve: la literatura publicada ya viene sesgada. Un prior destilado de papers hereda el sesgo de esos papers, y la confianza declarada por el sistema mide cuánta evidencia hay, no cuánto vale esa evidencia.
Nos interesa Distribird no por automatizar sino por dejar rastro: dice de dónde sale cada número y con cuánta seguridad lo dice. En herramientas científicas asistidas por LLM, esa trazabilidad vale más que un punto extra de precisión.
Fuentes
Seguir leyendo
Un DAG de proceso lleva a los agentes LLM del 0% al 100% en CDISC
Cinco modelos frontera fallaron al generar un dataset ADSL válido en 11 intentos. Con una topología DAG y Claude Sonnet 4.6, el mismo trabajo sale completo.
Gobernanza en runtime: el modelo propone, el runtime decide
Un paper de arXiv mide 6.300 ejecuciones y encuentra 79 filtraciones de riesgo con gobernanza por prompt. Con un boundary en runtime, los efectos peligrosos caen a cero.
IntegrityBench: los LLM fallan un tercio de decisiones bajo presión
IntegrityBench somete a 18 variantes de modelos frontera a 36 tareas pareadas bajo cinco niveles de presión. En el pico fallan una de cada tres decisiones de integridad.