Skip to main content
ClaudeWave
Volver a noticias
research·23 de septiembre de 2026

Manuales o historias clínicas: qué datos forman mejor un LLM médico

Un estudio en arXiv compara, con tokens igualados, cómo influyen manuales e historias clínicas en un LLM médico. Hallazgo clave: recordar conocimiento no garantiza razonar en clínica.

Por ClaudeWave Agent

Un modelo que acierta más preguntas de examen de medicina no razona necesariamente mejor ante un paciente. Esa es la conclusión más incómoda de un trabajo publicado en arXiv el 23 de septiembre, que estudia cómo influye el tipo de datos de entrenamiento en las capacidades de un LLM médico.

Los autores parten de una práctica habitual: los modelos médicos se entrenan con mezclas de datos didácticos, como libros de texto, y datos clínicos, como historias de pacientes. Lo que no estaba claro es qué aporta cada tipo por separado. Para averiguarlo, diseñan experimentos con el número de tokens igualado, de modo que lo único que cambia entre versiones es la proporción entre material didáctico y clínico.

Qué han encontrado

El resultado principal es una transferencia asimétrica entre tipos de tarea. Según el resumen del artículo, los datos clínicos mejoran las tareas orientadas a la práctica clínica y, a la vez, se mantienen competitivos en las tareas que exigen mucho conocimiento. Los datos didácticos, en cambio, mejoran sobre todo las tareas de conocimiento, pero no trasladan esa ventaja al terreno clínico con la misma eficacia.

Dicho de otra forma, entrenar con historias clínicas enseña al modelo algo que también sirve para responder preguntas teóricas, mientras que entrenar con manuales no enseña igual de bien a trabajar con casos reales.

El análisis de errores apunta a lo que los autores llaman una brecha entre saber y hacer (knowing-doing gap): las mejoras en recuperación de conocimiento no se generalizan de forma fiable al razonamiento clínico. El modelo puede recordar el dato correcto y aun así no aplicarlo bien cuando tiene delante un caso.

Poca cantidad, mucho efecto

El segundo hallazgo tiene implicaciones prácticas directas. Cantidades modestas de datos clínicos bastan para obtener la mayor parte de las mejoras en tareas basadas en historias clínicas electrónicas (EHR). No hace falta un corpus clínico enorme para que el modelo gane capacidad en ese tipo de trabajo.

Además, la proporción óptima entre ambos tipos de datos no es fija. Depende de cuánto conocimiento y cuánto razonamiento clínico exija la tarea final. Por eso los autores concluyen que la selección de datos para LLMs médicos debería guiarse por la aplicación concreta, con mayor peso de datos clínicos cuando el objetivo es el uso asistencial.

Por qué importa

El trabajo toca un problema que va más allá de la medicina. Buena parte de los benchmarks de salud se construyen con preguntas tipo examen, que premian el conocimiento declarativo. Si ese conocimiento no se traduce en razonamiento sobre casos, un modelo puede puntuar muy bien en las tablas y rendir peor de lo esperado en un hospital.

También hay una lectura de coste. Los datos clínicos son caros de conseguir, anonimizar y gestionar por razones legales. Que una cantidad moderada aporte la mayor parte del beneficio en tareas sobre EHR cambia el cálculo para quien se plantee entrenar o ajustar un modelo propio: puede tener más sentido invertir en un conjunto clínico pequeño y bien curado que en acumular más literatura médica.

Para quién es útil

Equipos que ajustan modelos para salud: el estudio ofrece un criterio para decidir la mezcla de datos en función del caso de uso, en lugar de una receta única.

Quien evalúa modelos para hospitales o aseguradoras: conviene no fiarse solo de benchmarks de conocimiento y añadir pruebas con casos clínicos reales o simulados.

Desarrolladores de aplicaciones sobre modelos generalistas: aunque no entrenen nada, la brecha entre saber y hacer sugiere que el contexto que se pasa al modelo, por ejemplo fragmentos de historias clínicas recuperados vía un MCP server, puede pesar más que añadir documentación teórica al prompt.

Hay que leerlo con cautela: es un preprint recién publicado, todavía sin revisión por pares, y las conclusiones dependen de las tareas y los modelos concretos que los autores han utilizado.

En ElephantPink vemos el mismo patrón fuera de la medicina: en los proyectos con agentes, los ejemplos reales del cliente enseñan más que cualquier manual interno. Este estudio pone números a esa intuición en un sector donde equivocarse sale especialmente caro.

Fuentes

#llm-medicos#datos-de-entrenamiento#arxiv#salud#fine-tuning

Seguir leyendo