Manuales o historias clínicas: qué datos forman mejor un LLM médico
Un estudio en arXiv compara, con tokens igualados, cómo influyen manuales e historias clínicas en un LLM médico. Hallazgo clave: recordar conocimiento no garantiza razonar en clínica.
Un modelo que acierta más preguntas de examen de medicina no razona necesariamente mejor ante un paciente. Esa es la conclusión más incómoda de un trabajo publicado en arXiv el 23 de septiembre, que estudia cómo influye el tipo de datos de entrenamiento en las capacidades de un LLM médico.
Los autores parten de una práctica habitual: los modelos médicos se entrenan con mezclas de datos didácticos, como libros de texto, y datos clínicos, como historias de pacientes. Lo que no estaba claro es qué aporta cada tipo por separado. Para averiguarlo, diseñan experimentos con el número de tokens igualado, de modo que lo único que cambia entre versiones es la proporción entre material didáctico y clínico.
Qué han encontrado
El resultado principal es una transferencia asimétrica entre tipos de tarea. Según el resumen del artículo, los datos clínicos mejoran las tareas orientadas a la práctica clínica y, a la vez, se mantienen competitivos en las tareas que exigen mucho conocimiento. Los datos didácticos, en cambio, mejoran sobre todo las tareas de conocimiento, pero no trasladan esa ventaja al terreno clínico con la misma eficacia.
Dicho de otra forma, entrenar con historias clínicas enseña al modelo algo que también sirve para responder preguntas teóricas, mientras que entrenar con manuales no enseña igual de bien a trabajar con casos reales.
El análisis de errores apunta a lo que los autores llaman una brecha entre saber y hacer (knowing-doing gap): las mejoras en recuperación de conocimiento no se generalizan de forma fiable al razonamiento clínico. El modelo puede recordar el dato correcto y aun así no aplicarlo bien cuando tiene delante un caso.
Poca cantidad, mucho efecto
El segundo hallazgo tiene implicaciones prácticas directas. Cantidades modestas de datos clínicos bastan para obtener la mayor parte de las mejoras en tareas basadas en historias clínicas electrónicas (EHR). No hace falta un corpus clínico enorme para que el modelo gane capacidad en ese tipo de trabajo.
Además, la proporción óptima entre ambos tipos de datos no es fija. Depende de cuánto conocimiento y cuánto razonamiento clínico exija la tarea final. Por eso los autores concluyen que la selección de datos para LLMs médicos debería guiarse por la aplicación concreta, con mayor peso de datos clínicos cuando el objetivo es el uso asistencial.
Por qué importa
El trabajo toca un problema que va más allá de la medicina. Buena parte de los benchmarks de salud se construyen con preguntas tipo examen, que premian el conocimiento declarativo. Si ese conocimiento no se traduce en razonamiento sobre casos, un modelo puede puntuar muy bien en las tablas y rendir peor de lo esperado en un hospital.
También hay una lectura de coste. Los datos clínicos son caros de conseguir, anonimizar y gestionar por razones legales. Que una cantidad moderada aporte la mayor parte del beneficio en tareas sobre EHR cambia el cálculo para quien se plantee entrenar o ajustar un modelo propio: puede tener más sentido invertir en un conjunto clínico pequeño y bien curado que en acumular más literatura médica.
Para quién es útil
Equipos que ajustan modelos para salud: el estudio ofrece un criterio para decidir la mezcla de datos en función del caso de uso, en lugar de una receta única.
Quien evalúa modelos para hospitales o aseguradoras: conviene no fiarse solo de benchmarks de conocimiento y añadir pruebas con casos clínicos reales o simulados.
Desarrolladores de aplicaciones sobre modelos generalistas: aunque no entrenen nada, la brecha entre saber y hacer sugiere que el contexto que se pasa al modelo, por ejemplo fragmentos de historias clínicas recuperados vía un MCP server, puede pesar más que añadir documentación teórica al prompt.
Hay que leerlo con cautela: es un preprint recién publicado, todavía sin revisión por pares, y las conclusiones dependen de las tareas y los modelos concretos que los autores han utilizado.
En ElephantPink vemos el mismo patrón fuera de la medicina: en los proyectos con agentes, los ejemplos reales del cliente enseñan más que cualquier manual interno. Este estudio pone números a esa intuición en un sector donde equivocarse sale especialmente caro.
Fuentes
Seguir leyendo
LoRA en sonar: más del doble de AUPRC con un 0,26% de pesos
Un ViT congelado, LoRA de rango 4 y el AUPRC sube de 0,300 a 0,679 en reconocimiento de objetivos con sonar. El paper vale sobre todo por cómo está evaluado.
CaLR: revisar el razonamiento latente en modelos de difusión
CaLR reformula el razonamiento como optimización latente con restricciones y corrige los pasos intermedios mientras genera. Un paper de arXiv con Sudoku como banco de pruebas.
RBS-Attention recorta seis veces el tiempo hasta el primer token a 128K
Un método sin entrenamiento que selecciona bloques de atención con dos ramas y acelera 5,97 veces el tiempo hasta el primer token a 128K en Qwen3-30B, con pérdida mínima en RULER.