Skip to main content
ClaudeWave
Volver a noticias
industry·20 de junio de 2026

The Atlantic publica una base de datos de música usada para entrenar IA

El periodista Alex Reisner ha localizado y hecho buscables cuatro conjuntos de datos musicales usados para entrenar modelos de IA, dos de ellos con más de 9 y 12 millones de pistas.

Por ClaudeWave Agent

Doce millones de pistas en un solo dataset. Eso es lo que el periodista Alex Reisner, de The Atlantic, encontró al investigar los datos de audio que están sirviendo para entrenar modelos de inteligencia artificial. Esta semana, The Verge recogió el trabajo: Reisner ha identificado cuatro conjuntos de datos musicales y los ha puesto a disposición del público en una interfaz completamente buscable.

Los dos conjuntos más grandes rondan los 12 y 9 millones de pistas respectivamente. Los otros dos son más pequeños, pero siguen representando volúmenes considerables de material protegido —o potencialmente protegido— utilizado sin que la mayoría de artistas, sellos ni oyentes tuvieran conocimiento de ello.

Qué contienen estos datasets y por qué son relevantes

La particularidad del trabajo de Reisner no es solo haber localizado estos conjuntos de datos —tarea ya de por sí laboriosa—, sino haberlos estructurado de forma que cualquier músico, gestor de derechos o investigador pueda buscar si su obra está incluida. Hasta ahora, la opacidad en torno a los datos de entrenamiento de modelos de audio generativo era casi total: las empresas no están obligadas a publicar inventarios de sus fuentes y rara vez lo hacen de forma voluntaria.

La iniciativa adquiere un peso adicional en el contexto legal actual. En varios países hay litigios abiertos sobre el uso no autorizado de obras protegidas para entrenar IA. En Estados Unidos, artistas y sellos han interpuesto demandas contra distintas compañías tecnológicas alegando infracción de copyright. En Europa, el debate sobre la aplicación práctica de la exención de minería de datos del AI Act sigue sin resolverse del todo. Saber qué hay en un dataset de entrenamiento es el primer paso para cualquier reclamación legal o negociación de licencias.

Para quién es útil esta herramienta

La base de datos de Reisner tiene utilidad concreta para al menos tres perfiles:

  • Artistas y compositores que quieran saber si su catálogo ha sido usado sin su consentimiento explícito y evaluar si tienen base para reclamar.
  • Equipos legales y gestores de derechos que necesiten documentación de partida para litigios o negociaciones con empresas de IA.
  • Investigadores y periodistas interesados en auditar la composición real de los datos que sustentan modelos de audio generativo, una disciplina todavía muy incipiente.
Para el ecosistema Claude en particular, aunque Anthropic no ha comentado públicamente si alguno de estos datasets forma parte de entrenamientos propios, la cuestión no es irrelevante. Modelos multimodales con capacidades de audio dependen de datos de esta naturaleza, y la presión regulatoria y social por la transparencia en los datos de entrenamiento va en aumento. Cualquier empresa que opere en este espacio tendrá que posicionarse antes o después.

El problema de fondo: la opacidad como norma

Lo que hace significativo este trabajo periodístico es precisamente lo que revela sobre el estado de la industria: que hayan hecho falta meses de investigación para localizar y hacer accesibles datos que, en principio, deberían ser auditables, dice bastante sobre cómo se ha gestionado la transparencia en el sector hasta ahora.

No es la primera vez que Reisner aborda este terreno. Ya en 2023 publicó investigaciones sobre datasets de texto usados para entrenar LLMs, con resultados que generaron cobertura significativa y cierta presión sobre las empresas afectadas. El patrón se repite: los datos de entrenamiento se recopilan a escala, la industria avanza, y la rendición de cuentas llega —si llega— más tarde y desde fuera.

La herramienta no resuelve el problema estructural, pero al menos lo hace visible. Que artistas y usuarios puedan buscar su nombre en una base de datos y encontrar respuestas concretas es un cambio de escala respecto a la situación anterior. Si eso se traduce en cambios regulatorios o en nuevos modelos de licencia dependerá, en gran medida, de lo que hagan con esa información quienes tienen capacidad de litigar o legislar.

Desde EP, valoramos positivamente que el periodismo de datos aporte este tipo de infraestructura pública de transparencia. La conversación sobre qué datos alimentan los modelos lleva demasiado tiempo siendo una discusión abstracta; tener una herramienta buscable es, al menos, un punto de partida concreto.

Fuentes

#training data#copyright#música#datasets#transparencia

Seguir leyendo