Inteligencia artificial y derecho de autor: primeras propuestas de regulación

Compartimos en esta nota un análisis sobre un informe clave de la Oficina de Derechos de Autor de Estados Unidos (U.S. Copyright Office) que aborda las complejas cuestiones del derecho de autor en relación con el entrenamiento de la Inteligencia Artificial (IA) generativa. Este informe, titulado «Copyright e Inteligencia Artificial, Parte 3: Entrenamiento de IA Generativa», es una versión preliminar publicada por la Oficina en respuesta a solicitudes del Congreso y el interés de diversas partes interesadas. Seguramente estamos en presencia de los primeros pasos de una regulación novedosa que vendrá en breve.

El documento ofrece una visión técnica sobre cómo funcionan los sistemas de IA generativa y examina en qué momentos de su desarrollo se podrían estar realizando actos que implican el derecho de autor. Pueden acceder a la versión publicada al final de esta nota.

Puntos Clave del Informe de la Oficina de Derechos de Autor de EE. UU.

  1. Implicaciones del Derecho de Autor en el Proceso de Desarrollo: El informe identifica principalmente tres etapas donde surgen potenciales implicaciones de derecho de autor:
    • Recopilación y Curación de Datos: El informe subraya que el contenido utilizado para entrenar la IA, incluyendo obras protegidas por derechos de autor, no debe considerarse simplemente «datos» en un sentido genérico, ya que encarnan expresión creativa protegida. La recopilación a menudo implica descargar contenido disponible públicamente en internet, lo cual no significa que esté necesariamente autorizado. Algunas fuentes comunes incluyen web scraping, bases de datos, y descargas masivas de videos o subtítulos. Se menciona que algunos desarrolladores podrían incluso usar material pirateado o acceder ilegalmente a datos, saltándose barreras de pago. La curación implica filtrar, limpiar (a veces eliminando información de gestión de derechos de autor), y compilar datasets. Se destaca que la calidad de los datos es crucial para el rendimiento del modelo.
    • Entrenamiento: Esta fase implica la copia y retención de obras dentro de los parámetros del modelo, a veces llamada memoria «paramétrica». El proceso requiere hacer copias, frecuentemente de forma repetida, de los datos de entrenamiento. Existe la posibilidad de que los modelos «memoricen» contenido de sus datos de entrenamiento. El informe indica que la responsabilidad por las salidas (outputs) de la IA que infrinjan derechos de autor se abordará en una parte posterior.
    • Generación Aumentada por Recuperación (RAG): Esta es una característica común donde el sistema recupera obras individuales relevantes para la consulta del usuario para mejorar la respuesta. Este proceso también conlleva hacer reproducciones. El uso de RAG es una preocupación particular para los medios de noticias, especialmente cuando las salidas resumen artículos, ya que esto puede sustituir el acceso a las fuentes originales y desviar tráfico.
  2. Análisis del Uso Justo (Fair Use): El informe explora cómo la doctrina del uso justo, una limitación legal a los derechos exclusivos de autor en EE. UU., podría aplicarse a estas actividades. La Oficina mantiene un índice de uso justo y participa en la formulación de posiciones gubernamentales en casos relevantes. El análisis se basa en los cuatro factores tradicionales:
    • Propósito y Carácter del Uso: Se debate si el entrenamiento es un uso «transformativo» (que añade nuevo significado o propósito). La Oficina rechaza el argumento de que la IA solo usa ideas o hechos, afirmando que el entrenamiento utiliza elementos expresivos de las obras subyacentes. Las empresas buscan contenido expresivo para que los modelos imiten la creatividad humana. Un uso es menos transformativo si la salida sustituye a la obra original, como resúmenes de artículos de noticias en RAG. El acceso ilegal a material (piratería) también impacta el carácter del uso.
    • Naturaleza de la Obra Protegida: La ley estadounidense considera más probable el uso justo en obras fácticas que en obras de ficción o creatividad.
    • Cantidad y Sustancialidad de la Porción Utilizada: El uso de obras completas para el entrenamiento es menos justificable que en casos previos como Google Books o búsquedas de miniaturas. Aunque las empresas de IA usan enormes datasets, la Oficina no apoya la idea de un «descuento por volumen» en el análisis del uso justo.
    • Efecto en el Mercado Potencial o Valor de la Obra: Este es a menudo el factor más importante. Se considera la sustitución del mercado (por ejemplo, si las salidas de IA reemplazan la necesidad de acceder a las obras originales) y la pérdida de oportunidades de licenciamiento. Algunos argumentan que el análisis debe considerar el daño al mercado general del tipo de obra o a la autoría futura, no solo a la obra específica. La existencia de un mercado de licenciamiento para el uso en cuestión desfavorece el uso justo.
    • Beneficios Públicos: El informe reconoce argumentos válidos sobre los beneficios públicos tanto de las aplicaciones de IA como de la producción de obras creativas humanas. Se debate si la necesidad de licencias limitaría la innovación o, por el contrario, la incentivaría al asegurar la compensación a los creadores.
  3. Opciones de Licenciamiento para el Entrenamiento de IA: El informe evalúa la viabilidad de diferentes modelos:
    • Licenciamiento Voluntario: Se observa que ya está ocurriendo en algunos sectores (noticias, publicaciones académicas, imágenes, música). Se puede realizar de forma directa o colectiva (a través de organizaciones que gestionan derechos de múltiples autores). Sin embargo, presenta desafíos significativos como los altos costos de transacción, la dificultad para identificar titulares de derechos (especialmente para obras «vernáculas» online), la preocupación de que los creadores más pequeños tengan menos poder de negociación, y cuestiones de compensación por volúmenes masivos. El licenciamiento colectivo voluntario se ve como una forma de reducir costos de transacción.
    • Enfoques Estatutarios:
      • Licenciamiento Obligatorio (Compulsory Licensing): Históricamente, EE. UU. los ha adoptado solo en casos excepcionales donde el mercado libre no funciona, y la Oficina ha sido históricamente cautelosa al respecto. Se considera que socavan los derechos exclusivos del autor y pueden ser difíciles de modificar una vez establecidos. Existe un fuerte desacuerdo entre las partes interesadas sobre si sería apropiado para el entrenamiento de IA, con preocupaciones de que podría sofocar la creatividad. Los argumentos en contra incluyen la dificultad logística para implementarlo a gran escala y la probabilidad de regalías insignificantes por obra.
      • Licenciamiento Colectivo Extendido (Extended Collective Licensing – ECL): Es otra opción, usada en otros países para la digitalización masiva o «obras huérfanas». Podría facilitar el licenciamiento masivo pero comparte algunas preocupaciones con el licenciamiento obligatorio.
    • Mecanismos de «Opt-Out» (Exclusión): Discutidos en el contexto de enfoques internacionales como el de la UE. Muchos comentaristas los critican, argumentando que trasladan una carga injusta a los titulares de derechos, son imprácticos (dada la dificultad para rastrear obras o la eliminación de metadatos), y el daño de la ingestión de datos a menudo no se puede deshacer. Algunas empresas de IA ofrecen mecanismos voluntarios de exclusión.
  4. Análisis y Recomendaciones de la Oficina: La Oficina reconoce la variación entre tipos de obras y usos. Observa que el mercado de licenciamiento voluntario está desarrollándose. Considera que el licenciamiento colectivo voluntario puede ser muy útil para reducir costos. No obstante, la Oficina recomienda, en este momento, permitir que el mercado de licenciamiento voluntario continúe desarrollándose sin intervención gubernamental. Si se demostraran fallos de mercado para tipos específicos de obras en contextos concretos, se podrían considerar intervenciones dirigidas, como el ECL. La Oficina considera que el licenciamiento obligatorio para el entrenamiento de IA tendría desventajas significativas. También sugiere que los usos académicos o de investigación podrían calificarse como uso justo y no requerirían licencia.

Contexto Internacional y en América Latina

El informe de la Oficina de EE. UU. menciona brevemente algunos enfoques internacionales. Cita el marco de la Unión Europea con su excepción de minería de texto y datos (TDM) que incluye una cláusula de exclusión (opt-out). También menciona que Brasil tiene un proyecto de ley pendiente que requeriría compensación a los titulares de derechos por el uso de sus obras en el entrenamiento de IA, buscando mecanismos que permitan la negociación efectiva (directa o colectiva) y calculen la compensación considerando el tamaño de la IA y el impacto competitivo. Cita que España consideró establecer un mecanismo de licenciamiento colectivo extendido para el desarrollo de modelos de IA, pero la propuesta fue retirada posteriormente. Otros países mencionados con avances regulatorios son Alemania, Israel, Corea y China.

Conclusión

El informe de la Oficina de Derechos de Autor de EE. UU. subraya que el uso de obras protegidas para el entrenamiento de IA generativa presenta desafíos complejos para el derecho de autor, involucrando actos como la copia y retención de contenido expresivo. La aplicación de la doctrina del uso justo es objeto de intenso debate, especialmente en lo relativo al carácter transformativo y el impacto en el mercado. Si bien el licenciamiento voluntario está emergiendo en algunos sectores, la Oficina recomienda por ahora que el mercado continúe desarrollándose sin intervención obligatoria, reservando la posibilidad de intervenciones específicas como el ECL si se identifican fallos de mercado claros.

Este análisis desde una jurisdicción influyente como Estados Unidos es un insumo valioso para comprender las discusiones globales sobre este tema, que sin duda seguirá evolucionando y requerirá atención continua por parte de los profesionales del derecho y los sectores involucrados en la innovación tecnológica y la creación de contenido.

[Nota: Hemos elaborado esta nota con asistencia de información proporcionada por Inteligencia Artificial]