Les contentieux sur les données d’entraînement évoluent au-delà de la seule question de leur utilisation, pour porter également sur leur provenance et sur la concurrence que les contenus générés peuvent exercer contre les œuvres originales. La plainte de WikiHow contre OpenAI, le précédent Anthropic sur les livres piratés et les procédures engagées par plusieurs médias illustrent cette évolution du droit d’auteur américain. En Europe, l’AI Act impose parallèlement davantage de transparence sur les contenus utilisés pour entraîner les modèles, tandis qu’émerge progressivement un marché de données sous licence.

