Les entreprises d'IA utilisent le contenu des éditeurs, mais n'en fixent pas le prix
De nouveaux documents judiciaires révèlent que les entreprises d'IA étaient conscientes de la valeur et des questions de droits d'auteur du contenu qu'elles utilisaient, mais l'absence de marché entrave la rémunération des éditeurs.

Alors que les modèles d'IA générative arrivent à maturité, la question de la juste rémunération des énormes quantités de contenu en ligne utilisées pour l'entraînement s'intensifie. Des documents récemment rendus publics dans le cadre d'un procès intenté par The New York Times contre OpenAI et Microsoft suggèrent que des personnalités clés au sein de ces entreprises d'IA étaient conscientes dès le départ des implications éthiques et juridiques de l'utilisation de matériel protégé par le droit d'auteur.
Les communications internes indiquent que Brent Hecht, directeur de la science appliquée chez Microsoft, a averti début 2023 que cette pratique pourrait être perçue comme "le plus grand vol de travail de l'histoire de l'humanité". Le président d'OpenAI, Greg Brockman, aurait réagi positivement à des nouvelles concernant le contournement des paywalls, et Nick Turley, responsable de ChatGPT, a décrit les chatbots d'IA comme une "menace existentielle" pour les éditeurs.
Le procès, intenté en décembre 2023, se concentrait initialement sur la phase d'entraînement des données. Cependant, ces échanges internes soulignent des préoccupations qui s'étendent à la phase d'"inférence", où l'IA génère des réponses et des résumés. Les éditeurs soutiennent que ces sorties concurrencent directement leur reportage original, nuisant potentiellement à leur marché.
Malgré la valeur reconnue du contenu éditorial pour améliorer les produits d'IA, un marché fonctionnel pour la licence de ces données en temps réel n'a, dans l'ensemble, pas réussi à émerger. Cela est dû en partie aux ambiguïtés juridiques entourant le "fair use" (usage équitable) et à une réticence à investir dans des cadres de tarification lorsque la disponibilité future reste incertaine. Par conséquent, une grande partie de la valeur économique générée par l'utilisation des données par l'IA contourne les entreprises médiatiques, exacerbant les pressions financières sur l'industrie de l'édition.