WikiHow poursuit OpenAI pour l'utilisation de contenu dans l'entraînement de l'IA
WikiHow a déposé une plainte contre OpenAI, alléguant que l'entreprise d'IA a extrait et utilisé son contenu protégé par droit d'auteur sans autorisation pour entraîner ses modèles d'IA. La plainte affirme qu'OpenAI a exploité la vaste bibliothèque d'instructions de WikiHow pour construire ChatGPT.

WikiHow a engagé une action en justice contre la société d'IA OpenAI, l'accusant d'avoir copié et utilisé illicitement le matériel protégé par droit d'auteur de WikiHow pour former ses modèles d'intelligence artificielle, y compris ChatGPT. La plainte affirme qu'OpenAI a exploité la vaste bibliothèque d'instructions de WikiHow pour développer ChatGPT.
Le cœur de la plainte de WikiHow est qu'OpenAI aurait exploité son contenu sans licence ni paiement, créant ainsi un produit qui fournit désormais directement aux utilisateurs l'essentiel des articles de WikiHow, détournant ainsi le trafic et les revenus du site d'origine. Cette pratique, selon WikiHow, le prive de visites de pages essentielles qui soutiennent ses revenus publicitaires.
WikiHow soutient qu'OpenAI a violé ses droits d'auteur par plusieurs moyens. Cela inclut la copie à grande échelle pour la création de données d'entraînement, l'intégration de contenu dans des systèmes de génération augmentée par récupération (RAG), et enfin la génération de résultats similaires pour les utilisateurs. L'entreprise affirme que les robots d'OpenAI ont accédé aux pages de WikiHow des centaines de milliers de fois sur une courte période et accuse l'entreprise d'utiliser des agents utilisateurs et des adresses IP obfusqués pour dissimuler ses activités de collecte de données.
Bien qu'OpenAI n'ait pas divulgué publiquement tous les ensembles de données utilisés, la plainte suggère que des modèles précédents tels que GPT-2 et GPT-3 contenaient du matériel extrait de WikiHow. WikiHow affirme qu'au moins 11 211 de ses articles ont été utilisés pour entraîner GPT-4 et les modèles ultérieurs. La poursuite vise à obliger OpenAI à cesser d'utiliser et de stocker ses œuvres et demande des dommages-intérêts dont le montant n'est pas divulgué.
Cette poursuite fait suite à des actions similaires contre des entreprises d'IA. Plus tôt cette année, The New York Times et Encyclopædia Britannica ont intenté des actions en justice comparables pour violation présumée du droit d'auteur. Cependant, dans une affaire distincte en avril, la Haute Cour de Delhi a rejeté une injonction provisoire demandée par l'agence de presse ANI contre OpenAI, estimant que le contenu plus récent d'ANI n'était probablement pas inclus dans les données d'entraînement de GPT-4.