Amazon achète des livres rares pour l'entraînement de l'IA, suscitant des inquiétudes
Amazon acquiert de vieux livres rares pour un scan destructif destiné à l'entraînement de l'IA. Les libraires et les conservateurs s'inquiètent que la destruction des copies physiques ne rende certains titres irremplaçables.

Amazon acquiert de vieux livres, obscurs et rares pour un scan destructif destiné au travail lié à l'intelligence artificielle, selon une enquête de 404 Media. Les libraires et les conservateurs ont exprimé leur inquiétude quant au fait que la destruction de ces copies physiques pourrait rendre certains livres irremplaçables.
L'enquête a révélé qu'Amazon envoie les livres achetés à une installation, VGT3 à Las Vegas, pour un processus de numérisation destructeur. Les travailleurs retirent les dos des livres et séparent les pages pour une numérisation plus rapide, après quoi les copies physiques sont jetées. Cette pratique est particulièrement préoccupante pour les livres anciens et rares, qui peuvent exister en nombre limité ou contenir des notes manuscrites uniques et d'autres détails physiques qu'un fichier numérique ne peut pas préserver.
Amazon a confirmé qu'il achète des livres par des canaux commerciaux pour améliorer les produits et services destinés aux clients, mais n'a pas précisé le volume de ses achats de livres ni s'il conserve les titres rares. Des libraires européens ont signalé des commandes groupées inhabituelles de milliers de titres obscurs, soupçonnant des entreprises d'IA ou des intermédiaires d'être à l'origine de ces achats. Ces commandes ne ressemblent pas à des collections ou des acquisitions typiques de bibliothèques.
Amazon n'est pas la seule grande entreprise d'IA à se tourner vers les livres. Auparavant, Anthropic, Meta, OpenAI et Google ont également utilisé des livres pour le développement de l'IA. Les distinctions résident dans leurs méthodes : il est documenté qu'Amazon et Anthropic ont acquis et démantelé des livres physiques, tandis que les projets associés à OpenAI et Google ont exploité des collections numérisées existantes. Dans le cas d'Anthropic, un tribunal a statué en 2025 que l'utilisation de livres protégés par le droit d'auteur pour l'entraînement de l'IA constituait une "utilisation équitable" ("fair use"), bien que la défense n'ait pas été acceptée pour les livres obtenus par piratage.