L'Inde doit contrer la censure et l'exclusion de l'IA avec des données souveraines plus équitables
L'Inde est confrontée à une menace croissante de censure de l'IA et d'exclusion des données, ce qui nécessite le développement de jeux de données souverains plus équitables. Les ressources linguistiques limitées et les modèles étrangers posent des défis importants.

L'Inde doit faire face à la menace croissante de la censure par l'intelligence artificielle (IA) et de l'exclusion des données en développant ses propres ressources de données, plus équitables et souveraines. L'avancement rapide des grands modèles linguistiques (LLM) risque de perpétuer des informations biaisées ou censurées, en particulier pour les langues à faibles ressources et concernant les sujets indiens.
De nombreux modèles LLM actuels sont principalement entraînés sur des jeux de données occidentaux ou chinois, ce qui entraîne la domination de ces perspectives. Cela peut conduire à des représentations inadéquates ou inexactes des philosophies indiennes, telles que l'Advaita Vedanta. De plus, les modèles texte-vers-image ont dépeint à plusieurs reprises les Indiens selon des stéréotypes, exacerbant ainsi l'exclusion.
La censure parrainée par l'État au sein des jeux de données et des LLM qui en dépendent représente un risque important pour l'écosystème informationnel et la souveraineté de l'Inde. À mesure que ces modèles deviennent plus sophistiqués et sont déployés dans des secteurs critiques tels que la défense et l'application de la loi, les données censurées pourraient façonner leurs opérations et leur prise de décision.
La Chine a déjà investi massivement dans la création de jeux de données nationaux validés, bien que ceux-ci soient strictement censurés par l'État. Alors que les jeux de données occidentaux modèrent également le contenu, ils s'appuient sur un plus large éventail de sources ouvertes. L'Inde doit créer ses propres référentiels de données diversifiés et non censurés pour garantir une utilisation équitable et précise de l'IA.