Corpus Internet de Chine 4.0 publié pour le développement de l'IA
Le Corpus Internet de Chine 4.0, contenant 120 Go de données, a été officiellement publié aujourd'hui. L'ensemble de données vise à soutenir l'entraînement de grands modèles d'IA et à faire progresser le développement de l'intelligence artificielle.
Le Corpus Internet de Chine 4.0, un ensemble de données de 120 gigaoctets, a été officiellement publié aujourd'hui à Jinan lors d'un forum sur la gouvernance de la sécurité de l'IA, un sous-événement de la Semaine nationale de la cybersécurité 2026. Les données sont désormais disponibles sur la "Plateforme de ressources du corpus Internet chinois" pour les utilisateurs enregistrés et authentifiés.
L'initiative a été dirigée par la China Cyberspace Security Association en collaboration avec le National Internet Emergency Center. Plusieurs entreprises technologiques de premier plan, dont Baidu, iFlytek et Zhihu, ont participé à la collecte et au traitement des données. Cette dernière version s'appuie sur les publications précédentes (1.0, 2.0 et 3.0) et vise à fournir une base de données fiable pour l'entraînement de modèles d'IA à grande échelle.
La publication du corpus est présentée comme une étape importante dans l'amélioration de l'offre de ressources de données chinoises de haute qualité. Selon un représentant de la China Cyberspace Security Association, l'ensemble de données enrichit l'offre nationale et soutient le développement de haute qualité de l'industrie de l'IA.
L'association a l'intention de continuer à travailler avec d'autres organisations et entreprises pour développer davantage le corpus. L'objectif est d'améliorer continuellement la qualité et la quantité des données afin de soutenir la croissance du secteur de l'IA.