📣 Envoyez-nous votre communiqué de presse
Site mis à jour toutes les 15 minutes
Technologie

Une étude révèle que l'IA ne peut pas évaluer les dissertations d'étudiants de manière fiable comme un enseignant humain

Une nouvelle recherche de l'Université de Cardiff et de l'Université de Melbourne montre que l'intelligence artificielle générative (GenAI) ne peut pas encore évaluer de manière fiable les dissertations d'étudiants avec la même constance que les éducateurs humains. La notation de ChatGPT a montré des variations importantes.

24 août 2026
Une étude révèle que l'IA ne peut pas évaluer les dissertations d'étudiants de manière fiable comme un enseignant humain
Image générée par IA à titre d'illustration

Une nouvelle étude menée par l'Université de Cardiff et l'Université de Melbourne révèle que l'intelligence artificielle générative (GenAI) n'est actuellement pas capable d'évaluer de manière fiable les dissertations d'étudiants avec la même constance que les enseignants humains. Les chercheurs ont testé la capacité de ChatGPT à noter 50 dissertations d'étudiants en biosciences, selon sept critères.

L'étude a utilisé quatre méthodes d'invite différentes et a comparé les notes attribuées par l'IA aux notes moyennes et aux fluctuations de celles données par des correcteurs humains. Bien que les notes globales de l'IA et des humains aient été relativement proches, des divergences notables sont apparues lors de l'examen des critères individuels et des dissertations spécifiques.

Dans la plupart des cas, les notes moyennes fournies par l'IA étaient supérieures à celles des évaluateurs humains. La plus grande différence dans les notes moyennes était de 16,1 points, et pour des dissertations individuelles, les écarts de notes pouvaient atteindre 40 points. L'IA avait également tendance à réduire l'écart des notes, en abaissant les scores des dissertations les mieux notées et en augmentant ceux des dissertations moins bien notées.

Les résultats suggèrent que l'IA n'est actuellement pas adaptée pour remplacer les enseignants dans la notation des devoirs, en particulier pour les travaux écrits subjectifs. Bien que les capacités d'évaluation de l'IA puissent s'améliorer avec le développement, il sera probablement difficile d'atteindre une cohérence avec le jugement humain.

Source originale: ithome.com