Tutkimus: Tekoäly ei pysty arvioimaan opiskelijoiden esseitä luotettavasti ihmisopettajan tavoin
Uusi brittiläis-australialainen tutkimus paljastaa, että tekoäly ei toistaiseksi kykene arvioimaan opiskelijoiden esseitä luotettavasti ihmisopettajan tasolla. ChatGPT:n antamat arvosanat vaihtelivat merkittävästi.

Cardiffin ja Melbournen yliopistojen uusi tutkimus osoittaa, että generatiivinen tekoäly (GenAI) ei kykene arvioimaan opiskelijoiden kirjallisia tehtäviä yhtä luotettavasti kuin ihmisopettajat. Tutkijat testasivat ChatGPT:n kykyä arvioida 50 biologisten tieteiden opiskelijan esseetä seitsemän kriteerin pohjalta.
Tutkimuksessa käytettiin neljää erilaista kehotemuotoa ja verrattiin tekoälyn antamia arvosanoja ihmisarvioijien keskiarvoihin ja vaihteluihin. Vaikka tekoälyn ja ihmisten antamat kokonaispisteet olivat suhteellisen lähellä toisiaan, yksittäisten kriteerien ja esseiden kohdalla havaittiin merkittäviä eroja.
Useimmiten tekoälyn antamat keskiarvosanat olivat korkeampia kuin ihmisarvioijien. Suurin ero keskiarvosanoissa oli 16,1 pistettä ja yksittäisissä esseissä jopa 40 pistettä. Tekoäly myös taipui tasoittamaan arvosanoja: se alensi korkeasti arvioitujen esseiden pisteitä ja nosti matalasti arvioitujen pisteitä.
Tutkimuksen mukaan tekoäly ei siis tällä hetkellä sovellu korvaamaan opettajia tehtävien arvioinnissa, etenkään subjektiivisemmissa kirjallisissa töissä. Vaikka tekoälyn kehittyessä sen arviointikyky saattaa parantua, yhdenmukaisuuden saavuttaminen ihmisarvioijien kanssa ei ole helppoa.