OpenAI julkaisi MentalHealthBench-arviointityökalun tekoälyn mielenterveyskykyjen testaukseen
OpenAI on julkaissut MentalHealthBench-nimisen avoimen arviointikehikon, joka sisältää 1215 synteettistä mielenterveyskeskustelua tekoälyn kykyjen arvioimiseksi todellisissa tilanteissa.

Tekoälytutkimusyritys OpenAI on julkaissut MentalHealthBench-työkalun, joka on suunniteltu arvioimaan tekoälymallien kykyä käsitellä mielenterveysaiheisia keskusteluja.
Uusi arviointikehikko sisältää 1215 synteettistä psykologista keskustelua, jotka kattavat laajan kirjon tilanteita päivittäisistä huolenaiheista aina hätätilanteisiin asti. Sen kehittämiseen osallistui yli 80 lisensoitua psykologia ja psykiatria 22 maasta, jotka käyttivät 19 kieltä ja edustivat lähes 20 eri mielenterveysalan erikoisalaa. Jokaiselle keskustelulle on luotu asiantuntijoiden laatimat arviointikriteerit.
OpenAI:n mukaan olemassa olevat arviointimenetelmät keskittyvät usein vain hätätilanteisiin ja käyttävät yleisiä standardeja. MentalHealthBench pyrkii täyttämään tämän aukon tarjoamalla kattavamman kuvan tekoälyn suoriutumisesta monenlaisissa mielenterveyskeskusteluissa. Arviointikehikon julkaisun tavoitteena on mahdollistaa muiden tutkijoiden tarkastaa menetelmät, suorittaa riippumattomia arviointeja ja jatkaa tutkimusta sen pohjalta.
Alustavat testitulokset osoittavat, että OpenAI:n omat mallit, kuten GPT-6 Astra, menestyivät parhaiten arvioinnissa. Tulokset kuitenkin paljastivat myös parannuskohteita, erityisesti mallien kyvyssä hankkia asianmukaisia taustatietoja ja tunnistaa kiireellisyysasteita tarkasti. OpenAI korostaa, että ChatGPT ei korvaa ammattimaista terapiaa tai terveydenhuoltopalveluita.
MentalHealthBench-aineisto on ladattavissa, ja OpenAI pyytää tutkijoita olemaan julkaisematta aineiston sisältöä sellaisenaan välttääkseen sen päätymistä mallien koulutusdataan ja arvioinnin vääristymistä.