📣 Skicka ert pressmeddelande till oss
Webbplatsen uppdateras var 15:e minut
Teknologi

OpenAI lanserar MentalHealthBench för att utvärdera AI:s förmåga inom psykisk hälsa

OpenAI har lanserat MentalHealthBench, en öppen referensdatabas med 1215 syntetiska dialoger om psykisk hälsa, för att bedöma hur AI-system hanterar verkliga situationer.

24 september 2026
OpenAI lanserar MentalHealthBench för att utvärdera AI:s förmåga inom psykisk hälsa
Bilden är en AI-genererad illustration

AI-forskningsföretaget OpenAI har introducerat MentalHealthBench, ett nytt verktyg utformat för att bedöma AI-modellers förmåga att hantera konversationer om psykisk hälsa.

Den nya utvärderingsramen innehåller 1215 syntetiska psykologiska dialoger som täcker ett brett spektrum av situationer, från dagliga bekymmer till nödsituationer. Dess utveckling involverade över 80 licensierade psykologer och psykiatriker från 22 länder, som använde 19 språk och representerade nästan 20 olika specialistområden inom psykisk hälsa. För varje dialog har experter skapat specifika utvärderingskriterier.

Enligt OpenAI fokuserar befintliga utvärderingsmetoder ofta enbart på nödsituationer och använder allmänna standarder. MentalHealthBench syftar till att fylla denna lucka genom att erbjuda en mer omfattande bild av AI:s prestanda i en mängd olika psykiska hälsodiskussioner. Lanseringen av utvärderingsramen gör det möjligt för andra forskare att granska metoderna, utföra oberoende utvärderingar och fortsätta forskningen baserat på den.

Initiala testresultat visar att OpenAI:s egna modeller, som GPT-6 Astra, presterade bäst i utvärderingen. Resultaten avslöjade dock också förbättringsområden, särskilt när det gäller modellernas förmåga att inhämta relevant bakgrundsinformation och korrekt identifiera brådskandegrad. OpenAI betonar att ChatGPT inte ersätter professionell terapi eller sjukvårdstjänster.

MentalHealthBench-datamängden finns tillgänglig för nedladdning, och OpenAI uppmanar forskare att inte publicera innehållet i råformat för att förhindra att det hamnar i träningsdata för modeller och därmed snedvrider utvärderingen.

Ursprunglig källa: ithome.com