Collinear AI julkaisi CWE-bench-testin tekoälyn koodauskyvyille kyberturvallisuudessa
Collinear AI on julkaissut CWE-bench-testin, joka arvioi tekoälyn kykyä tunnistaa ja korjata tietoturvahaavoittuvuuksia. Testi paljasti merkittäviä puutteita nykyisissä koodausagenteissa.

Collinear AI on julkaissut uuden arviointityökalun nimeltä CWE-bench, joka mittaa tekoälypohjaisten koodausagenttien suorituskykyä puolustuksellisissa kyberturvallisuustehtävissä. Uusi työkalu keskittyy tunnistamaan ja korjaamaan haavoittuvuuksia, jotka on luokiteltu Common Weakness Enumeration (CWE) -standardin mukaisesti.
Testin tulokset osoittavat, että edistyneimmätkin koodausagentit suoriutuivat alle 50 prosenttisesti tehtävistä, ja 18 haavoittuvuustyyppiä jäi kokonaan ratkaisematta. Tämä korostaa merkittävää aukkoa tekoälyn nykyisissä kyvyissä kyberturvallisuuden saralla, erityisesti ennaltaehkäisevien ja korjaavien toimintojen osalta.
CWE-bench kattaa 54 erilaista haavoittuvuustyyppiä, mikä tekee siitä kattavan mittarin tekoälyagenttien kyvylle tunnistaa ja ehkäistä turvallisuusriskejä ohjelmistokehityksessä. Tavoitteena on edistää turvallisempien tekoälysovellusten kehittämistä.
Collinear AI:n mukaan tulokset antavat arvokasta tietoa tekoälyn kehittäjille ja kyberturvallisuusammattilaisille. Ne osoittavat, että tekoälyagenttien kykyä hyödyntää puolustuksellisessa kyberturvallisuudessa on vielä kehitettävä merkittävästi, jotta niistä olisi todellista apua uhkien torjunnassa.