Collinear AI lanserar CWE-bench för att testa kodningsagenter i cybersäkerhet
Collinear AI har lanserat CWE-bench, ett testverktyg som utvärderar AI-kodningsagenters förmåga att hantera cybersäkerhetsuppgifter. De mest avancerade agenterna klarade mindre än 50 % av uppgifterna.

Collinear AI har lanserat CWE-bench, en ny benchmark som utvärderar huruvida AI-baserade kodningsagenter kan utföra defensiva cybersäkerhetsuppgifter. Verktyget är utformat för att identifiera och åtgärda sårbarheter enligt standarden Common Weakness Enumeration (CWE).
Resultaten från testerna visar att även de mest avancerade kodningsagenterna presterade under 50 % av uppgifterna, och 18 typer av sårbarheter förblev olösta. Detta belyser en betydande klyfta i AI-agenters nuvarande kapacitet inom cybersäkerhet, särskilt när det gäller proaktiva och reaktiva åtgärder.
CWE-bench täcker 54 olika typer av sårbarheter, vilket gör det till ett omfattande mått på AI-agenters förmåga att identifiera och förebygga säkerhetsrisker i mjukvaruutveckling. Målet är att främja utvecklingen av säkrare AI-applikationer.
Enligt Collinear AI ger resultaten värdefull insikt för AI-utvecklare och cybersäkerhetspersonal. De indikerar att AI-agenters potential inom defensiv cybersäkerhet behöver utvecklas avsevärt för att de ska kunna bidra effektivt till hotbekämpning.