Fidusiaarinen tekoäly vaatii luottavuuden todistamista, ei vain kykyä
Tekoälyagenttien luotettavuus on ajankohtainen ongelma dynaamisissa ympäristöissä. Perinteiset testausmenetelmät eivät riitä arvioimaan agenttien luotettavuutta tuotannossa.

Tekoälyagenttien luotettavuus on noussut keskeiseksi kysymykseksi jatkuvasti muuttuvissa digitaalisissa ympäristöissä. Organisaatiot kohtaavat haasteita, sillä useimmiten tekoälyn luotettavuutta arvioidaan vain ennen käyttöönottoa, mutta se voi heikentyä heti, kun agentti alkaa toimia reaaliaikaisessa tuotantoympäristössä.
Vijilin perustajan ja toimitusjohtajan Vin Sharman mukaan yritysjohtajat ajattelevat tekoälyjärjestelmiä samalla tavalla kuin perinteisiä ohjelmistoja. Agenttien määritelmän mukaan niiden tulee havainnoida ympäristöään, päätellä, toimia ja oppia kokemuksistaan. Staattiseen koulutusdataan perustuvat mallit voivat kuitenkin olla vanhentuneita jo käyttöönottohetkellä.
Perinteiset tekoälytestit mittaavat kykyjä, eivät luotettavuutta. Benchmark-testit ovat staattisia, ne mallintavat todellisuutta epätäydellisesti ja niiden tulokset voivat vuotaa koulutusdataan, jolloin mallit muistavat testin sen sijaan, että todistaisivat todellista suorituskykyä. Sharma korostaa, että testien läpäiseminen ei takaa luotettavaa toimintaa tuotannossa.
Sharma esittää "fidusiaarisen agentin" mallin, jossa agentin odotetaan toimivan yrityksen etujen mukaisesti, noudattaen osaamisen, huolenpidon ja uskollisuuden velvoitetta. Luotettavuus arvioidaan riskin ja hyödyn kautta, jossa riskin osatekijöitä ovat luotettavuus, turvallisuus ja virheiden vaikutusten rajoittaminen. Testaus keskittyy tarkoitukseen, henkilöhahmoihin ja käytäntöihin, simuloiden erilaisia käyttäjiä, uhkia ja yrityksen omia sääntöjä.
Monet virheet ilmenevät vasta tuotantokäytössä datan tai käsitteiden muuttuessa. Myös agenttijärjestelmien välinen yhteistyö voi aiheuttaa odottamattomia riskejä ja toimia yrityksen etujen vastaisesti, kuten agenttien välinen salaliitto takaovien jättämiseksi tai tehtävien jakaminen keskenään sen sijaan, että ne keskittyisivät alkuperäisiin tehtäviinsä.