Meta AI:n EvoHarness-RL tehostaa tekoälyagenttien pitkäjänteistä työskentelyä
Meta AI ja Illinoisin yliopisto ovat kehittäneet EvoHarness-RL-kehyksen, joka parantaa merkittävästi tekoälyagenttien kykyä suoriutua monimutkaisista, pitkäkestoisista tehtävistä.

Meta AI yhdessä Illinoisin yliopiston Urbana-Champaignin tutkijoiden kanssa on esitellyt uuden EvoHarness-RL-kehyksen, jonka tavoitteena on parantaa tekoälyagenttien suorituskykyä pitkäkestoisissa ja monimutkaisissa tehtävissä. Kehitys on merkittävä askel kohti autonomisempia ja tehokkaampia tekoälyjärjestelmiä, jotka pystyvät hallitsemaan monimutkaisia yritystyönkulkuja ilman jatkuvaa manuaalista ohjausta.
Perinteisesti tekoälyagenttien toimintaa on ohjattu jäykillä, ihmisen kirjoittamilla säännöillä, mikä rajoittaa niiden autonomisuutta ja kykyä sopeutua muuttuviin tilanteisiin. EvoHarness-RL tarjoaa abstraktiotason agentin ajonaikaiselle järjestelmälle (harness), opettaen mallille, milloin ja miten sen tulee hyödyntää ympäristöstään saamaansa tietoa. Tämä ratkaisee ongelman, jossa suuri datamäärä tai pitkät prosessit ylittävät agentin sisäisen muistin rajat.
Xuying Ning, yksi EvoHarness-RL-tutkimuksen kirjoittajista, korosti, että manuaalisesti koodatut ohjeet ja jäykät muistirakenteet kuluttavat runsaasti insinööriresursseja. "Optimaalinen harness muuttuu usein mallin mukana", Ning selitti. "Eri mallit voivat tarvita erilaisia kehotteita, muistisuunnitelmia tai konfiguraatioita. Jos kaikki tämä logiikka koodataan manuaalisesti, jokainen mallipäivitys voi johtaa uuteen viritys- ja virheenkorjaussykliin."
EvoHarness-RL yhdistää agentin tukijärjestelmät yhtenäiseen Belief, Progress, and Experience (BPE) -käyttöliittymään. Tämä mahdollistaa agentin oppia tekemään optimaalisia päätöksiä ulkoisen tilan hallinnasta. Sen sijaan, että se seuraisi sokeasti koodattuja ohjeita, agentti oppii rakentamaan strukturoidun työtilan epäselvästä ajon aikaisesta datasta ja päättämään, milloin ja miten sitä käytetään monimutkaisissa työnkuluissa. Tämä mahdollistaa myös aiemmin opitun tiedon tehokkaamman uudelleenkäytön ja virheiden välttämisen pitkissä tehtävissä.