Alibaba Cloud julkaisi avoimen lähdekoodin dokumenttien analyysimallin OvisOCR2
Alibaba Cloud on julkaissut OvisOCR2-dokumenttien analyysimallin avoimena lähdekoodina. Malli saavutti korkeimmat pisteet OmniDocBench-vertailussa, mikä osoittaa sen ylivoiman perinteisiin menetelmiin.

Kiinalainen teknologiayritys Alibaba Cloud on julkaissut uuden dokumenttien analyysimallin, OvisOCR2, avoimena lähdekoodina. Malli on saavuttanut huipputuloksia OmniDocBench v1.6 -vertailussa 96,58 pisteellä. Tämä saavutus on merkittävä, sillä se on ensimmäinen kerta, kun kokonaisvaltainen eli "end-to-end" -malli on ylittänyt perinteiset "putkimaiset" menetelmät tällä alalla.
Dokumenttien muuntaminen rakenteelliseksi tekstiksi on keskeinen toimenpide tekoälysovelluksissa, kuten yritystietokannoissa ja kysymys-vastausjärjestelmissä. Perinteiset "putkimaiset" menetelmät ovat yhdistelmä sivuanalyysi- ja sisällöntunnistusmalleja, jotka erikseen tunnistavat dokumentin asettelun ja sisällön. Tällainen lähestymistapa on kuitenkin altis virheiden kertymiselle ja monimutkainen ylläpidettävä.
OvisOCR2 käyttää sen sijaan kokonaisvaltaista lähestymistapaa. Se syöttää dokumentin kuvana ja tuottaa kerralla Markdown-muotoisen esityksen, joka sisältää tekstin, kaavat, taulukot ja visuaaliset elementit luonnollisessa lukujärjestyksessä. Tämä vähentää merkittävästi tarvittavien mallien määrää ja monimutkaisuutta.
Malli perustuu Qwen3.5-0.8B-malliin ja on koulutettu käyttäen monivaiheista prosessia, johon kuuluu todellisten ja synteettisten dokumenttien yhdistelmä. Alibaba Cloud on julkaissut OvisOCR2:n Apache 2.0 -lisenssillä, ja se on yhteensopiva yleisten päättelykehysten, kuten vLLM:n, kanssa, mikä helpottaa kehittäjien integrointia.
Malli on saatavilla Hugging Face -alustalla ja ModelScope-palvelussa. Tekninen raportti tarjoaa lisätietoa mallin arkkitehtuurista ja suorituskyvystä.