Alibaba Cloud släpper öppen källkodsmodell för dokumentanalys, OvisOCR2
Alibaba Cloud har släppt sin dokumentanalysmodell OvisOCR2 som öppen källkod. Modellen har satt ett nytt rekord i OmniDocBench-jämförelsen, vilket markerar en framgång för end-to-end-metoden.

Det kinesiska teknikföretaget Alibaba Cloud har släppt sin dokumentanalysmodell, OvisOCR2, som öppen källkod. Modellen har uppnått en poäng på 96,58 i OmniDocBench v1.6-jämförelsen, vilket markerar första gången en end-to-end-modell överträffar traditionella "pipeline-metoder" inom området.
Dokumentanalys är en viktig teknik för att omvandla ostrukturerade dokument som PDF:er och skanningar till strukturerad text, vilket är avgörande för applikationer som företagets kunskapsbaser och RAG-system (Retrieval-Augmented Generation). Pipeline-metoder, som tidigare dominerat, består vanligtvis av separata modeller för layoutanalys och innehållsigenkänning. Denna metod är dock känd för höga underhållskostnader och ackumulerade fel.
OvisOCR2 använder en end-to-end-arkitektur som tar en dokumentbild som input och producerar en Markdown-representation i ett enda steg. Denna representation inkluderar text, formler, tabeller och visuella områden, vilket eliminerar behovet av flera modeller som arbetar tillsammans.
Modellen, som är baserad på Qwen3.5-0.8B, har tränats genom en robust process som använder en kombination av verkliga och syntetiska data, samt avancerade träningsmetoder. Alibaba Cloud har släppt OvisOCR2 under Apache 2.0-licensen, vilket säkerställer att den är kompatibel med populära inferensramverk som vLLM.
OvisOCR2 finns tillgänglig via Hugging Face och ModelScope. Ett tekniskt dokument ger ytterligare detaljer om modellens prestanda och arkitektur.