Alibaba Cloud veröffentlicht Open-Source-Modell zur Dokumentenanalyse: OvisOCR2
Alibaba Cloud hat sein Dokumentenanalysemodell OvisOCR2 als Open-Source veröffentlicht. Das Modell erzielte einen Rekordwert im OmniDocBench-Benchmark und stellt einen Durchbruch für End-to-End-Ansätze dar.

Der chinesische Technologieanbieter Alibaba Cloud hat ein neues Modell zur Dokumentenanalyse namens OvisOCR2 als Open Source veröffentlicht. Das Modell hat im OmniDocBench v1.6-Vergleich mit einer Gesamtpunktzahl von 96,58 einen neuen Rekord aufgestellt. Dies ist das erste Mal, dass ein End-to-End-Modell traditionelle "Pipeline-Methoden" in diesem Bereich übertroffen hat.
Die Dokumentenanalyse ist eine Schlüsseltechnologie zur Umwandlung von unstrukturierten Dokumenten wie PDFs und Scans in strukturierte Texte. Dies ist entscheidend für Anwendungen wie Unternehmenswissensdatenbanken und RAG-Systeme (Retrieval-Augmented Generation). Bisher dominierten "Pipeline-Methoden", die typischerweise aus separaten Modellen für Layout-Analyse und Inhaltsidentifikation bestehen. Dieser Ansatz ist jedoch mit hohen Wartungskosten und potenziellen Fehlern verbunden.
OvisOCR2 nutzt einen End-to-End-Ansatz. Es verarbeitet ein Dokumentenbild als Eingabe und gibt in einem einzigen Schritt eine strukturierte Markdown-Darstellung aus, die Text, Formeln, Tabellen und visuelle Bereiche in natürlicher Lesereihenfolge erfasst. Dieser integrierte Ansatz vereinfacht den Prozess im Vergleich zu Multi-Modell-Pipelines.
Das Modell basiert auf dem Qwen3.5-0.8B-Modell und wurde durch fortschrittliche Trainingsverfahren entwickelt. Alibaba Cloud hat OvisOCR2 unter der Apache 2.0-Lizenz veröffentlicht, um die Kompatibilität mit gängigen Inferenz-Frameworks wie vLLM zu gewährleisten und eine nahtlose Integration in das Qwen-Ökosystem zu ermöglichen.
Entwickler können auf OvisOCR2 über Plattformen wie Hugging Face und ModelScope zugreifen. Ein technischer Bericht liefert weitere Details zur Architektur und Leistung des Modells.