Tencents WeChat-Team veröffentlicht multimodale Embedding-Modelle als Open Source
Tencents WeChat Vision-Team hat WeMM-Embedding, eine Familie multimodaler Embedding-Modelle, als Open Source veröffentlicht, die Text, Bilder und Videos verarbeiten kann.

Tencents WeChat Vision-Team hat WeMM-Embedding, eine Familie multimodaler Embedding-Modelle, als Open Source freigegeben. Diese Modelle können verschiedene Inhaltstypen wie Text, Bilder und Videos darstellen und abgleichen.
Das Team gab an, dass die Modelle bereits in mehreren WeChat-Diensten wie WeChat Channels, Official Accounts, Moments und E-Commerce-Plattformen eingesetzt werden. Die Veröffentlichung umfasst die Modellversionen 2B, 4B und 9B.
Laut von Tencent veröffentlichten Evaluierungsergebnissen erreichte das 9B-Modell in den Benchmarks MMEB-v2 und MMEB-v3 die beste Leistung unter den aufgeführten Modellen.
Der Modellcode, die Auswertungswerkzeuge und die Gewichte wurden über ein öffentliches Repository und Modellseiten zur Verfügung gestellt. Dies ermöglicht Entwicklern, die Modelle für multimodale Such-, Abruf- und Empfehlungsanwendungen zu nutzen.