L'équipe WeChat de Tencent publie un modèle d'intégration multimodal en open source
L'équipe Vision de WeChat chez Tencent a rendu WeMM-Embedding, une famille de modèles d'intégration multimodaux, open source pour représenter et faire correspondre texte, images et vidéos.

L'équipe Vision de WeChat chez Tencent a publié WeMM-Embedding, une série de modèles d'intégration multimodaux, en open source. Ces modèles sont capables de représenter et de faire correspondre divers types de contenu, y compris du texte, des images et des vidéos.
L'équipe a indiqué que les modèles sont déjà utilisés dans plusieurs services WeChat, tels que WeChat Channels, Official Accounts, Moments et les plateformes de commerce électronique. La publication comprend trois versions des modèles : 2B, 4B et 9B.
Selon les résultats d'évaluation publiés par Tencent, le modèle 9B a obtenu les meilleures performances sur les benchmarks MMEB-v2 et MMEB-v3 par rapport aux autres modèles listés.
Le code du modèle, les outils d'évaluation et les poids ont été mis à disposition via un dépôt public et des pages de modèles, permettant aux développeurs d'intégrer ces modèles dans des applications de recherche, de récupération et de recommandation multimodales.