SenseTime publie en open source un modèle multimodal à 8 milliards de paramètres
La société d'IA SenseTime a rendu public le code source de son modèle SenseNova U1.5 Lite, un modèle IA multimodal de 8 milliards de paramètres alliant compréhension visuelle, génération et édition d'images.

La société d'IA SenseTime a rendu disponible en open source son modèle SenseNova U1.5 Lite. Ce modèle IA multimodal, doté de 8 milliards de paramètres, intègre la compréhension visuelle avec des capacités de génération et d'édition d'images.
Le modèle prend en charge la sortie native d'images en résolution 4K et est conçu pour traiter des instructions complexes portant sur des sujets, des quantités, des relations spatiales, du texte, des mises en page et des styles visuels. Cette initiative intervient alors que des concurrents tels que Baidu et Alibaba se concentrent également sur la publication de solutions d'IA open source similaires.
SenseTime affirme que ce modèle léger améliore la préservation de l'identité et le contrôle de la structure spatiale lors de l'édition d'images. Il introduit également de nouvelles commandes, notamment des boîtes englobantes, des marqueurs visuels et l'utilisation de plusieurs images de référence.
SenseNova U1.5 Lite est accessible via GitHub, Hugging Face et ModelScope. Cette publication vise à promouvoir la transparence dans le développement de l'IA et à encourager la recherche ainsi que les applications dans ce domaine.