SenseTime släpper öppen källkod för 8 miljarder parametrar multimodal modell
AI-företaget SenseTime har släppt SenseNova U1.5 Lite, en multimodal modell med 8 miljarder parametrar, som öppen källkod. Modellen kombinerar visuell förståelse med bildgenerering och redigering.

AI-företaget SenseTime har gjort SenseNova U1.5 Lite, en multimodal modell med 8 miljarder parametrar, tillgänglig som öppen källkod. Modellen integrerar förmågan att förstå visuellt innehåll med funktioner för bildgenerering och redigering.
Modellen har stöd för att generera bilder i äkta 4K-upplösning. Den är utvecklad för att hantera detaljerade instruktioner som rör objekt, antal, rumsliga relationer, text, layouter och visuella stilar. Tekniken är relevant då andra stora aktörer som Baidu och Alibaba satsar på liknande öppen källkodsinitiativ.
SenseTime uppger att den lättviktiga modellen förbättrar bevarandet av identitet och rumslig struktur vid bildredigering. Den introducerar även nya kontroller, inklusive ramar (bounding boxes), visuella markörer och möjligheten att använda flera referensbilder.
SenseNova U1.5 Lite finns tillgänglig via plattformar som GitHub, Hugging Face och ModelScope. Lanseringen bidrar till ökad transparens inom AI-utveckling och främjar forskning och tillämpningar inom området.