ByteDance lance le modèle SeedRealtime pour l'interaction audio-vidéo en temps réel
ByteDance a présenté le modèle SeedRealtime, capable de traiter en continu l'audio, la vidéo et le texte, permettant une écoute et une réponse en temps réel.

La société technologique chinoise ByteDance a lancé SeedRealtime, un modèle natif audio-vidéo full-duplex conçu pour traiter en continu les flux audio, vidéo et texte tout en écoutant et en répondant en temps réel.
Le modèle prend en charge les interactions où il peut simultanément regarder, écouter et parler. Ce développement fait passer la technologie d'une démonstration de recherche à un produit destiné aux consommateurs.
SeedRealtime a été déployé dans l'application Doubao de ByteDance. Cette mise en œuvre intègre la technologie de sa phase de recherche dans un produit accessible aux consommateurs. Le lancement élargit l'offre de ByteDance en matière de systèmes d'interaction multimodale en temps réel, complétant ses capacités existantes de génération de texte et d'images.
L'introduction de SeedRealtime fournit à ByteDance un nouvel outil pour créer des applications avancées capables de comprendre et de réagir aux entrées utilisateur à travers plusieurs modalités, améliorant potentiellement l'expérience utilisateur dans divers services.