Weka lance une nouvelle plateforme de stockage pour améliorer l'efficacité de l'IA
La société de stockage IA Weka a lancé son logiciel NeuralMesh 6 et son matériel Wekapod 3. La nouvelle plateforme vise à réduire la charge sur les GPU et les coûts de calcul pour les modèles d'IA.

La société de stockage spécialisée dans l'IA, Weka, a publié son logiciel NeuralMesh 6 ainsi que sa première gamme de matériel conçue en interne, Wekapod 3. La nouvelle plateforme est conçue pour améliorer les performances et l'efficacité des modèles d'IA en réduisant considérablement la dépendance à l'égard de la mémoire coûteuse des processeurs graphiques (GPU).
La plateforme utilise l'approche Augmented Memory Grid de Weka, qui agrège le stockage flash pour fonctionner comme une mémoire GPU à une fraction du coût. L'objectif est de résoudre les goulots d'étranglement de performance dans les modèles d'IA causés par les longues fenêtres de contexte et les conversations multi-tours, qui entraînent des calculs redondants et consomment des ressources GPU précieuses.
NeuralMesh 6 introduit plusieurs nouvelles fonctionnalités, notamment la multi-location composable et virtuelle, offrant une isolation au niveau matériel et une évolutivité à des milliers de locataires par cluster. Elle fournit également un stockage de fichiers et d'objets unifié sans copies de données séparées ni couches de traduction, accélérant ainsi le traitement des données, en particulier dans les environnements cloud GPU.
La réplication Metadata-first et la technologie AlloyFlash améliorent encore les performances et la rentabilité. AlloyFlash mélange différents types de mémoire flash NAND, permettant l'utilisation de mémoire QLC économique pour les données volumineuses tout en maintenant la vitesse pour les tâches sensibles à la latence grâce à la mémoire TLC plus rapide.
Le co-fondateur et PDG de Weka, Liran Zvibel, a souligné que la nouvelle plateforme permet une utilisation du cache jusqu'à des centaines de fois plus efficace, éliminant le besoin de calculs répétés et économisant des ressources GPU considérables. Cela peut accélérer le déploiement de nouvelles charges de travail d'IA et améliorer l'utilisation des investissements GPU existants.