Thinking Machines dévoile un modèle d'IA plus petit et performant
Thinking Machines a lancé Inkling-Small, un modèle d'IA open source qui approche les performances de son prédécesseur plus grand pour une fraction de la taille. Le modèle offre des avantages significatifs en termes de calcul et de coût pour les entreprises.

Thinking Machines, une startup bien financée dirigée par l'ancienne CTO d'OpenAI, Mira Murati, a lancé Inkling-Small, son dernier modèle d'IA open source. Deux semaines seulement après la sortie de son prédécesseur, Inkling, le nouveau modèle promet des performances quasi équivalentes pour environ un quart de la taille, offrant des avantages substantiels en termes d'efficacité de calcul et de coût pour les entreprises.
Le nouveau modèle de 276 milliards de paramètres, publié sous licence Apache 2.0, atteint des métriques de performance proches de l'Inkling original de 975 milliards de paramètres. Il se classe à seulement un point derrière son grand frère dans l'indice d'analyse de l'intelligence artificielle. Capable de traiter des entrées textuelles, image et audio et de produire des sorties textuelles, Inkling-Small prend en charge une fenêtre de contexte allant jusqu'à un million de tokens, ce qui en fait une option compétitive pour les organisations disposant de ressources de calcul plus limitées.
Inkling-Small utilise une architecture Mixture-of-Experts (MoE). Cette conception permet au modèle d'utiliser seulement 12 milliards de paramètres actifs par token sur ses 276 milliards de paramètres totaux. Cette efficacité réduit considérablement ses exigences de calcul et ses coûts d'inférence tout en conservant une grande partie des capacités de codage, de raisonnement et multimodales du modèle plus grand.
Le modèle est disponible avec les poids complets sur Hugging Face, avec un support de fine-tuning via son API Tinker. Bien qu'Inkling-Small ne soit pas adapté aux ordinateurs portables, il est considérablement plus facile à déployer que l'Inkling original. Cela en fait un choix pratique pour les entreprises possédant une certaine capacité GPU. Les utilisateurs peuvent ajuster les besoins de calcul pour équilibrer la qualité, la latence et le coût en fonction de la difficulté de la tâche.