DeepSeek V4 Flash échoue sur des tâches d'agent suite à des hausses de prix
Le modèle V4 Flash de DeepSeek a montré des performances incohérentes sur des tâches d'agent en conditions réelles, parallèlement à des augmentations de prix significatives.

Le modèle d'IA V4 Flash de DeepSeek, auparavant en tête des classements, a démontré des résultats incohérents dans l'exécution de tâches d'agent complexes en temps réel. Les tests de Composio ont révélé que le modèle n'a réussi que 53,8 % des tâches en plusieurs étapes impliquant des outils tels que Gmail, GitHub et Slack.
Les tests ont montré que les performances de V4 Flash variaient considérablement en fonction de la plateforme d'orchestration, de la configuration des outils et d'autres facteurs techniques. Cela suggère que la simple capacité brute du modèle peut ne pas suffire à l'adoption en entreprise, soulignant le rôle critique de l'intégration et de la gestion.
Parallèlement, DeepSeek a annoncé des augmentations de prix substantielles pour ses modèles V4 Flash et V4 Pro, atteignant jusqu'à 1100 %. Ce changement de prix soulève des questions sur la compétitivité du modèle sur un marché où il se distinguait auparavant par son faible coût.
Les analystes notent que si les augmentations de prix réduisent l'avantage de coût de DeepSeek par rapport à ses concurrents, il reste plus abordable que de nombreux modèles des grandes entreprises technologiques. Les entreprises devront désormais peser plus soigneusement le coût par rapport aux performances et à la fiabilité.