📣 Envoyez-nous votre communiqué de presse
Site mis à jour toutes les 15 minutes
Technologie

AMD et Cerebras s'associent pour l'inférence IA à faible latence

AMD et Cerebras collaborent pour développer de nouvelles solutions d'inférence IA ciblant une latence ultra-faible. Ce partenariat vise à améliorer considérablement les performances et l'efficacité dans les charges de travail IA exigeantes.

24 juillet 2026
AMD et Cerebras s'associent pour l'inférence IA à faible latence
Image générée par IA à titre d'illustration

Le fabricant de semi-conducteurs AMD et l'entreprise spécialisée en intelligence artificielle Cerebras ont annoncé un effort de développement conjoint pour des solutions d'inférence IA. Cette collaboration vise spécifiquement les cas d'utilisation nécessitant une latence ultra-faible.

La nouvelle solution intégrera l'offre Helios d'AMD, destinée aux racks de serveurs, avec le Wafer-Scale Engine de Cerebras. Cette initiative se positionne pour concurrencer les solutions intégrées existantes sur le marché, telles que celles proposées par Nvidia et Groq.

Selon les feuilles de route annoncées par les entreprises, le système Helios d'AMD fonctionnera comme un moteur de débit évolutif et haute performance, gérant le traitement des invites (prompts) et les grandes fenêtres de contexte. Le Wafer-Scale Engine de Cerebras sera responsable des phases de génération et de décodage de tokens, intensives en bande passante mémoire, en mettant l'accent sur ses capacités de faible latence.

Lors de l'utilisation de deux moteurs de calcul, la solution combinée devrait permettre une augmentation de cinq fois du nombre de tokens traités par seconde et par watt. Cerebras souligne l'architecture de son Wafer-Scale Engine, qui intègre des centaines de milliers de cœurs de calcul et des dizaines de gigaoctets de SRAM sur une seule plaquette, dans le but de réduire les goulots d'étranglement de communication.

Source originale: ithome.com