AMD étoffe son portefeuille dans l’IA avec le rachat de Taalas, une start-up basée à Toronto et fondée en 2023. La transaction reste soumise aux conditions de clôture habituelles et aux autorisations réglementaires.
Taalas développe des composants en silicium spécialisés pour l’inférence IA. À la différence de l’entraînement, qui mobilise d’importantes capacités de calcul pour construire un modèle, l’inférence intervient lors de son utilisation opérationnelle, souvent en temps réel.
La technologie de Taalas vise à réduire les goulets d’étranglement liés au calcul et à la mémoire dans les architectures généralistes. La start-up conçoit notamment des accélérateurs adaptés à des modèles spécifiques, en intégrant directement certains paramètres du modèle dans le silicium.
Cette approche permet de gagner en performance et en efficacité énergétique, au prix d’une flexibilité moindre qu’avec un GPU généraliste. Les accélérateurs de Taalas sont configurés pour un modèle donné et peuvent donc être beaucoup plus rapides et moins coûteux dans des scénarios d’usage ciblés. Mais ils doivent être adaptés lorsque le modèle évolue.
Le premier composant de Taalas ferait fonctionner une version allégée de Llama 3.1, le modèle de Meta.
Une brique supplémentaire pour AMD
AMD prévoit d’intégrer la technologie de Taalas dans sa feuille de route d’accélérateurs et entend également développer des solutions au niveau système combinant ces technologies avec ses GPU Instinct.
L’opération doit ainsi compléter la plateforme IA full stack d’AMD, qui comprend les solutions rackscale Helios, les accélérateurs Instinct, les processeurs EPYC, le logiciel ROCm et les composants de son écosystème logiciel et matériel.
Pour AMD, l’enjeu consiste à proposer plusieurs types de processeurs selon les charges de travail. Les GPU restent adaptés à une grande variété de modèles et d’usages tandis que des accélérateurs spécialisés peuvent être pertinents pour des modèles stabilisés exécutés à très grande échelle. Par exemple dans les moteurs de recherche, les assistants conversationnels ou les services de génération de contenu.
Cette acquisition intervient alors que le marché de l’IA se déplace progressivement de l’entraînement des modèles vers leur déploiement massif. Les fournisseurs de cloud et les grandes entreprises cherchent désormais à réduire le coût et la consommation énergétique de milliers, voire de millions, de requêtes quotidiennes.
Cette évolution ouvre la voie à des architectures plus spécialisées. Les GPU offrent une grande souplesse mais leur coût et leur consommation peuvent devenir pénalisants lorsque les modèles sont exécutés de manière répétitive et prévisible. Les ASIC et autres accélérateurs dédiés tentent de répondre à cette contrainte en optimisant le matériel pour un modèle ou une famille de modèles.
La bataille de l’inférence s’intensifie
Nvidia a renforcé sa présence sur ce segment en dévoilant, notamment, un processeur et un système d’IA s’appuyant sur la technologie de Groq, une start-up spécialisée dans l’inférence.
La pression concurrentielle ne vient toutefois pas uniquement des deux géants des GPU car les hyperscalers développent également leurs propres puces, à l’image des accélérateurs conçus pour leurs infrastructures cloud.
Pour AMD, le principal défi sera d’intégrer cette technologie dans une offre industrielle et logicielle cohérente. Une puce spécialisée peut afficher des performances très élevées sur un modèle donné, mais son intérêt dépend de la stabilité des architectures d’IA, de la capacité à reconfigurer rapidement le matériel et de la compatibilité avec les outils de développement existants.
L’intégration avec Instinct et ROCm sera donc déterminante. AMD devra démontrer que Taalas peut compléter ses GPU plutôt que constituer une technologie isolée, difficile à programmer ou limitée à quelques cas d’usage.
The post AMD rachète Taalas pour accélérer sur l’inférence IA appeared first on Silicon.fr.