La ruée vers l’or continue ! Microsoft vient de dévoiler les spécifications de Maia 100, son premier accélérateur IA personnalisé, conçu spécifiquement pour les charges de travail d’IA à grande échelle déployées sur Azure. Ce nouveau composant hardware s’inscrit dans une stratégie d’intégration verticale visant à optimiser les performances et réduire les coûts des infrastructures IA. On fait le point sur ces annonces.
Une architecture taillée pour l’IA
Maia 100 est une puce de 820 mm2 fabriquée avec le procédé N5 de TSMC et la technologie d’interposeur COWOS-S. Elle intègre une large mémoire SRAM sur la puce et quatre matrices HBM2E, offrant une bande passante totale de 1,8 To/s et une capacité de 64 Go .
Cette configuration permet de gérer efficacement les vastes quantités de données requises par les workloads IA modernes. L’architecture de Maia 100 comprend plusieurs éléments clés :
- Une unité tensorielle haute vitesse pour un traitement rapide lors de l’entraînement et l’inférence
- Un processeur vectoriel avec une architecture d’instructions personnalisée
- Un moteur DMA supportant différents schémas de sharding de tenseurs
- Des sémaphores matériels pour la programmation asynchrone
Le SDK Maia permet aux développeurs de porter rapidement leurs modèles PyTorch et Triton sur cette nouvelle plateforme. Il offre une intégration native avec PyTorch, des outils de débogage et d’optimisation, ainsi que deux modèles de programmation : Triton pour la portabilité et l’API Maia pour les performances maximales.
L’accélérateur utilise une approche de multiplication matricielle basée sur le rassemblement (gather-based) plutôt que sur la réduction (all-reduce). Cela permet notamment de fusionner la fonction d’activation post-GEMM directement dans la SRAM et de réduire la latence en envoyant des données quantifiées sur le réseau .
Maia 100 s’appuie sur une interconnexion Ethernet développée dans le cadre de l’Ultra Ethernet Consortium. Elle offre jusqu’à 4800 Gbps de bande passante pour les opérations all-gather et scatter-reduce, et 1200 Gbps pour les communications all-to-all. Le protocole backend supporte le chiffrement AES-GCM, le rendant adapté au calcul confidentiel .
Un potentiel important
Avec son architecture avancée, ses outils de développement complets et son intégration transparente avec Azure, Maia 100 révolutionne la façon dont Microsoft gère et exécute les charges de travail d’IA. Cette approche d’intégration verticale, combinant co-conception algorithmique du matériel et du logiciel, offre une nouvelle option puissante pour exécuter des workloads IA avancés dans le cloud de Microsoft.
La puce Maia 100 illustre parfaitement la convergence entre hardware et software qui s’opère actuellement dans le domaine de l’IA. Elle démontre également l’importance croissante pour les géants du cloud de maîtriser l’ensemble de la chaîne technologique, de la conception des puces jusqu’aux frameworks logiciels .