Faire tourner un modèle d’IA sans se marier à un seul fabricant de puces : voilà la promesse de ZML. La jeune pousse française, adoubée par Yann LeCun (lauréat du prix Turing et figure de l’IA chez Meta), vient de publier LLMD, un logiciel gratuit censé accélérer l’inférence sur une flopée de puces différentes.
Points clés
- ZML publie LLMD, un logiciel gratuit pour accélérer l’inférence des modèles d’IA
- L’outil vise à faire tourner l’IA sur des puces de fabricants différents sans réécrire le code
- La startup française est soutenue par Yann LeCun, lauréat du prix Turing
L’inférence, ce gouffre financier
Entraîner un modèle coûte cher, mais le faire tourner au quotidien (l’inférence) finit par coûter encore plus, à force de requêtes empilées. C’est précisément là que ZML plante son drapeau. LLMD promet d’exécuter les modèles plus vite et sur du matériel varié, sans réécrire son code pour chaque marque de silicium.
Sortir du jardin clos matériel
L’argument de vente est limpide : ne plus dépendre d’un unique fournisseur de puces. Dans un marché où un acteur dicte les prix et les délais de livraison des GPU, pouvoir basculer d’une puce à l’autre sans tout reconstruire relève du confort stratégique autant que de l’économie pure.
Que le logiciel soit distribué gratuitement joue en sa faveur : plus la brique s’installe largement, plus elle devient un standard de fait. Reste à voir les gains réels sur le terrain, loin des slides de démonstration. Mais qu’une startup française mise sur l’ouverture plutôt que sur un énième écosystème verrouillé a de quoi réjouir.