voteinutile.fr logo

Coinbase divise par deux sa facture IA en routant vers des modèles moins chers

Coinbase a réduit de près de moitié sa facture liée à l’IA sans freiner l’usage interne des tokens. Le directeur général Brian Armstrong a détaillé sur X une stratégie qui consiste à orienter les requêtes vers des modèles moins coûteux plutôt qu’à rationner les équipes.

Le message de l’entreprise tient en deux chiffres apparemment contradictoires. Les dépenses d’IA ont baissé de près de 50 % tandis que la consommation de tokens continue de croître. Coinbase mise sur des modèles open-weight comme GLM 5.2 et Kimi 2.7 dans ses réglages par défaut, complétés par un travail sur le routage et le caching.

Points clés

  • Coinbase dit avoir réduit ses dépenses d’IA de près de 50 % alors que l’usage des tokens augmente
  • La méthode repose sur le routage des requêtes, le caching et des modèles open-weight comme GLM 5.2 et Kimi 2.7
  • 91 % des employés n’avaient jamais atteint leur limite de consommation, écartant un durcissement des quotas
  • Brian Armstrong vise une migration de 80 % des workloads vers des modèles bien moins coûteux sous 12 à 18 mois

Des économies par le routage et le caching

Coinbase n’a pas restreint l’accès des équipes à l’IA. L’entreprise privilégie des ajustements d’infrastructure : choix du modèle par défaut, routage des requêtes et amélioration du cache. Brian Armstrong indique qu’environ 91 % des employés n’avaient jamais atteint la limite de consommation prévue, ce qui a conduit l’entreprise à ne pas durcir les quotas.

L’optimisation du caching a joué un rôle clé. Dans le cas de LibreChat, le taux de cache hit serait passé de 5 % à 60 % après optimisation. L’objectif est de réduire le coût par requête sans empêcher les ingénieurs de choisir un modèle plus avancé quand la tâche l’exige.

« Nous travaillons dur pour router les prompts vers des modèles moins chers lorsque cela est approprié, et dans certains cas nous avons pu maintenir les coûts à peu près stables, tandis que l’usage des tokens continue de croître de manière exponentielle », a écrit Brian Armstrong, directeur général de Coinbase.

Une bascule vers les modèles ouverts

Ce message prolonge des prises de parole antérieures. Début juin, Armstrong disait s’attendre à voir environ 80 % des workloads d’IA migrer dans les 12 à 18 mois vers des modèles environ 99 % moins chers. La montée en charge de l’usage interne se poursuit en parallèle, preuve que la baisse des coûts ne repose pas sur un gel de l’activité.

Pour une entreprise qui s’appuyait largement sur des modèles propriétaires, le recours aux poids ouverts change l’équation économique. L’enjeu reste de conserver des performances suffisantes pour les équipes techniques tout en empêchant la facture de progresser au même rythme que les usages.

Commentaires