Les GPU ne suffisent plus : le boom silencieux de l'inférence

Pourquoi ça compte pour toi
Tu fais tourner de l'IA ? Les coûts d'inférence commencent à devenir le vrai problème. Cette tendance montre que le marché bascule vers des alternatives à Nvidia — moins chères, plus efficaces énergétiquement. Si tu dois déployer du ML en production, comprendre ce basculement est crucial pour tes coûts d'infra demain.
Ce qu'il faut retenir
- 1.General Compute lève 400M$ contre des puces SambaNova (SN50), première fois qu'on finance de l'inférence en collatéral
- 2.Ces puces d'inférence : 16x plus rapides que les GPU, sans refroidissement coûteux, déployables partout
- 3.Le marché pivote : modèles open-source moins chers > derniers LLM des labos. Nvidia trop cher pour faire tourner du texte déjà entraîné
Tu galères avec le jargon ?
Lis la version réécrite en mode débutant — toutes les idées, sans le jargon.
Pourquoi les puces d'inférence changent la donne
Quand on construit un modèle d'IA, tu as besoin de GPU Nvidia haut de gamme (cher, gourmand en énergie). Mais une fois le modèle entraîné ? Tu dois juste le faire tourner vite sur les requêtes des utilisateurs. Ce sont deux besoins totalement différents.
Les puces d'inférence comme le SN50 de SambaNova sont optimisées pour ça : exécuter du code ML déjà existant, pas l'inventer. Résultat : moins de puissance = moins d'électricité = pas besoin de systèmes de refroidissement à l'eau = déploiement partout, même dans les petits data centers.
General Compute (fondée par Finn Puklowski, seed 15M$ en mai) parie que c'est l'avenir. Et Upper90 — le fonds qui avait financé les premiers achats de GPU chez Crusoe en 2021 — semble d'accord. "Quand on a financé les premiers GPU, le marché était inefficace," raconte Billy Libby, co-founder d'Upper90. "Maintenant les GPU sont sur-achetés. L'inférence, c'est la prochaine vague."
Le signal : la fin du monopole Nvidia (doucement)
Ce deal signifie surtout une chose : les banques commencent à croire que des alternatives à Nvidia peuvent valoir quelque chose. Upper90 a pris le risque de financer du matériel non-Nvidia. C'est pas rien — les financiers traditionnels disaient non il y a 5 ans.
OpenRouter, Fireworks (accès illimité aux modèles open) lèvent des tours massives. Kimi K3 (chinois) rivalise avec Claude et GPT-4o sur les benchmarks de code. Groq et Cerebras attirent les acquéreurs. AMD pousse aussi l'inférence. Soudain, Nvidia n'est plus la seule réponse.
Puklowski le dit clairement : "Des puces avec un coût total de possession bien meilleur que Nvidia émergent, mais personne ne les achète. Ce deal, c'est le premier signal que le capital se réorganise et que la domination monopolistique se fragmente."
Pour qui c'est pertinent ?
Si tu opères une plateforme d'IA (API, chatbot, app) et que tes marges sont rongées par le coût d'inférence Nvidia, c'est pertinent. Si tu explores du ML en prod sur AWS/Azure et tu te demandes s'il n'existe pas mieux : c'est pertinent. Si tu construis une startup d'infra AI et tu dépends à 100% de Nvidia : regarde derrière toi.
Le paradoxe ? C'est pas "Nvidia va disparaître." C'est "pour 80% des besoins d'inférence, tu n'as pas besoin du top Nvidia. Tu peux aller ailleurs, moins cher, et ça marche."
Et concrètement pour toi ?
Choisis ton profil — la lecture de l'article change selon qui tu es.
Pour toi, retiens que Nvidia dominait parce que tu avais besoin de puissance brute pour l'entraînement. Maintenant ? Faire tourner de l'IA déjà entraînée coûte moins cher sur d'autres puces — le monopole se lézarde.
Essayer maintenant
Explorer General Compute →Source
📊 Cours en bourse
Pour aller plus loin
Cet article t'a donné envie d'approfondir ? Deux formations Noésis t'attendent :