
Près de dix ans après le lancement de Volta, des GPU V100 exécutent encore des charges clientes chez CoreWeave. Dans le même temps, le fournisseur met en production la génération Vera Rubin, mesurée jusqu’à 4,8 fois plus rapide que le GB200 NVL72 sur une charge d’inférence ciblée.
NVIDIA Vera Rubin passe en production chez CoreWeave

Présenté lors de CoreWeave Fully Connected 2026, le Vera Rubin NVL72 est désormais proposé dans le cloud de CoreWeave, aux côtés de configurations Vera autonomes. NVIDIA et son partenaire promettent des tâches achevées en quelques jours plutôt qu’en plusieurs semaines, un gain qui reste toutefois dépendant des modèles, des logiciels et du niveau d’interactivité.
Cognition figure parmi les premiers clients. L’entreprise, qui développe l’agent de programmation Devin, a étendu son parc à plusieurs milliers de GPU en neuf mois. Dès septembre, elle avait comparé Vera Rubin à Grace Blackwell sur l’inférence SWE-2 et relevé un débit total de tokens jusqu’à 4,8 fois supérieur à celui du GB200 NVL72, avec une génération de code plus rapide et un raisonnement en plusieurs étapes plus réactif.
Un autre résultat communiqué fait état d’un débit de sortie par GPU jusqu’à 3,8 fois supérieur selon le niveau d’interactivité. Ces données proviennent de premiers essais et ne constituent donc pas une mesure universelle des performances de la plateforme.

Des V100 toujours rentabilisés près de dix ans après Volta
Ian Buck, vice-président hyperscale et calcul haute performance chez NVIDIA, souligne que les V100 de CoreWeave traitent toujours des charges clientes près d’une décennie après l’arrivée de Volta. Le groupe met en avant la possibilité d’affecter chaque génération de GPU aux tâches qui lui correspondent, au lieu de remplacer systématiquement l’ensemble du parc.
CoreWeave indique avoir déployé en quelques jours un cluster Vera Rubin de production pour Cognition. La capacité est accessible à travers CoreWeave Kubernetes Service, SUNK, CoreWeave Mission Control, CoreWeave Sandboxes et CoreWeave Inference.
Vera CPU cible les environnements d’agents à grande échelle
CoreWeave intègre également Vera CPU à son offre. Un rack rassemble 128 processeurs Vera, soit 11 264 cœurs, et peut gérer plus de 11 000 environnements simultanés. La société revendique des sandboxes agentiques lancées jusqu’à trois fois plus rapidement ainsi qu’un gain de 1,7 fois sur l’ensemble des tâches réussies de Terminal-Bench.
Une étude de Signal65 compare par ailleurs le coût total de déploiements IA sur trois ans chez CoreWeave à celui des grands clouds généralistes. Elle avance un coût inférieur jusqu’à 41 % sur NVIDIA HGX B200, 65 % sur GB200 NVL72 et 52 % sur HGX B300. Ces écarts reposent sur les scénarios et hypothèses de cette étude, et ne s’appliquent pas nécessairement à chaque exploitation.
CoreWeave Forge relie entraînement, agents et observabilité
En parallèle du matériel, CoreWeave lance Forge, un environnement réunissant Weights & Biases, l’expertise de post-entraînement d’OpenPipe et le projet open source de notebooks marimo. L’objectif est de relier expérimentation, exécution et amélioration continue des modèles et des agents.
Désormais disponible à grande échelle, CoreWeave ARIA analyse les exécutions, propose des expériences et des modifications de code, les stocke dans GitHub puis identifie les facteurs ayant influencé les résultats. Le nouveau service Agent Lens exploite quant à lui les traces de production : CoreWeave revendique une détection des défaillances améliorée de 20 % et des corrections réalisées à moitié prix, à partir de dizaines de millions de traces d’agents.
CoreWeave Sandboxes est également disponible à grande échelle pour isoler les appels d’outils, évaluations et tâches de reinforcement learning sur CPU ou GPU, en mode serverless ou sur l’infrastructure d’entraînement existante. Les offres serverless de supervised fine-tuning et de reinforcement learning permettent d’exploiter les signaux de production sans cluster dédié. Pour son service de RL, CoreWeave annonce un entraînement 1,4 fois plus rapide et 40 % moins coûteux qu’une installation autogérée.
Le déploiement illustre surtout la stratégie économique des clouds spécialisés : conserver les anciennes générations pour les charges sensibles au coût, tout en réservant les systèmes NVL72 les plus récents aux workloads où leur débit compense une infrastructure dense et énergivore. La coexistence des V100 et de Vera Rubin est moins paradoxale qu’elle n’y paraît : elle montre qu’à l’échelle d’un opérateur, la durée de vie utile d’un accélérateur dépend autant de son positionnement tarifaire et logiciel que de ses performances brutes.
Source : Wccftech