
Empiler la logique directement sur la mémoire change l’équation du débit dans les accélérateurs IA. À Hot Chips 2026, d-Matrix avance une carte Raptor donnée pour plus de 100 To/s avec seulement 32 Go de 3D-DRAM.
Raptor mise sur la proximité entre calcul et 3D-DRAM
Le principe retenu par d-Matrix s’écarte du schéma HBM classique. Le die logique en TSMC N4 est posé directement sur une DRAM maison via un empilement face-à-face, au lieu d’installer de gros stacks HBM à côté du processeur.

D’après la société, cette interconnexion très courte augmente fortement la bande passante tout en réduisant l’énergie nécessaire au transfert des données. La cible n’est pas le GPU de jeu, mais l’inférence IA.
32 Go, mais plus de 100 To/s
Raptor associe 32 Go de 3D-DRAM à une bande passante annoncée de plus de 100 To/s. En face, d-Matrix cite une configuration en HBM4 de 192 Go autour de 18 To/s.
Le compromis est net : la HBM garde un avantage massif en capacité, tandis que la 3D-DRAM cherche à déplacer un volume plus réduit de données beaucoup plus vite. Pour le décodage des grands modèles de langage, d-Matrix estime que cette contrainte de bande passante est souvent dominante, chaque nouveau token imposant des accès répétés aux poids du modèle et au KV cache.

Débit, consommation et surface silicium
La société mesure sa liaison mémoire verticale à 0,37 pJ/bit, contre environ 2 à 3 pJ/bit pour la HBM4 dans sa comparaison. Même à ce niveau, déplacer les données reste coûteux : à 100 To/s, Raptor demanderait encore près de 296 W rien que pour les entrées-sorties mémoire.

D-Matrix avance aussi environ 20 fois plus de bande passante par mm² et 13,5 fois moins d’énergie par unité de bande passante qu’une configuration NVIDIA Rubin R200 en HBM4. Il s’agit ici de calculs internes liés à la surface silicium, pas de mesures indépendantes de performances.
Les limites thermiques restent centrales
Faire fonctionner de la DRAM aussi près d’un die logique à forte puissance pose des problèmes de chaleur, de rafraîchissement et de fiabilité. Les 32 Go par carte restent aussi très loin des capacités offertes par les accélérateurs IA actuels basés sur la HBM.
Pour encadrer ces contraintes, d-Matrix mentionne un rafraîchissement plus rapide, de l’ECC et des banques mémoire de secours. Raptor ne doit donc pas être lu comme une HBM plus rapide, mais comme une architecture mémoire conçue pour des charges IA où la bande passante prime sur la capacité.


Le projet n’est pas encore un produit final. La présentation Hot Chips expose un accélérateur commercial planifié et ses spécifications visées, tandis que la brique 3D-DRAM a déjà été démontrée via le silicium de test Pavehawk, le demonstrateur interne de d-Matrix pour cette mémoire empilée.
Si d-Matrix tient ses chiffres en production, le point intéressant n’est pas de remplacer la HBM partout, mais de segmenter plus finement le marché de l’inférence. Les cartes orientées décodage pourraient accepter une capacité réduite en échange d’un débit très supérieur, à condition que le coût, la dissipation thermique et la fiabilité ne gomment pas l’avantage promis sur le papier.
Source : ServeTheHome