
Un modèle de 552 milliards de paramètres vient de culminer à 494 tokens par seconde sur une installation suffisamment compacte pour tenir dans un rack domestique. La démonstration illustre jusqu’où peut aller l’inférence locale, à condition d’y consacrer plusieurs dizaines de milliers de dollars.
DeepSeek V4.1-Flash exploite quatre DGX Spark
Patrick Moorhead, ancien d’AMD et analyste technologique, a présenté le 5 octobre 2026 une configuration réunissant quatre NVIDIA DGX Spark dans un rack compact tec MOJO. Des ventilateurs supplémentaires sont placés sous les machines, qui cumulent environ 512 Go de mémoire unifiée.
Chaque DGX Spark embarque un processeur Arm à 20 cœurs, avec 10 Cortex-X925 haute performance et 10 Cortex-A725 efficaces. Chaque cœur possède son cache L2 privé, tandis que les deux clusters disposent chacun de 16 Mo de cache L3, soit 32 Mo au total.
Le GB10 intègre des Tensor Cores de cinquième génération, la prise en charge du DLSS 4 et des cœurs RTX dédiés au ray tracing. NVIDIA annonce jusqu’à 31 TFLOPS en FP32 et 1 000 TOPS en NVFP4 pour les traitements d’IA.
La plateforme comprend également 128 Go de LPDDR5X cohérente, partagée entre CPU et GPU, avec une bande passante d’environ 273 Go/s sur une interface 256 bits. S’y ajoutent une SmartNIC ConnectX-7 avec deux ports QSFP à 200 Gb/s, du 10 GbE, du Wi-Fi 7, du Bluetooth, une sortie HDMI 2.1a et plusieurs ports USB-C.
Le stockage NVMe varie généralement de 1 à 4 To. La consommation indiquée pour une unité se situe entre 140 et 240 W avec l’adaptateur fourni, tandis que la source évoque plus loin une consommation de 400 à 600 W par machine en charge. Le système fonctionne sous DGX OS, une distribution dérivée d’Ubuntu accompagnée de l’écosystème logiciel CUDA.
Un anneau QSFP plutôt qu’un commutateur 200 GbE
Les quatre machines communiquent directement par câbles QSFP, sans routeur optique ni commutateur Ethernet. La topologie forme un anneau : la première unité est reliée aux deuxième et quatrième, la deuxième aux première et troisième, la troisième aux deuxième et quatrième, puis la quatrième aux troisième et première.
NVIDIA recommande normalement une topologie en étoile reposant sur un commutateur 200 GbE pour relier quatre DGX Spark. L’anneau retenu ici réduit le coût matériel, au prix d’une architecture réseau différente de la configuration préconisée.
Une empreinte mémoire de 476 Go
Le choix de DeepSeek V4.1-Flash est déterminant. Malgré ses 552 milliards de paramètres, cette architecture Mixture-of-Experts n’en active que 8 milliards pendant le prefill et 16 milliards durant le décodage. Elle compte un expert partagé et 384 experts routés, dont six actifs.
Le modèle combine Causal Encoder-Decoder (CED), Compressed Sparse Attention 2 (CSA2), quantification FP4 et SWA Bounded Replay. Ces mécanismes ramènent son cache KV à seulement 890 octets par token et permettent de contenir son empreinte mémoire à 476 Go, juste sous la capacité agrégée du cluster.
494 tokens/s en pointe, mais avec 32 requêtes
Le débit maximal atteint 494 tokens/s sur du code avec 32 requêtes simultanées. Sur de la prose, toujours avec 32 requêtes concurrentes, le pic descend à 280 tokens/s.
Avec une seule requête, les mesures sont plus représentatives d’un usage interactif : environ 58 tokens/s en prose et 96 tokens/s pour le code. Le traitement des prompts atteint 4 764 tokens/s, avec un délai d’environ 0,2 seconde avant le premier token lorsque le système est au repos.
Une unité DGX Spark de 128 Go est proposée entre 5 500 et plus de 9 000 dollars selon le stockage et la disponibilité, soit approximativement 4 800 à plus de 7 800 euros hors taxes au taux indicatif de 0,87 euro pour un dollar. Les quatre machines représentent donc 22 000 à 36 000 dollars, environ 19 100 à 31 300 euros.
Les câbles QSFP nécessaires à l’anneau ajoutent quelques centaines de dollars. Le rack, les ventilateurs, la distribution électrique et les accessoires réclament encore quelques centaines de dollars, portant l’ensemble entre 25 000 et 40 000 dollars, soit environ 21 800 à 34 800 euros hors taxes.
Cette configuration ne remplace pas économiquement une API pour un usage occasionnel. Elle devient en revanche cohérente lorsque la confidentialité des données, l’absence de quotas et une exploitation continue priment sur l’investissement initial. Le résultat montre surtout que la mémoire unifiée et un réseau rapide permettent désormais d’héberger localement des modèles MoE d’une taille autrefois réservée aux infrastructures de centre de données.
Source : Wccftech