
Un modèle de 284 milliards de paramètres pourrait bientôt tenir dans la mémoire d’un ordinateur portable. Microsoft affirme même que cette exécution entièrement locale dépasserait GPT-5 sur certains tests de code et de raisonnement.
RTX Spark repousse les limites de l’IA locale
Lors de la présentation de RTX Spark, NVIDIA évoquait déjà l’exécution de modèles de 120 milliards de paramètres avec une fenêtre de contexte d’un million de tokens. Pavan Davuluri, vice-président exécutif de Windows + Devices chez Microsoft, avance désormais une capacité nettement supérieure.
L’architecture à mémoire unifiée de RTX Spark permettrait d’exécuter entièrement sur la machine DeepSeek-V4.1-Flash, un modèle open weight dense de 284 milliards de paramètres. Quantifié en 1,6 bit, celui-ci occuperait environ 60 Go de mémoire.
128 Go de mémoire unifiée pour élargir le contexte
La configuration haut de gamme du Surface Laptop Ultra intégrerait 128 Go de mémoire unifiée, laissant une marge importante après le chargement du modèle. Cette réserve pourrait notamment servir à augmenter sensiblement la fenêtre de contexte, particulièrement coûteuse en mémoire lors de l’inférence.
L’arrivée de RTX Spark s’accompagne aussi d’une nouvelle option dans Windows 11. L’utilisateur pourra déterminer la quantité de mémoire attribuée au GPU pour les charges de travail liées à l’intelligence artificielle, un réglage central sur une architecture où CPU et GPU partagent le même pool.
Des performances annoncées devant GPT-5
Microsoft soutient que cette version 1,6 bit de DeepSeek-V4.1-Flash peut rivaliser avec GPT-5, voire le dépasser, dans certains benchmarks de programmation et de raisonnement. GPT-5 était présenté comme le modèle le plus avancé d’OpenAI avant l’arrivée de GPT-6 Astra.
La comparaison doit toutefois rester prudente. Une quantification aussi agressive réduit fortement l’empreinte mémoire, mais son incidence sur la précision, le débit, la latence et la qualité des réponses dépend de l’implémentation comme des tests retenus.
Les premières machines commerciales devront donc confirmer ces affirmations en conditions réelles. Si les performances annoncées se vérifient, les portables à mémoire unifiée de grande capacité pourraient déplacer une partie des usages avancés du cloud vers le poste local, avec davantage de confidentialité et sans coût d’inférence à distance.
Source : Rohan Paul