
Une GeForce RTX 4070 SUPER exécute désormais un réseau officiellement réservé aux RTX 50, avec un résultat annoncé identique jusque dans ses sorties intermédiaires. Une déclinaison WebGPU le fait même fonctionner dans un navigateur, au prix de performances nettement inférieures.
OpenDLSS-NR reconstitue les 71 blocs du réseau NVIDIA
Le développeur MAAN a publié OpenDLSS-NR, une réimplémentation open source sous Vulkan du réseau Neural Rendering de DLSS 5. Le projet reproduit l’architecture à 71 blocs présente dans le runtime et la DLL DLSS-NR 310.8.0, avec des résultats annoncés « bit-exact » face à l’implémentation de NVIDIA, y compris pour les sorties intermédiaires.
Contrairement à DLSS Super Resolution, qui reconstruit une image en définition supérieure depuis une source moins définie, DLSS 5 Neural Rendering intervient sur une image déjà calculée. Le réseau enrichit son rendu avec des détails générés par IA et modifie notamment l’éclairage, les matériaux et les traits des visages.
OpenDLSS-NR s’appuie sur une architecture U-Net associant des transformers à fenêtres décalées et un Vision Transformer global. Le calcul emploie des activations FP8, une accumulation FP16 et environ 141 MiB de poids.
De 2,8 à 29,3 ms sur une RTX 4070 SUPER
L’implémentation comprend des noyaux PTX optimisés pour les Tensor Cores de NVIDIA ainsi que des compute shaders GLSL. Sur une GeForce RTX 4070 SUPER, MAAN relève 2,8 ms en 768 × 768, 7,8 ms en 1920 × 1080, 12,6 ms en 2560 × 1440 et 29,3 ms en 3840 × 2160 pour l’exécution complète du réseau.
Ces mesures correspondent au meilleur temps observé sur 40 images et non à une moyenne. Elles démontrent néanmoins que le réseau peut être exécuté sur Ada Lovelace, alors que NVIDIA réserve actuellement la prise en charge officielle du DLSS 5 aux GeForce RTX 50. Une compatibilité avec les RTX 40 est prévue ultérieurement.
Une version WebGPU indépendante des Tensor Cores
Le dépôt intègre aussi une implémentation WebGPU indépendante, capable de reproduire le même réseau sans Tensor Cores NVIDIA ni prise en charge native du FP8. Cette voie pourrait étendre le procédé à d’autres architectures graphiques et plateformes, mais son coût reste élevé : 72 ms en 512 × 512, contre environ 2,7 ms avec la version native optimisée.
Un démonstrateur technique, pas encore un mod prêt à installer
Le projet ne distribue pas les poids propriétaires de NVIDIA, que l’utilisateur doit fournir séparément. Il ne constitue pas non plus un remplacement directement intégrable aux jeux : OpenDLSS-NR fonctionne actuellement comme une implémentation autonome et n’inclut pas DLSS Super Resolution.
MAAN fournit toutefois un moteur de démonstration basé sur Filament de Google, avec vecteurs de mouvement et rétroaction temporelle. Le code et sa documentation sont disponibles sur GitHub sous licence MIT.
Au-delà de la prouesse de rétro-ingénierie, le projet montre que la restriction initiale aux RTX 50 ne découle pas d’une impossibilité absolue sur Ada Lovelace. Les temps relevés en 1440p et surtout en 4K restent trop lourds pour une intégration transparente, mais cette base pourrait accélérer les travaux de la communauté sur les anciennes RTX et, via WebGPU, sur du matériel non NVIDIA.
Source : Wccftech