
Un simple changement dans la gestion des accès mémoire fait progresser jusqu’à 23 % les LLM locaux sur Strix Halo. Attendu fin octobre ou début novembre, Linux 7.4 pourrait ainsi apporter un gain sensible aux machines équipées d’un iGPU AMD.
AMD PerfOpt allège le passage par l’IOMMU
Le correctif PerfOpt, pour « Performance Optimization », doit être intégré au noyau Linux 7.4. Il autorise certains périphériques d’E/S intégrés privilégiés, notamment les GPU, à contourner l’IOMMU lorsqu’ils accèdent directement à la mémoire système.
Dans ce mode, l’IOMMU continue d’appliquer les bits d’autorisation IR/IW, mais n’effectue plus les traductions GPA vers SPA. La réduction de cette surcharge doit profiter aux charges sensibles à la latence ou au débit mémoire.
L’activation reste à la charge des pilotes. AMDGPU pourra utiliser PerfOpt lorsqu’un GPU intégré fonctionne déjà en mode identité, tandis qu’un paramètre de module permettra de désactiver systématiquement cette fonction.
Jusqu’à 18 à 23 % sur Strix Halo
Les essais publiés par Phoronix sur un APU AMD Strix Halo montrent une hausse de 18 à 23 % des performances avec des LLM exécutés localement. Ce résultat ne préjuge pas de gains identiques dans tous les logiciels, mais confirme l’intérêt du correctif pour les tâches fortement dépendantes des échanges avec la mémoire partagée.
PerfOpt concerne potentiellement l’ensemble des iGPU AMD compatibles. Son impact pourrait être particulièrement intéressant sur les appareils à faible enveloppe énergétique, comme le Valve Steam Deck et les autres consoles portables équipées de puces AMD, où les ressources graphiques restent contraintes.
Un déploiement dépendant des distributions
Linux 7.4 est attendu fin octobre ou début novembre. Cette version doit également améliorer la prise en charge HDMI, notamment avec le VRR et FreeSync, ce qui en fait une mise à jour notable pour les configurations AMD.
La date d’adoption par SteamOS reste inconnue. Les distributions suivant rapidement les nouvelles branches du noyau et privilégiant les performances, à l’image de CachyOS, devraient proposer PerfOpt plus tôt.
Le bénéfice réel dépendra toutefois des charges et de la rapidité avec laquelle les pilotes activeront ce chemin d’accès. Sur les APU à mémoire unifiée, supprimer une traduction inutile peut néanmoins produire un gain disproportionné, en particulier pour l’inférence locale et les usages GPU limités par la bande passante.
Source : Linux kernel mailing list