
Une station équipée de 128 Go de mémoire a planté après seulement 90 minutes d’inférence locale. Une barrette de 8 Go était hors service, puis une seconde a commencé à remonter des erreurs quelques jours plus tard.
Une DDR4 ECC défaillante après 90 minutes
Le propriétaire de la machine, connu sous le pseudonyme Future_Fuel_8425 sur Reddit, utilisait auparavant un LLM de 20B sur une GeForce RTX 5070 Ti dotée de 16 Go de GDDR7. Ce modèle tenait dans la VRAM, mais se révélait trop limité pour ses travaux complexes sur des bases de données.
Il est donc passé à Ornith-1.5-35B-A3B, un modèle de 35B nécessitant un déchargement partiel vers la mémoire système. La station disposait de 128 Go de DDR4 ECC, répartis en barrettes de 8 Go. Au retour de l’utilisateur, 90 minutes après le lancement, la machine avait planté.
Le diagnostic a désigné l’une des barrettes, devenue inutilisable. Après son retrait, le modèle a été relancé. L’utilisateur appréciait sa qualité ainsi que le maintien des performances en tokens lorsque les 16 Go de VRAM étaient saturés et que la RAM prenait le relais.
Une seconde barrette en erreur après 8 à 9 jours
La première panne pouvait encore passer pour une défaillance isolée, d’autant que les modules étaient anciens. Après 8 à 9 jours d’utilisation continue, les journaux ont toutefois signalé des erreurs sur une deuxième barrette.
Le propriétaire écarte une surchauffe en indiquant que le CPU et le GPU n’ont jamais dépassé 80 °C. Cette mesure ne suffit pourtant pas à innocenter la température : aucune donnée concernant directement les modules DDR4 ECC n’a été publiée.
L’âge des barrettes, une charge prolongée et un flux d’air insuffisant autour des emplacements DIMM constituent des causes plus crédibles qu’un LLM qui « détruirait » directement la mémoire. Une activité soutenue peut révéler rapidement un module déjà fragilisé, mais des lectures séquentielles continues ne devraient pas, à elles seules, rendre une RAM saine inutilisable.
Passer à la DDR5 apporterait davantage de bande passante, mais ne garantirait pas une meilleure résistance thermique. En l’absence des tensions appliquées, des relevés de température des DIMM, des résultats MemTest et des références exactes des modules, le lien de causalité entre Ornith-1.5-35B-A3B et ces deux défaillances reste impossible à établir.
Source : Reddit