
Un Galaxy S24+, trois Mac et deux PC Windows ont uni leurs ressources pour charger un modèle normalement réservé aux machines très fortement dotées en mémoire. L’expérience fonctionne, mais son débit de 1,1 token par seconde la cantonne au rang de démonstration technique.
gpt-oss-120b réparti sur six machines grand public
Le redditeur « Medicine_Blogscanner » a exécuté la version quantifiée en 4 bits de gpt-oss-120b sur un cluster particulièrement hétérogène. Celui-ci associe un Samsung Galaxy S24+, un mini-PC équipé d’une GeForce RTX 3060 avec 12 Go de VRAM, un ordinateur portable Windows doté de 12 Go de mémoire, un MacBook Pro Intel, un Mac mini et un MacBook Pro M3.
Un LLM de 120 milliards de paramètres de cette catégorie réclame habituellement entre 60 et 80 Go de VRAM et de mémoire système pour conserver des performances acceptables. La variante 4 bits demande au minimum 60 Go, tandis que le modèle non quantifié nécessiterait environ 240 Go de RAM.
Une empreinte mémoire ramenée à 47 Go
Pour rester dans les capacités cumulées de ces appareils, l’empreinte du modèle a été réduite à 47 Go. Le dispositif repose ensuite sur le pipeline parallelism : les couches du réseau neuronal sont découpées et distribuées entre les six nœuds, plutôt que chargées intégralement sur une seule machine.
Le système principal, baptisé « Tiny », assure l’essentiel du calcul avec environ 28,7 Go de mémoire système et la RTX 3060. Les autres appareils accueillent les portions restantes du modèle et interviennent successivement au fil de l’inférence.
Une réussite technique bridée par le réseau
Cette méthode contourne la capacité limitée de chaque appareil, mais elle ne supprime ni les transferts de données ni les temps d’attente entre les nœuds. Les différences d’architecture, de mémoire et de puissance de calcul aggravent encore les latences, jusqu’à limiter le cluster à seulement 1,1 token par seconde.
À titre de comparaison matérielle, l’exécution locale de modèles aussi denses vise plutôt des systèmes disposant de 128 Go de mémoire unifiée, une capacité proposée sur les MacBook Pro haut de gamme et évoquée pour de futures machines RTX Spark. Ces plateformes restent toutefois nettement plus coûteuses qu’un assemblage de matériels déjà disponibles.
Les mini-PC dédiés à l’IA explorent aussi cette montée en mémoire et en calcul distribué, comme le MSI PRO MAX EDGE AI+ 11M conçu pour les clusters IA.
L’expérience démontre surtout que la capacité mémoire d’un LLM peut être mutualisée entre des appareils ordinaires. Elle ne constitue pas encore une alternative crédible à une station de travail dédiée : à 1,1 token par seconde, la génération longue devient laborieuse, et des modèles moins denses restent bien plus adaptés à un usage local quotidien.
Source : Reddit