gpt-oss-120b tourne sur six appareils disparates, dont un smartphone Android

Un Galaxy S24+, trois Mac et deux PC Windows ont uni leurs ressources pour charger un modèle normalement réservé aux machines très fortement dotées en mémoire. L’expérience fonctionne, mais son débit de 1,1 token par seconde la cantonne au rang de démonstration technique.

gpt-oss-120b réparti sur six machines grand public

Le redditeur « Medicine_Blogscanner » a exécuté la version quantifiée en 4 bits de gpt-oss-120b sur un cluster particulièrement hétérogène. Celui-ci associe un Samsung Galaxy S24+, un mini-PC équipé d’une GeForce RTX 3060 avec 12 Go de VRAM, un ordinateur portable Windows doté de 12 Go de mémoire, un MacBook Pro Intel, un Mac mini et un MacBook Pro M3.

Un LLM de 120 milliards de paramètres de cette catégorie réclame habituellement entre 60 et 80 Go de VRAM et de mémoire système pour conserver des performances acceptables. La variante 4 bits demande au minimum 60 Go, tandis que le modèle non quantifié nécessiterait environ 240 Go de RAM.

Une empreinte mémoire ramenée à 47 Go

Pour rester dans les capacités cumulées de ces appareils, l’empreinte du modèle a été réduite à 47 Go. Le dispositif repose ensuite sur le pipeline parallelism : les couches du réseau neuronal sont découpées et distribuées entre les six nœuds, plutôt que chargées intégralement sur une seule machine.

Le système principal, baptisé « Tiny », assure l’essentiel du calcul avec environ 28,7 Go de mémoire système et la RTX 3060. Les autres appareils accueillent les portions restantes du modèle et interviennent successivement au fil de l’inférence.

Une réussite technique bridée par le réseau

Cette méthode contourne la capacité limitée de chaque appareil, mais elle ne supprime ni les transferts de données ni les temps d’attente entre les nœuds. Les différences d’architecture, de mémoire et de puissance de calcul aggravent encore les latences, jusqu’à limiter le cluster à seulement 1,1 token par seconde.

À titre de comparaison matérielle, l’exécution locale de modèles aussi denses vise plutôt des systèmes disposant de 128 Go de mémoire unifiée, une capacité proposée sur les MacBook Pro haut de gamme et évoquée pour de futures machines RTX Spark. Ces plateformes restent toutefois nettement plus coûteuses qu’un assemblage de matériels déjà disponibles.

L’expérience démontre surtout que la capacité mémoire d’un LLM peut être mutualisée entre des appareils ordinaires. Elle ne constitue pas encore une alternative crédible à une station de travail dédiée : à 1,1 token par seconde, la génération longue devient laborieuse, et des modèles moins denses restent bien plus adaptés à un usage local quotidien.

Source : Reddit

Wael.K

Ravi de vous accueillir sur ma page dédiée aux articles ! Je suis Wael El Kadri, et je suis un ingénieur civil de profession. Mais ma véritable passion est le matériel informatique. J'en suis passionné depuis l'âge de 12 ans, et j'aime apprendre et découvrir de nouvelles choses. En 2016, j'ai créé ma page personnelle sur les réseaux sociaux, baptisée Pause Hardware. C'est là que je partage mes créations en modding, mais aussi divers sujets liés au matériel informatique en général. J'ai également crée le site web, pausehardware.com, en 2019 où je publie des articles plus approfondis sur le matériel à travers des tests et revues et articles de news. J'ai eu l'opportunité de participer en tant qu'exposant à plusieurs événements liés aux jeux vidéo, aux côtés de grandes marques, notamment lors de la Paris Game Week en 2018 et 2019. Je reste constamment en quête de nouvelles manières de partager mes connaissances et ma passion pour le matériel informatique avec d'autres passionnés. Voici quelques publications médiatiques qui ont mis en lumière mon travail : Deux articles dans le magazine Extreme PC, parus dans ses  numéros 1 et 21 : Extreme PC Magazine Issue 21 (adobe.com) Également, un article sur Forbes intitulé "Dix Modèles de PC Incroyables en 2021" sur forbes.com : Ten Incredible PC Mods Of 2021 (forbes.com)
guest
0 Commentaires
Le plus ancien
Le plus récent Le plus populaire
0
Nous aimerions avoir votre avis, veuillez laisser un commentaire.x