
Un accélérateur IA sur USB qui promet 40 TOPS pour l’inférence locale, avec 8 Go dédiés et 2,5 W en charge typique. De quoi sortir des NPUs intégrés et déporter des workloads génératifs sans toucher au cloud.
ASUS UGen300 : 40 TOPS sur USB-C, mémoire dédiée et prise en charge multi-OS
ASUS présente UGen300, un accélérateur IA compact (105 × 50 × 18 mm) équipé du processeur Hailo‑10H donné pour 40 AI TOPS. Une déclinaison en M.2 est aussi prévue. L’objectif est clair : ajouter une brique d’inférence locale pour LLMs, VLMs et autres modèles génératifs, sans dépendance au cloud.

Le module embarque 8 Go de LPDDR4 dédiés afin d’éviter le partage mémoire avec l’hôte et les goulots d’étranglement associés. La connexion s’effectue en USB‑C (USB 3.1 Gen 2), avec une consommation annoncée de 2,5 W sur des charges typiques. Le support est annoncé pour Windows, Linux et Android, avec une compatibilité immédiate TensorFlow, PyTorch et ONNX.
Accélération d’inférence locale et intégration logicielle
Positionné pour suppléer CPU et NPU, le Hailo‑10H vise des usages comme la génération de texte, la synthèse et la résumé de vidéo, le voice‑to‑action, le triggering d’événements ou la perception temps réel. La promesse : latence minimale, pas d’abonnement, confidentialité et fiabilité accrue avec l’exécution on‑device.

ASUS prépare un utilitaire UGen Utility pour valider rapidement plus de 100 modèles pré‑entraînés. Le produit s’adosse aussi à la Hailo Developer Community pour les tutoriels, designs de référence et retours d’expérience, afin de réduire le time‑to‑deployment sur l’edge.
Spécifications clés et cas d’usage
• Processeur IA : Hailo‑10H, 40 AI TOPS
• Mémoire : 8 Go LPDDR4 dédiés
• Interface : USB‑C (USB 3.1 Gen 2)
• Dimensions : 105 × 50 × 18 mm
• Consommation : 2,5 W en charge typique
• OS : Windows, Linux, Android
• Frameworks : TensorFlow, PyTorch, ONNX
• Form factors : USB, M.2
Dans un parc hétérogène, UGen300 peut décharger les pipelines IA lourds sur des postes clients ou des boîtiers embarqués, tout en stabilisant le débit grâce à la RAM dédiée. Sur le marché, cette approche plug‑and‑play met la pression sur les NPUs intégrés à faible bande passante mémoire et ouvre un chemin de montée en charge granulaire, appareil par appareil, sans refonte plateforme.
Source : TechPowerUp