
Alibaba Qwen a dévoilé Qwen3.7-Max, un modèle « agentic » présenté comme son nouveau flagship pour des agents autonomes capables de coder, d’orchestrer des workflows via MCP et de tenir des chaînes d’actions longues sur des tâches multi-étapes. Le déploiement passera « prochainement » par l’API d’Aliyun Bailian.

Positionnement et périmètre fonctionnel
Le constructeur met l’accent sur la polyvalence: du prototypage front-end aux projets multi-fichiers, automatisation bureautique par intégration MCP et coordination multi-agents, et exécution prolongée. Un test interne évoqué parle d’une optimisation de noyau menée en autonomie sur 35 heures, avec plus de 1 000 appels d’outils, sans rupture de chaîne de raisonnement. Qwen insiste par ailleurs sur une bonne généralisation inter-cadres, y compris sous Claude Code, OpenClaw et Qwen Code.

Mesures de performance publiées
Sur les agents de programmation, Qwen3.7-Max revendique des premiers rangs: SWE-Pro 60,6; SWE-Multilingual 78,3; SciCode 53,5; QwenSVG 1 608. Sur Terminal Bench 2.0–Terminus, il marque 69,7 contre 67,9 pour DS-V4-Pro Max. Sur SWE-Verified, 80,4, au niveau d’Opus-4.6 Max (80,8) et de DS-V4-Pro Max (80,6).
Sur les agents généralistes, l’écart se creuse selon l’éditeur: MCP-Mark 60,8 (vs GLM-5.1 57,5), MCP-Atlas 76,4 (vs Opus-4.6 75,8), Skillbench 59,2 (vs K2.6 56,2). Kernel Bench L3 signale une accélération médiane ×1,98 et 96 % de taux d’accélération pour l’optimisation de kernels GPU. Bon niveau aussi sur BFCL-V4 75,0, Qwenclaw 64,3, ClawEval 65,2, juste derrière Opus-4.6 Max. En bureautique, SpreadSheetBench-v1 atteint 87,0.
Reste à voir comment ces scores tiendront une fois les agents confrontés à des environnements moins balisés, où l’on bascule vite d’un benchmark à des chaînes d’outils bien plus capricieuses. C’est précisément le terrain sur lequel Google Deep Research Max a déjà commencé à installer ses propres repères.
En raisonnement, Qwen3.7-Max prend l’avantage publié sur plusieurs suites: GPQA Diamond 92,4 (vs Opus-4.6 91,3), HLE 41,4 (vs 40,0), HMMT 2026 Feb 97,1 (vs 96,2), IMOAnswerBench 90,0 (vs DS-V4-Pro 89,8) et Apex 44,5 (vs 38,3). En capacités générales et multilingues: IFBench 79,1 (vs DS-V4-Pro 77,0), WMT24++ 85,8, MAXIFE 89,2, SuperGPQA 73,6, QwenWorldBench 57,3.
L’arrivée par API sur Aliyun Bailian place Qwen3.7-Max face aux modèles orientés agents d’Anthropic et de DeepSeek, avec un discours axé sur la tolérance aux longues chaînes d’outils et l’optimisation GPU embarquée. Si les benchmarks propriétaires comme QwenSVG ou Qwenclaw jouent en terrain familier, les écarts constatés sur GPQA Diamond, SWE-Verified ou SpreadsheetBench, plus reconnus, donneront matière aux éditeurs d’agents à éprouver la robustesse inter-outils et la stabilité en exécution prolongée dans des pipelines réels.
Ce type d’exécution prolongée rappelle aussi combien le protocole MCP, censé fluidifier les échanges entre outils, peut devenir un point de fragilité quand la surface d’attaque s’élargit. Une démonstration récente l’a montré avec la faille MCP d’Anthropic, qui a justement remis la sécurité de ces chaînes d’agents sous surveillance.
Source : ITHome