Un modèle à mille milliards de paramètres au prix d’une option économique
Le 3 août 2026, l’équipe Qwen d’Alibaba a publié Qwen3.8-Max, son modèle le plus vaste et le plus performant à ce jour — un système à mélange d’experts (MoE) de 2,4 billions de paramètres qui n’en active qu’environ 95 milliards par requête, selon l’analyse technique de DataFloq. Cette conception d’activation clairsemée est ce qui rend le prix agressif possible : au lieu de faire fonctionner l’intégralité des 2,4 billions de paramètres pour chaque requête, le routeur sélectionne un sous-ensemble de sous-réseaux « experts » spécialisés — activant environ 95 des 2,4 billions de paramètres totaux par requête, selon DataFloq — de sorte que le coût de calcul par requête ne représente qu’une fraction de ce qu’exigerait un modèle dense de même taille totale.
L’élément marquant, c’est le prix. Alibaba facture 2 $ par million de tokens en entrée et 6 $ par million de tokens en sortie, avec un tarif de mise en cache descendant à 0,25 $ par million — une tarification que l’analyse de DataFloq décrit comme « nettement moins chère que Claude et GPT-5.6 ». Le modèle est accessible dès maintenant via Alibaba Cloud Model Studio, qui propose des interfaces API compatibles OpenAI et Anthropic, ainsi que la plateforme professionnelle d’Alibaba QwenWork, selon TechNode Global.
Ce que le modèle peut réellement faire
Qwen3.8-Max prend en charge une fenêtre de contexte d’1 million de tokens — suffisamment large pour ingérer une base de code entière, un contrat juridique volumineux, ou des heures de transcription vidéo en un seul passage, selon le compte-rendu technique de TechNode Global. Il accepte le texte, l’image et la vidéo en entrée native. Concernant les performances sur les benchmarks, l’analyse de MarkTechPost recense un score de 86,6 sur Terminal-Bench 2.1, un score de 92,6 sur GPQA Diamond, et un score de 86,1 sur OSWorld-Verified — ce dernier positionnant, selon Alibaba, le modèle devant certains systèmes concurrents sur les tâches d’automatisation agentique de bureau.
Mais le modèle n’est pas un leader uniforme. L’analyse de DataFloq révèle que Qwen3.8-Max obtient un score de 67,7 sur SWE-bench Pro contre 80,0 rapporté pour Claude sur le même benchmark, et les évaluateurs ont signalé une génération de sortie plus lente que celle des systèmes concurrents, ainsi que des difficultés à mener à bien des projets complexes multi-fichiers tels que le développement complet de jeux 3D. Alibaba elle-même n’a pas contesté cet écart — ses propres classements d’arène, cités par DataFloq, placent le modèle cinquième en Text Arena et deuxième en Vision Arena, jamais premier.
La stratégie : le coût de calcul comme véritable champ de bataille
Le positionnement d’Alibaba n’est pas « le modèle le plus intelligent » — c’est « suffisamment bon, partout, pour une fraction du prix ». L’analyse de DataFloq le formule explicitement : Alibaba cible les charges de travail d’entreprise à fort volume et répétitives — automatisation du support client, chaînes de traitement de documents, tâches de codage à long horizon — où l’écart de capacité marginal face à Claude ou GPT-5.6 compte moins que le coût sous-jacent par token. DataFloq décrit la tarification 2 $/6 $ d’Alibaba comme « nettement moins chère » que le tarif catalogue de l’un ou l’autre concurrent occidental, ce qui est le levier qu’actionne Alibaba : non pas une revendication de capacité, mais une revendication économique. Dans une démonstration citée par DataFloq, le modèle a exécuté de manière autonome un projet d’ingénierie logicielle s’étalant sur 16 jours, construisant un framework d’agent open source appelé oh-my-cli, sans échouer totalement la tâche — preuve qu’un raisonnement « suffisamment bon » soutenu sur un long horizon peut se substituer à une intelligence de pointe par requête pour de nombreuses charges de production.
C’est également la première fois que Qwen prévoit d’ouvrir les poids d’un modèle phare de catégorie Max. Alibaba s’est engagée à publier les poids sur Hugging Face et ModelScope dans la semaine suivant l’annonce du 3 août, aux côtés d’un modèle compagnon plus petit, Qwen3.8-27B, que DataFloq décrit comme « la voie de déploiement sur site réaliste » pour les organisations qui ne peuvent pas ou ne veulent pas envoyer leurs données à une API tierce. Ouvrir les poids d’un modèle de cette envergure — plutôt que de le maintenir derrière une API fermée, comme le font OpenAI et Anthropic avec leurs modèles phares — est un levier délibéré : cela permet aux gouvernements, universités et entreprises soumises à des exigences de souveraineté des données de faire fonctionner un modèle de pointe sur une infrastructure qu’ils contrôlent, plutôt que de confier des requêtes sensibles à un fournisseur cloud étranger. Cette distinction est susceptible d’importer davantage aux acheteurs réglementés — banques, systèmes de santé, agences gouvernementales — qu’un point de précision supplémentaire sur un classement de raisonnement, car pour ces acheteurs, la contrainte déterminante est souvent d’ordre juridique, non technique.
Publicité
Pourquoi l’écart de prix est le véritable signal
La structure de coûts d’Alibaba ne fonctionne que grâce à l’architecture à mélange d’experts : activer 95 des 2,4 billions de paramètres par token signifie que l’entreprise paie une fraction du calcul d’inférence qu’exigerait un modèle dense de taille équivalente. Cette efficacité est ensuite répercutée sur les clients sous forme de prix — et c’est le prix, plus que le tableau des benchmarks, qui est susceptible de faire pencher les décisions d’achat des entreprises dans les marchés où l’accès aux GPU et les factures d’API en dollars constituent la contrainte déterminante, non la qualité de raisonnement marginale.
Ce que cela signifie pour les acheteurs d’IA en entreprise
1. Recalculez votre modèle de coût de charge de travail avant de renouveler un contrat API
Si votre organisation exécute des charges de travail IA à fort volume et faible complexité — tri des tickets de support, résumé de documents, première relecture de code — l’écart de prix entre 6 $/million de tokens en sortie et le tarif catalogue d’un modèle occidental de pointe peut faire la différence entre une fonctionnalité IA rentable ou subventionnée. Modélisez le volume de tokens réel de votre charge de production par rapport à la tarification publiée de Qwen3.8-Max avant de supposer que le fournisseur en place reste le choix économique.
2. Distinguez les tâches « critiques en capacité » des tâches « critiques en volume »
L’écart sur SWE-bench Pro (67,7 contre 80,0 pour Claude) signifie que Qwen3.8-Max n’est pas un choix par défaut sûr pour vos tâches de codage ou de raisonnement les plus exigeantes. Orientez le travail complexe et à fort enjeu vers un modèle plus performant, et réservez Qwen3.8-Max — ou son équivalent à poids ouverts — à la part à fort volume et faible complexité de votre chaîne, là où les économies de coût s’accumulent.
3. Évaluez la publication à poids ouverts pour vos exigences de souveraineté des données
Une fois les poids disponibles sur Hugging Face et ModelScope, toute organisation soumise à une exigence réglementaire ou contractuelle de conserver l’inférence sur une infrastructure domestique obtient une option de pointe qui n’existe pas aujourd’hui chez OpenAI ou Anthropic, tous deux limitant leurs modèles phares à l’API. Il s’agit d’une option significative pour les secteurs réglementés et les acheteurs publics jusqu’ici écartés des capacités de pointe par les règles de résidence des données.
4. Considérez la démonstration de codage autonome de 16 jours comme un signal de capacité, non une garantie
Une seule démonstration réussie sur un long horizon prouve que le modèle peut soutenir une tâche agentique pluri-journalière, pas qu’il le fera de manière fiable dans votre environnement. Pilotez les charges de travail agentiques sur une tâche limitée et à faible risque avant d’étendre l’autonomie aux systèmes de production.
La vue d’ensemble
Qwen3.8-Max ne cherche pas à dominer le classement des benchmarks — les propres chiffres d’Alibaba concèdent des deuxième et cinquième places en classement d’arène. Ce qu’il cherche à faire, c’est comprimer le prix de l’IA « suffisamment bonne » au point où le choix entre un fournisseur de modèle chinois et occidental cesse de porter sur la capacité pour porter sur le coût, le contrôle du déploiement et la souveraineté des données. Pour les entreprises situées hors de l’écosystème des laboratoires de pointe américains — y compris sur des marchés où les dépenses d’API en dollars constituent une contrainte réelle — ce recadrage compte davantage qu’un point de pourcentage supplémentaire sur GPQA Diamond.
Questions Fréquemment Posées
Qu’est-ce que Qwen3.8-Max et en quoi diffère-t-il des autres modèles IA d’Alibaba ?
Qwen3.8-Max est le modèle IA le plus vaste et le plus performant d’Alibaba à ce jour, publié le 3 août 2026, avec 2,4 billions de paramètres au total et environ 95 milliards actifs par requête via une architecture à mélange d’experts, selon DataFloq. C’est le premier modèle phare de catégorie Max de Qwen qu’Alibaba prévoit de publier à poids ouverts, aux côtés d’un modèle compagnon plus petit, Qwen3.8-27B.
Comment la tarification de Qwen3.8-Max se compare-t-elle à GPT et Claude ?
Alibaba facture 2 $ par million de tokens en entrée et 6 $ par million de tokens en sortie, avec une mise en cache descendant jusqu’à 0,25 $ par million, selon MarkTechPost. L’analyse de DataFloq décrit cela comme « nettement moins cher que Claude et GPT-5.6 », bien que Qwen3.8-Max accuse également un retard face à Claude sur des benchmarks exigeants comme SWE-bench Pro (67,7 contre 80,0).
Les entreprises peuvent-elles exécuter Qwen3.8-Max sur leur propre infrastructure ?
Pas encore à l’échelle du modèle phare — Alibaba a promis de publier les poids de Qwen3.8-Max sur Hugging Face et ModelScope dans la semaine suivant l’annonce du 3 août 2026, aux côtés du modèle plus petit Qwen3.8-27B, que DataFloq décrit comme « la voie de déploiement sur site réaliste » pour la plupart des organisations, compte tenu des exigences de calcul du modèle complet de 2,4 billions de paramètres.














