Qwen3.8-Flash-Next divise les prix par douze

Qwen3.8-Flash-Next étiquette un prix plancher sur un rack de serveurs Alibaba

Alibaba publie Qwen3.8-Flash-Next, un modèle multimodal à mélange d’experts qui active 6 milliards de paramètres sur 125 au total. Le tarif tombe à 0,16 dollar le million de tokens en entrée, environ douze fois moins que le flagship Qwen3.8-Max. L’équipe présente ce modèle comme un aperçu de l’architecture Qwen4.

Pour résumer

  • Qwen3.8-Flash-Next compte 125 milliards de paramètres dont 6 activés par token, avec un contexte natif de 262 144 tokens extensible à 1 million via YaRN.
  • Le prix descend à 0,16 dollar le million de tokens en entrée et 0,47 en sortie, douze fois sous Qwen3.8-Max.
  • Les benchmarks publiés le placent devant DeepSeek-V4-Flash et Claude Opus 4.6 sur la plupart des tâches de code et de bureautique.

Faire résumer cet article par une IA

ChatGPT

Une architecture qui déborde du GPU

La sortie est officialisée par le billet technique publié par l’équipe Qwen pour détailler le modèle. Qwen3.8-Flash-Next est un mélange d’experts multimodal de 125 milliards de paramètres qui n’en active que 6 milliards par token, un ratio pensé pour l’inférence à bas coût.

La singularité se loge dans une couche d’embeddings inhabituelle. Le modèle embarque une table de n-grams de 51 milliards de paramètres qui tourne sur la RAM système au lieu de la mémoire GPU, ce qui déplace une partie du coût matériel vers un composant beaucoup moins cher.

L’attention a aussi été retravaillée. Le duo Gated DeltaNet et Gated Attention des générations précédentes laisse place à un couple Gated DeltaNet et QSA, pour Qwen Sparse Attention, qui sélectionne des micro-blocs de contexte plutôt que des tokens individuels.

Le contexte suit la même logique d’extension. La fenêtre native atteint 262 144 tokens et grimpe jusqu’à 1 million via YaRN, de quoi charger des bases de code entières ou des dossiers documentaires lourds sans découpage préalable.

Le raisonnement reste débrayable. Qwen3.8-Flash-Next fonctionne en mode hybride, avec des réglages distincts pour la réflexion et la réponse directe, pilotés par les paramètres enable_thinking, preserve_thinking et reasoning_effort exposés aux développeurs.

L’équipe insiste enfin sur l’efficacité amont. L’entraînement aurait coûté environ un neuvième de celui de Qwen3.7-Plus pour de meilleurs résultats, dans la lignée d’une famille dont le flagship Qwen 3.8 présenté cet été comme le plus gros modèle du groupe occupait déjà le haut du panier.

La cadence de la gamme mérite d’être notée. En quelques semaines, Alibaba a enchaîné son flagship, une déclinaison 27B passée en licence Apache 2.0 et désormais cet aperçu de la génération suivante, un rythme de publication que peu de laboratoires soutiennent aujourd’hui.


Qwen3.8-Flash-Next

Des benchmarks qui bousculent la hiérarchie

Sur le code, les scores publiés placent le modèle très haut pour sa catégorie de prix. Qwen3.8-Flash-Next affiche 58,7 sur DeepSWE 1.1 et 62,5 sur SWE-bench Pro, deux références centrées sur la résolution de tickets réels dans des dépôts existants.

La bureautique agentique suit. Le modèle atteint 73,9 sur CoWorkBench et 55,7 sur JobBench, des évaluations qui mesurent l’exécution de tâches de bureau de bout en bout, et grimpe à 91,7 sur GPQA Diamond côté raisonnement scientifique.

La comparaison mise en avant vise directement la concurrence. Les chiffres donnent l’avantage à Qwen3.8-Flash-Next face à DeepSeek-V4-Flash-Vision, que nous avons vu talonner Opus 4.8 la semaine dernière, et face à Claude Opus 4.6 sur la plupart des tâches testées.

Une réserve d’usage s’impose. Ces scores proviennent de l’éditeur lui-même, et l’écart entre benchmarks déclarés et comportement en production reste la règle plutôt que l’exception dans les publications de modèles. Les évaluations tierces des prochains jours feront foi.

Le prix, lui, ne souffre aucune ambiguïté. L’entrée est facturée 0,16 dollar le million de tokens et la sortie 0,47 dollar, environ douze fois moins que Qwen3.8-Max. À ce niveau, le modèle s’installe dans la zone tarifaire des petits modèles tout en revendiquant des capacités de flagship.


D’autres articles sur Horizon


Un prix plancher qui met la pression sur tout le monde

Pour les équipes techniques, l’accès est immédiat sur la partie poids ouverts. Les fichiers sont disponibles sur Hugging Face et ModelScope, accompagnés d’un rapport technique sur GitHub, et la version de production arrivera sous peu via l’API QwenCloud.

L’écosystème a réagi dans la journée. Des quantisations communautaires au format GGUF circulent déjà et les recettes de déploiement vLLM sont publiées, signe d’une adoption locale qui démarre sans attendre l’ouverture de l’API officielle.

Le déport de la table d’embeddings vers la RAM change le calcul d’infrastructure. Une partie du modèle échappe à la mémoire GPU, le composant le plus rare et le plus cher du marché, ce qui abaisse le ticket d’entrée pour servir le modèle en interne.

Le contexte à 1 million de tokens ouvre des cas d’usage que la tarification rendait jusqu’ici dissuasifs. Analyser un dépôt complet, un corpus contractuel ou des mois d’historique client devient une opération à quelques centimes plutôt qu’à plusieurs dollars.

Ramené à des termes concrets, le tarif transforme le contexte long en monnaie de poche. Charger la fenêtre native complète de 262 144 tokens revient à environ quatre centimes au prix d’entrée affiché, de quoi banaliser l’analyse d’un dépôt entier.

Les workflows d’agents sont les premiers servis. La facture de ces usages se joue surtout sur les tokens produits, et à 0,47 dollar le million en sortie, une session d’agent qui génère plusieurs centaines de milliers de tokens se règle en dizaines de centimes plutôt qu’en dollars.

Côté concurrence, la pression tarifaire vise d’abord les compatriotes. DeepSeek a construit sa percée sur le rapport qualité-prix, et voit un rival local revendiquer mieux pour moins cher. La vague des modèles ouverts chinois, déjà illustrée par MiniMax M3, qui bousculait GPT-5.5 au printemps, gagne un nouveau représentant agressif.

Les laboratoires américains sont touchés par ricochet. Un modèle ouvert qui revendique le niveau d’Opus 4.6 pour une fraction du prix resserre l’espace de justification des abonnements premium, en particulier sur les usages de code où la substitution est la plus simple.

La lecture stratégique se dessine en creux. Alibaba installe une gamme à deux vitesses, un Max en vitrine de performance et un Flash qui porte l’argument commercial face aux API américaines.

Reste la question que le nom du modèle pose ouvertement. Si Qwen3.8-Flash-Next est bien l’avant-goût de l’architecture Qwen4, la génération suivante appliquera ces choix techniques à une échelle supérieure, et la fenêtre de riposte des concurrents se compte en mois.

Affaire à suivre sur Horizon.

Comments

No comments yet. Why don’t you start the discussion?

    Laisser un commentaire

    Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *