DeepSeek a publié le 31 juillet une nouvelle version de son modèle économique, DeepSeek V4 Flash « 0731 », qui grimpe à 50 points sur l’Intelligence Index d’Artificial Analysis, à un souffle des 51 de GPT-5.6 Luna. Le tout en open weights sous licence MIT, et à une tâche facturée environ 60 % moins cher que le modèle d’entrée d’OpenAI. Le rapport capacité sur prix vient encore de basculer.
Pour résumer
- DeepSeek V4 Flash « 0731 » passe de 40 à 50 sur l’Intelligence Index, contre 51 pour GPT-5.6 Luna.
- Poids ouverts sous licence MIT, 284 milliards de paramètres au total dont 13 activés, fenêtre d’un million de tokens.
- Une tâche coûte environ 60 % de moins que sur GPT-5.6 Luna, avec une remise de cache poussée à 98 %.
Faire résumer cet article par une IA
ChatGPTUn modèle d’entrée qui rattrape le haut du panier
Il ne s’agit pas d’une nouvelle architecture, mais d’un ré-entraînement. DeepSeek a repris son V4 Flash existant et l’a repost-entraîné, en gardant les 284 milliards de paramètres au total et les 13 milliards activés. Les poids publiés sur Hugging Face sous licence MIT confirment une fenêtre de contexte d’un million de tokens, inchangée.
Le saut se lit dans les chiffres. Sur l’Intelligence Index d’Artificial Analysis, l’agrégat de référence pour comparer les modèles, la note passe de 40 à 50. GPT-5.6 Luna, le modèle le moins cher de la gamme d’OpenAI, plafonne à 51. L’écart entre un poids ouvert chinois et le modèle d’entrée du leader américain se réduit à un point.
Le gain le plus net tombe côté agentique. Sur GDPval, le benchmark qui mesure la capacité d’un modèle à enchaîner des tâches professionnelles réelles, le score bondit de 1 189 à 1 559 points Elo. DeepSeek revendique aussi une baisse du taux d’hallucination et des progrès homogènes sur toutes les catégories testées, pas un pic isolé sur une métrique.
Pour les équipes qui construisent des agents, ce point-là compte plus que la note globale. Un modèle bon marché qui décroche sur les tâches multi-étapes reste inutilisable en production. Un modèle bon marché qui tient la distance sur GDPval devient un candidat crédible pour remplacer un modèle propriétaire trois fois plus cher.
Le prix comme véritable arme
Le vrai levier n’est pas le benchmark, c’est la facture. DeepSeek chiffre une tâche à environ 60 % de moins que la même tâche sur GPT-5.6 Luna, et ce après la baisse de 80 % qu’OpenAI vient d’appliquer. La gamme GPT-5.6 avait pourtant déjà cassé son prix d’entrée à 0,20 dollar par million de tokens, et DeepSeek passe encore dessous.
Un second levier amplifie l’effet. La remise sur le cache monte à 98 %, quand le standard du marché tourne autour de 90 %. Pour un usage qui rappelle souvent le même contexte, un assistant sur base documentaire, un agent qui relit les mêmes fichiers, la part cachée des tokens devient quasi gratuite.
La nouvelle version consomme en plus 12 % de tokens de moins que la précédente pour un résultat équivalent. Moins de tokens émis, un cache presque offert, un prix unitaire déjà plancher : les trois se cumulent. Sur un volume industriel, l’écart de coût avec un modèle propriétaire cesse d’être une ligne comptable pour devenir un argument d’architecture.
Cette bascule prolonge une tendance déjà nette. Anthropic avait joué la même carte quand Claude Opus 5 est venu rivaliser avec le sommet du marché à moitié prix. La différence, cette fois, c’est que le tarif casseur vient d’un modèle dont tout le monde peut télécharger les poids.
D’autres articles sur Horizon
- GPT-5.6 Luna : OpenAI casse son prix de 80 %
- Gemini Robotics ER 2 fait collaborer plusieurs robots
- Claude Mythos 5 : Anthropic admet trois intrusions réelles
Ce que l’open weight MIT impose aux concurrents
La licence MIT est le point qui déplace le débat. Elle autorise l’usage commercial sans contrepartie, y compris l’auto-hébergement. Une entreprise qui refuse d’envoyer ses données vers une API tierce peut faire tourner DeepSeek V4 Flash sur son propre matériel, avec une qualité désormais proche du modèle d’entrée d’OpenAI.
Le calendrier n’aide pas les labs occidentaux. La pression open weights venue de Chine ne faiblit pas, comme l’a montré Kimi K3 en publiant 1,4 To de poids gratuits. Chaque sortie de ce type rogne un peu plus l’argument de la performance exclusive côté propriétaire.
Le sujet remonte jusque dans la stratégie des grands labs. La question de savoir s’il faut ouvrir ou verrouiller ses modèles est désormais frontale, au point qu’Anthropic a dû clarifier publiquement sa position sur les poids ouverts. Tenir un modèle fermé se justifie de moins en moins par la seule avance technique.
Côté concurrence, la réponse attendue est mécanique. OpenAI a déjà baissé, Anthropic aussi, et un poids ouvert qui talonne Luna à 60 % de moins relance le tour de table. Le prochain lab qui sort un modèle d’entrée devra se positionner non plus contre un concurrent propriétaire, mais contre un modèle gratuit à télécharger.
Reste la limite habituelle. Un point d’écart sur un index agrégé ne dit rien des cas d’usage précis où Luna garde l’avantage, ni de la vitesse d’inférence réelle selon le matériel. Mais pour un décideur qui arbitre un budget d’API, la trajectoire est sans ambiguïté : la qualité descend vers le gratuit plus vite que le prix des modèles fermés ne baisse.
Affaire à suivre sur Horizon.


