xAI a lancé Grok 4.5 mercredi 8 juillet 2026, premier modèle Musk pensé pour le coding et les tâches agentic. Le modèle rivalise avec Claude Opus 4.7 sur les benchmarks annoncés, à un tarif de 2 dollars par million de tokens en entrée et 6 dollars en sortie, avec une consommation environ quatre fois moindre en tokens de sortie sur les tâches complexes. Le lancement précède d’une journée le rollout mondial de GPT-5.6 et redistribue les cartes du segment coding pro.
Pour résumer
- xAI a sorti Grok 4.5 le 8 juillet 2026, premier modèle Musk purpose-built pour le coding et les tâches agentic.
- Pricing 2 dollars entrée et 6 dollars sortie par million de tokens, plus de 60 % moins cher qu’Opus 4.8 et GPT-5.5.
- Benchmarks mitigés : Grok 4.5 bat Opus 4.8 sur DeepSWE 1.0 et Terminal-Bench 2.1, perd sur DeepSWE 1.1 et SWE-Bench Pro. Score 54, 4e sur l’Intelligence Index.
Faire résumer cet article par une IA
ChatGPTUn modèle pensé pour le coding et les agents
Grok 4.5 est le premier modèle xAI explicitement conçu pour le coding et les workflows agentic. Les précédentes versions de Grok visaient un chatbot généraliste calibré pour l’écosystème X. Cette fois, Musk a annoncé un pivot d’axe assumé : rester compétitif sur les usages de code long, itératifs, avec appels d’outils, là où la stack d’entreprise s’est installée.
Dans la note de lancement, Musk a positionné Grok 4.5 comme un modèle « Opus-class », puis a précisé la comparaison en anglais : « roughly comparable to Opus 4.7, but much faster ». La formule vise directement Anthropic, dont Claude Opus reste la référence coding haut de gamme depuis un an, aux côtés d’un stack outillé pour les agents autonomes.
Le classement Artificial Analysis Intelligence Index confirme un placement solide. Grok 4.5 arrive 4e avec un score de 54, devant tous les Gemini et tous les modèles open-weight aujourd’hui accessibles. Ce résultat suffit à replacer xAI dans le peloton de tête, un an après que la marque avait glissé derrière Anthropic et Google sur le segment pro.
Le tournant agentic mérite une ligne à part. La couche d’orchestration multi-outils est devenue le vrai différenciateur applicatif, comme nous l’avions détaillé dans notre analyse des agents IA plus lents que prévu chez Meta. Musk a chiffré Grok 4.5 sur ce même terrain, en insistant sur la latence et le coût par appel plutôt que sur la qualité brute d’une réponse isolée.
Autre inflexion notable : Grok 4.5 arrive sans nouvelle version grand public de la marque. Les efforts précédents de xAI cherchaient à muscler l’expérience conversationnelle sur X. Ici, la cible assumée est l’API et les intégrations professionnelles, avec un déploiement direct sur les grands hyperscalers pour les workloads coding lourds.
Un verdict benchmark mitigé, un coup fort sur les tokens
Le tableau de bord des benchmarks livre un signal en demi-teinte sur la performance pure. Grok 4.5 devance Opus 4.8 sur DeepSWE 1.0 avec 62 % de résolution contre 55,75 %, et sur Terminal-Bench 2.1. Mais Opus 4.8 reste devant sur DeepSWE 1.1 avec 59 % contre 53 %, et sur SWE-Bench Pro avec un taux de résolution de 69,2 % contre 64,7 %.
La lecture directe est simple : sur les benchmarks les plus récents et les plus exigeants, Anthropic garde une longueur d’avance. xAI ne prétend pas au premier rôle sur le taux de résolution absolu. La marque a construit son argumentaire sur un second axe, plus intéressant à examiner : la quantité de tokens consommée pour résoudre une tâche donnée.
Sur l’Intelligence Index, Grok 4.5 mobilise en moyenne 14 000 tokens de sortie par tâche, contre 67 020 pour Opus 4.8 sur le même exercice. Sur SWE-Bench Pro, le rapport tient : xAI estime la consommation moyenne à environ 15 954 tokens par tâche, quand Opus 4.8 en mode max-effort consomme les mêmes 67 020 tokens déjà cités.
Ce que ça change concrètement sur la facture : pour une tâche coding équivalente, la facturation Anthropic peut basculer autour de quatre fois celle de xAI, à taux de résolution proche. Le raisonnement rejoint la bascule tarifaire opérée par Anthropic la semaine dernière et documentée dans le passage de Fable 5 à une facturation au token pur, où la charge par appel est devenue la variable d’ajustement centrale des équipes intégratrices.
Cette efficience tokenaire déplace toute la conversation. Les benchmarks classiques mesurent le taux de résolution, pas le coût unitaire de cette résolution. Musk a mis en avant cette dissociation, et la manière dont le score absolu Opus se paye dès qu’on empile plusieurs milliers de requêtes agentic quotidiennes en production.
Le pricing Grok 4.5 s’établit à 2 dollars par million de tokens en entrée et 6 dollars par million en sortie. À taux de résolution équivalent, l’économie sur une charge de plusieurs milliards de tokens mensuels devient l’argument central pour un DSI qui arbitre entre performance haut de gamme et coût de fonctionnement de son stack coding.
À voir également sur Horizon :
- Test GPT-5.6 : nous jugeons Sol, Terra et Luna
- GPT-Live : ChatGPT écoute et parle en même temps
- GPT-5.6 : OpenAI ouvre son déploiement mondial
Impact utilisateurs et concurrence : les cartes redistribuées
Côté utilisateurs pros, la fenêtre s’ouvre pour les équipes qui produisent des workloads coding volumineux. Ateliers d’ingénierie logicielle qui pipelinent des tests, des refactorings, des générations de docstrings, ou plateformes qui livrent du code assisté sur mesure : ces charges consomment des tokens en masse. Une bascule Opus 4.8 vers Grok 4.5, à qualité comparable sur DeepSWE 1.0, allège la facture mensuelle de manière significative. Nous avons vérifié la promesse sur le terrain, notre test complet de Grok 4.5.
L’arbitrage devient un vrai choix produit. Une équipe qui vise la haute qualité sur les tâches rares mais critiques restera sur Opus 4.8 pour les cas où la marge sur SWE-Bench Pro se paye. Une équipe qui absorbe un flux dense d’itérations coding automatisées pourra basculer sur Grok 4.5 sans perte majeure sur la moyenne des tâches, avec un gain cash à la clé.
Côté concurrence, Anthropic assume la position premium sur le taux de résolution absolu, mais perd le différenciateur budget-friendly qu’elle occupait entre GPT-5.5 et les modèles open-weight. OpenAI voit son mid-tier GPT-5.5 dans Codex directement challengé : Musk revendique un coût par tâche moitié moindre que GPT-5.5 dans le même Codex. Google prend un tour de plus, avec des Gemini repoussés derrière Grok 4.5 dans l’Intelligence Index.
Le calendrier resserré est notable. Grok 4.5 est sorti le 8 juillet, la veille du rollout mondial de GPT-5.6 documenté dans notre couverture du déploiement mondial de GPT-5.6 par OpenAI. La bascule Sol, Terra et Luna arrive à un moment où le nouveau standard budget est déjà posé par xAI. La comparaison directe GPT-5.6 Terra à 2,50 dollars entrée et 15 dollars sortie face à Grok 4.5 à 2 et 6 dollars, à performances déclarées comparables, va peser sur les prochaines migrations d’API.
La prochaine réaction concurrentielle se lira sur les prochaines semaines. Anthropic devra choisir entre défendre sa marge premium sur Opus 4.8 ou aligner un modèle intermédiaire calibré sur la même logique coût. OpenAI va probablement mettre en avant sa suite outillée avec les nouveaux workspace agents, plutôt que d’entrer dans une guerre de tarifs sur GPT-5.6 Luna. Le mid-tier LLM devient le vrai front de bataille du troisième trimestre 2026.
Affaire à suivre sur Horizon.


