Grok 4.6 égale les meilleurs modèles à moitié prix

Grok 4.6 trône sur une chaise vide en tête d'un conseil d'administration tendu

SpaceXAI a mis Grok 4.6 en ligne mercredi et le modèle se hisse à égalité avec GPT-5.6 Sol Max sur l’index de référence du secteur. La grille tarifaire, elle, reste plus de 60 % en dessous de celle d’Anthropic et d’OpenAI. Le laboratoire de Musk vient de transformer la question du choix de modèle en question de facture.

Pour résumer

  • Grok 4.6 atteint 61 sur l’index Artificial Analysis, à égalité avec GPT-5.6 Sol Max
  • 2 dollars le million de tokens en entrée contre 5 chez Claude Opus 5 et GPT-5.6 Sol
  • Le modèle de base n’a pas grossi, les gains viennent entièrement du post-entraînement

Faire résumer cet article par une IA

ChatGPT

Un score de 61 qui met SpaceXAI au niveau de Sol Max

Grok 4.6 est sorti mercredi et son résultat au classement d’intelligence agrégé tient en un chiffre : 61. Le modèle dépasse Kimi K3, le poids lourd ouvert de Moonshot, et rejoint exactement GPT-5.6 Sol Max, ce qui n’était jamais arrivé à un modèle xAI depuis le lancement de la gamme.

Le classement complet, publié par le laboratoire indépendant qui compile l’index d’intelligence des modèles frontière, laisse toujours Claude Opus 5 en tête et Fable 5 juste derrière. Anthropic conserve donc les deux premières marches, mais l’écart avec le troisième vient de se refermer.

Sur GDPval-AA v2, la mesure qui tente d’évaluer du vrai travail de connaissance sur un ordinateur, Grok 4.6 se classe deuxième avec un Elo de 1 753. Là encore, seul Claude Opus 5 passe devant. Cette deuxième place compte davantage que le score agrégé pour les équipes qui achètent de la capacité d’exécution, pas des points de benchmark.

Le détail technique de cette sortie est le plus parlant. SpaceXAI n’a pas agrandi son modèle de base : les gains passent intégralement par le post-entraînement. La génération précédente avait déjà tenté ce coup avec une version 4.5 positionnée au tiers du prix de Claude Opus, sans atteindre le niveau du top 3.

Un an plus tôt, le même saut aurait exigé un nouveau socle et une campagne d’entraînement complète. Le fait qu’un ajustement post-entraînement suffise à combler quinze places de classement dit quelque chose de l’état réel de la course : le scale brut n’est plus le seul levier disponible.


Grok 4.6

Deux dollars le million de tokens, la vraie rupture

Sous 200 000 tokens de prompt, Grok 4.6 est facturé 2 dollars le million en entrée, 50 centimes sur l’entrée mise en cache et 6 dollars le million en sortie. Au-delà de ce seuil, la grille double mécaniquement et passe à 4, 1 et 12 dollars.

La comparaison est brutale. Claude Opus 5 facture 5 dollars en entrée et 25 en sortie, GPT-5.6 Sol demande 5 et 30. À qualité annoncée équivalente, l’écart dépasse 60 % sur la sortie, qui est précisément le poste qui explose sur les charges agentiques.

Ce seuil de 200 000 tokens mérite qu’on s’y arrête, parce que le prix affiché n’est pas toujours celui qui sera payé. Une session agentique qui accumule un dépôt, des journaux d’exécution et plusieurs allers-retours de tests franchit la barre sans prévenir, et bascule alors sur la grille haute.

Même à 4 dollars en entrée et 12 en sortie, le modèle reste toutefois sous les tarifs d’entrée de gamme de ses deux concurrents directs. L’écart se resserre sur les contextes longs, il ne s’inverse jamais.

Pour les équipes produit, l’arbitrage se déplace. Un agent qui tourne pendant des heures sur un dépôt inconnu génère des dizaines de millions de tokens par semaine, et c’est cette ligne de coût qui décide aujourd’hui si un cas d’usage part en production ou reste en démonstration interne.

SpaceXAI met par ailleurs le modèle partout à la fois. Grok Build l’ouvre à partir du plan SuperGrok à 30 dollars par mois, Cursor l’intègre côté éditeur, et OpenRouter, Vercel et Cloudflare le relaient côté infrastructure. L’entité qui pousse ce déploiement est la même que celle qui avance sur un terminal grand public dont Musk a démenti l’existence en juillet.

Le positionnement produit assumé par le laboratoire vise les agents à horizon long, le code et les projets visuels lourds. SpaceXAI met en avant la capacité du modèle à tenir sur de nombreuses étapes, à naviguer dans une base de code inconnue et à tester sa propre sortie avant de continuer.


D’autres articles sur Horizon


Ce que la facture divisée par deux impose aux autres labos

Anthropic garde la tête sur la qualité pure, avec deux modèles au-dessus de Grok 4.6. Mais l’argument commercial se fissure : justifier un prix multiplié par deux et demi devient difficile quand le troisième du classement exécute correctement les mêmes charges de travail.

OpenAI se retrouve dans la position la plus inconfortable. GPT-5.6 Sol Max est désormais rattrapé sur le score et distancé sur le prix, ce qui laisse peu d’options : baisser la grille, différencier par les outils autour du modèle, ou accélérer la sortie suivante.

Le coût de sortie d’un fournisseur joue aussi en faveur de SpaceXAI. Passer un agent d’un modèle à l’autre depuis Cursor ou depuis un routeur d’API se teste en une après-midi, sans engagement, ce qui rend la comparaison beaucoup plus facile à mener pour une équipe qui hésite.

Côté chinois, le message est symétrique. Kimi K3 avait construit sa réputation sur le rapport performance-prix, et voir un modèle américain passer devant sur l’index tout en restant agressif sur la facture retire à Moonshot son principal argument d’adoption hors de Chine.

Reste la variable que les benchmarks ne mesurent pas. Le laboratoire de Musk traîne des questions ouvertes sur ses pratiques internes, dont la plainte déposée en juin par un ingénieur sécurité qui affirme avoir été écarté après ses alertes. Les directions techniques qui signent un contrat pluriannuel intègrent ce paramètre au même titre que le prix.

La réaction attendue dans les prochaines semaines tient en deux mouvements possibles : un ajustement tarifaire chez OpenAI sur le palier Sol, ou une réponse produit d’Anthropic qui déplacerait le débat des tokens vers l’outillage agentique. Le statu quo, lui, n’est plus tenable pour personne.

Affaire à suivre sur Horizon.

Comments

No comments yet. Why don’t you start the discussion?

    Laisser un commentaire

    Votre adresse e-mail ne sera pas publiée. Les champs obligatoires sont indiqués avec *