OpenAI a lancé mardi GPT-Live, une nouvelle génération de modèles voix capables d’écouter et de parler simultanément. Le modèle décide plusieurs fois par seconde s’il continue de parler, laisse le silence, gère une interruption ou délègue une question complexe à GPT-5.5 en arrière-plan. Le rollout est global et immédiat, avec deux paliers, GPT-Live-1 côté payant et GPT-Live-1 mini côté gratuit.
Pour résumer
- GPT-Live introduit une voix full-duplex qui écoute et parle en même temps, avec arbitrage temps réel
- Les questions lourdes sont déléguées à GPT-5.5 en tâche de fond, sans casser le fil de la conversation
- GPT-Live-1 est réservé aux comptes payants, GPT-Live-1 mini remplace Advanced Voice Mode par défaut sur le plan gratuit
Faire résumer cet article par une IA
ChatGPTUne architecture voix qui n’attend plus son tour
Jusqu’ici, la voix de ChatGPT fonctionnait comme un talkie-walkie amélioré. L’utilisateur parlait, le modèle attendait le silence, puis répondait. GPT-Live rompt cette logique. Le modèle écoute et parle dans le même flux, avec une prise de décision permanente sur l’action à mener.
OpenAI a détaillé le fonctionnement dans son annonce publiée mardi. Plusieurs fois par seconde, le modèle arbitre entre cinq états : parler, écouter, marquer une pause, gérer une interruption de l’utilisateur ou déclencher un appel d’outil. Cet arbitrage n’est pas scripté, il est piloté par le modèle lui-même en fonction du contexte sonore et sémantique de la conversation.
La conséquence pratique est immédiate. Si l’utilisateur reprend la parole au milieu d’une phrase du modèle, celui-ci s’arrête, réajuste, et repart sur ce qui vient d’être dit. Si l’utilisateur hésite ou soupire, le modèle peut choisir de laisser le silence plutôt que de couper. Le rythme d’une conversation orale, avec ses relances, ses reprises et ses pauses, devient techniquement accessible à un système synthétique.
Ce basculement s’inscrit dans un continuum que nous avions documenté la semaine dernière avec l’accélération de 25 % annoncée sur les agents vocaux OpenAI. La brique latence était traitée. GPT-Live traite maintenant la brique dialogue, celle du tour de parole.
La délégation silencieuse à GPT-5.5
Le point technique le plus notable ne concerne pas la voix elle-même, mais la façon dont GPT-Live gère les questions qui dépassent ses propres capacités de raisonnement rapide. Une conversation orale naturelle mélange en permanence des relances légères, des confirmations, des reformulations et, parfois, des demandes qui exigent un vrai calcul.
GPT-Live délègue ces questions lourdes à GPT-5.5 en arrière-plan, sans casser le fil de la conversation vocale. Pendant que le modèle de raisonnement travaille, GPT-Live continue de tenir la parole, glisse une transition, prend note de la question, puis rapporte le résultat au moment où il devient disponible. L’utilisateur n’est jamais laissé face à un silence de traitement.
Ce pattern rappelle la logique de deux cerveaux qui coopèrent. Un cerveau conversationnel rapide, entraîné pour tenir la cadence orale, et un cerveau analytique lent, appelé uniquement quand c’est nécessaire. C’est ce partage des tâches qui rend crédible l’idée d’une voix IA capable de tenir dix minutes de conversation sans donner l’impression d’un chatbot déguisé.
Greg Brockman avait esquissé cette direction quelques semaines plus tôt, en parlant d’un futur où la voix remplace peu à peu les interfaces logicielles classiques. Nous avions traité cet angle dans une analyse sur la thèse de Brockman et la fin annoncée des interfaces logicielles. GPT-Live est le premier produit qui rend cette thèse tangible côté grand public.
À voir également sur Horizon :
- GPT-5.6 : OpenAI ouvre son déploiement mondial
- Sam Altman offre 5 % d’OpenAI à Trump
- Fable 5 : Anthropic bascule à la facturation au token
Rollout global et bascule côté marché
OpenAI a choisi un déploiement rapide et différencié. GPT-Live-1 est réservé aux abonnés ChatGPT payants. Il embarque la version complète du modèle, l’accès à la délégation GPT-5.5 en arrière-plan, et une palette de voix élargie. Il devient l’expérience voix par défaut sur les comptes payants, sans surcoût annoncé.
GPT-Live-1 mini remplace Advanced Voice Mode par défaut sur les comptes gratuits. La version mini garde le principe full-duplex et la gestion des interruptions, mais avec un modèle plus léger et une délégation en arrière-plan restreinte. C’est déjà un saut qualitatif par rapport à Advanced Voice Mode, qui restait sur un pattern tour de parole classique.
La bascule est effective immédiatement, sans opt-in progressif ni vague géographique. Un utilisateur qui ouvre l’application ChatGPT retrouve le nouveau mode voix dès la mise à jour serveur, sans manipulation. Cette forme de rollout, brutale et globale, cadre avec la stratégie récente d’OpenAI qui préfère imposer un standard nouveau plutôt que le proposer en A/B test.
La comparaison avec le camp Apple devient inévitable. Nous avions couvert l’arrivée d’une voix personnalisable dans iOS 27 côté Siri. La stratégie diffère radicalement, personnalisation locale et progressive chez Apple, généralisation immédiate chez OpenAI, mais le terrain de jeu est le même. La voix devient une couche d’interaction que chaque acteur veut occuper avant que l’utilisateur prenne l’habitude d’un concurrent.
À court terme, la promesse tient sur trois usages concrets. La conduite, où l’interruption naturelle change la nature du dialogue vocal. L’apprentissage d’une langue, où la gestion du silence est un pilier pédagogique. Et le support client, où déléguer une question complexe pendant que l’agent continue de parler est une capacité qui n’existait pas dans le stack voix classique.
À moyen terme, la question stratégique porte sur les fournisseurs de voice AI tiers qui vendaient précisément la gestion full-duplex comme argument différenciant. Si le modèle de base d’OpenAI intègre nativement ce comportement, la valeur des surcouches se déplace vers d’autres briques, la personnalisation, la sécurité, l’intégration métier.
Reste la question de l’usage réel. Un mode voix full-duplex n’a de valeur que si l’utilisateur le sollicite plusieurs fois par jour. La courbe d’adoption d’Advanced Voice Mode avait montré des limites côté rétention. GPT-Live va être testé sur ce point, plus que sur ses capacités techniques, dans les semaines qui viennent.
Affaire à suivre sur Horizon.


