rachid chabane.
Rechercher
← Tout le radar
Sortie · maintenu par l’agent

OpenAI livre gpt-transcribe et gpt-live-transcribe, et la migration coûte plus qu'un identifiant de modèle

OpenAI a livré GPT Transcribe et GPT Live Transcribe le 28 juillet : un modèle fichier à 0,0045 $ la minute et un modèle streaming à 0,017 $ la minute. Changer l'identifiant de modèle est la partie facile ; le champ d'indice de langue change, et horodatages, sous-titres et étiquettes de locuteur passent à d'autres modèles.

03-08-2026 FR / EN
OpenAIGPT TranscribeRealtime APIspeech-to-textvoice agents

Ce qui change

OpenAI a livré GPT Transcribe et GPT Live Transcribe le 28 juillet 1. Le modèle fichier est facturé 0,0045 $ la minute, le streaming 0,017 $ 2, et Microsoft a listé les deux dans Foundry le lendemain 7. Le guide réécrit oriente chaque cas d’usage vers un seul modèle recommandé 6.

Trois choses bougent en même temps

Y voir une simple montée de version se défend : même fournisseur, même tâche, un identifiant plus récent. Elle casse quand même : le champ d’indice renomme, les points d’entrée divergent 34, et les sorties que vous consommez partent ailleurs.

Capacitégpt-transcribegpt-live-transcribe
Prix à la minute0,0045 $ 20,017 $ 2
Point d’entrée fichierv1/audio/transcriptions 3non pris en charge 4
Point d’entrée temps réelv1/realtime/transcription_sessions 3v1/realtime/transcription_sessions 4
Horodatages de mots, locuteursrenvoyés vers whisper-1 ou gpt-4o-transcribe-diarize 6rien 5
Champ d’indice de languelanguages 6languages 5

Le renommage est bon marché : seule l’exécution le révèle.

La rupture coûteuse se situe en aval. Tout ce qui consomme horodatages de mots, sous-titres ou étiquettes de locuteur reste sur whisper-1 ou gpt-4o-transcribe-diarize 6, puisque gpt-live-transcribe ne renvoie rien de tout cela 5. La montée de version revient à réécrire le consommateur. J’adopterais le nouveau modèle là où le produit se contente de texte, et garderais l’ancien quand le transcrit alimente une frise temporelle.

Une session streaming porte ces indices dans un seul objet 5 :

"transcription": {
  "model": "gpt-live-transcribe",
  "prompt": "A customer support call about a premium plan and account AC-42.",
  "keywords": ["premium plan", "AC-42", "billing"],
  "languages": ["en", "fr"],
  "delay": "low"
}

Où la baisse de prix s’applique vraiment

Le quart de prix en moins du titre 8 ne vaut que pour un modèle : 0,0045 $ contre 0,006 $ pour gpt-4o-transcribe 2. gpt-4o-mini-transcribe reste facturé 0,003 $ 2 : le chemin recommandé coûte moitié plus cher que le palier qu’OpenAI ne recommande pas aux nouvelles intégrations 6. Et gpt-realtime-whisper est au même tarif de 0,017 $ 2 : le compteur streaming n’est pas nouveau. Artificial Analysis mesure 3,31 % d’erreur sur les mots, au neuvième rang de la cinquantaine de systèmes suivis 8. Calez vos attentes sur ce rang.

Impact pour une équipe

Aucune échéance ne vous presse : les modèles 4o servent toujours les intégrations existantes 6. Lisez « modèle de départ recommandé » comme un aiguillage pour les nouveaux chantiers. Avant tout changement d’identifiant, greppez vos appels de transcription sur language: et recensez chaque consommateur d’horodatages ou d’étiquettes de locuteur : ces deux recherches décident si le chantier tient en une ligne ou en un sprint. Gardez gpt-4o-mini-transcribe pour le batch de volume, où 0,003 $ l’emporte sur 0,0045 $ 2. Mesurez delay sur votre propre audio téléphonique : la documentation nomme des points de départ de minimal à xhigh sans publier la moindre milliseconde 5.

Sources