Ce qui change
OpenAI a livré GPT Transcribe et GPT Live Transcribe le 28 juillet 1. Le modèle fichier est facturé 0,0045 $ la minute, le streaming 0,017 $ 2, et Microsoft a listé les deux dans Foundry le lendemain 7. Le guide réécrit oriente chaque cas d’usage vers un seul modèle recommandé 6.
Trois choses bougent en même temps
Y voir une simple montée de version se défend : même fournisseur, même tâche, un identifiant plus récent. Elle casse quand même : le champ d’indice renomme, les points d’entrée divergent 34, et les sorties que vous consommez partent ailleurs.
| Capacité | gpt-transcribe | gpt-live-transcribe |
|---|---|---|
| Prix à la minute | 0,0045 $ 2 | 0,017 $ 2 |
| Point d’entrée fichier | v1/audio/transcriptions 3 | non pris en charge 4 |
| Point d’entrée temps réel | v1/realtime/transcription_sessions 3 | v1/realtime/transcription_sessions 4 |
| Horodatages de mots, locuteurs | renvoyés vers whisper-1 ou gpt-4o-transcribe-diarize 6 | rien 5 |
| Champ d’indice de langue | languages 6 | languages 5 |
Le renommage est bon marché : seule l’exécution le révèle.
La rupture coûteuse se situe en aval. Tout ce qui consomme horodatages de mots, sous-titres ou étiquettes de locuteur reste sur whisper-1 ou gpt-4o-transcribe-diarize 6, puisque gpt-live-transcribe ne renvoie rien de tout cela 5. La montée de version revient à réécrire le consommateur. J’adopterais le nouveau modèle là où le produit se contente de texte, et garderais l’ancien quand le transcrit alimente une frise temporelle.
Une session streaming porte ces indices dans un seul objet 5 :
"transcription": {
"model": "gpt-live-transcribe",
"prompt": "A customer support call about a premium plan and account AC-42.",
"keywords": ["premium plan", "AC-42", "billing"],
"languages": ["en", "fr"],
"delay": "low"
}
Où la baisse de prix s’applique vraiment
Le quart de prix en moins du titre 8 ne vaut que pour un modèle : 0,0045 $ contre 0,006 $ pour gpt-4o-transcribe 2. gpt-4o-mini-transcribe reste facturé 0,003 $ 2 : le chemin recommandé coûte moitié plus cher que le palier qu’OpenAI ne recommande pas aux nouvelles intégrations 6. Et gpt-realtime-whisper est au même tarif de 0,017 $ 2 : le compteur streaming n’est pas nouveau. Artificial Analysis mesure 3,31 % d’erreur sur les mots, au neuvième rang de la cinquantaine de systèmes suivis 8. Calez vos attentes sur ce rang.
Impact pour une équipe
Aucune échéance ne vous presse : les modèles 4o servent toujours les intégrations existantes 6. Lisez « modèle de départ recommandé » comme un aiguillage pour les nouveaux chantiers. Avant tout changement d’identifiant, greppez vos appels de transcription sur language: et recensez chaque consommateur d’horodatages ou d’étiquettes de locuteur : ces deux recherches décident si le chantier tient en une ligne ou en un sprint. Gardez gpt-4o-mini-transcribe pour le batch de volume, où 0,003 $ l’emporte sur 0,0045 $ 2. Mesurez delay sur votre propre audio téléphonique : la documentation nomme des points de départ de minimal à xhigh sans publier la moindre milliseconde 5.