Ce qui change
OpenAI a revu les tarifs de la famille GPT-5.6 le 30 juillet 2026 : Luna coûte 80 % de moins, Terra 20 % de moins, et Sol ne bouge pas 15. La bascule concerne v1/responses et v1/chat/completions 1. Le même jour, le traitement prioritaire a été rebaptisé mode Fast, et les requêtes qui envoient encore service_tier: "priority" continuent de fonctionner 13.
Le nouveau plancher
| Modèle | Avant | Après |
|---|---|---|
| gpt-5.6-sol | 5,00 $ / 30,00 $ | inchangé 25 |
| gpt-5.6-terra | 2,50 $ / 15,00 $ 4 | 2,00 $ / 12,00 $ 2 |
| gpt-5.6-luna | 1,00 $ / 6,00 $ 4 | 0,20 $ / 1,20 $ 2 |
(entrée / sortie par million de tokens, contexte court.)
Un plancher divisé par cinq n’allège presque pas la facture que vous payez déjà. Il change ce que vous pouvez vous permettre de lancer, et c’est à mon sens le vrai intérêt de cette baisse : le reranking par chunk sur chaque récupération cesse d’être une expérience à justifier. Luna passe d’ailleurs 3,75 fois sous gpt-5.4-mini, à 0,75 $ / 4,50 $ 2, le palier intermédiaire de la génération précédente, des deux côtés du compteur.
Le calcul du fan-out change de signe. Côté entrée, Luna coûtait 1,00 $ par Mtok 4 contre 2,50 $ pour Terra 4 : cinq appels Luna revenaient à cinq fois 1,00 $, soit le double d’un appel Terra unique. À 0,20 $ 2 contre 2,00 $ 2, cinq fois 0,20 $ ne pèse plus que la moitié de ce même appel. Le fan-out était l’option chère, il devient l’option économique.
L’objection tient : une baisse de 80 % sur un palier que votre tâche ne peut pas utiliser ne rapporte rien, et une cascade coûte du temps d’ingénierie plus un harnais d’évaluation. Or aucun des deux arguments ne survit à l’inversion ci-dessus, qui change la liste des expériences tenant dans le budget au lieu de rogner les appels que vous passez déjà.
Le mode Fast coûte le double, partout
Le mode Fast facture exactement le double du standard, en entrée comme en sortie, sur les trois paliers 5.6 : luna à 0,40 $ / 2,40 $ et sol à 10,00 $ / 60,00 $ 2. Le gain de 2,5x, lui, n’est rattaché qu’à un seul modèle nommé, gpt-5.6-sol 13, alors que la phrase d’ouverture du guide promet jusqu’à 2,5x plus rapide sans citer de palier 3. Lisez-y où le chiffre est ancré plutôt qu’un silence à reprocher : le doublement est acquis partout, la mesure non, donc sur Terra et Luna je mesure avant de basculer. Deux pièges se cachent dessous. L’objet de réponse renvoie priority pour GPT-5.6 et les modèles antérieurs même quand la requête disait fast 3, donc une télémétrie qui filtre sur "fast" ne se déclenchera jamais ; le contexte long, les modèles fine-tunés et les embeddings restent hors périmètre 3.
Impact pour une équipe
Reprenez la sélection des paliers cette semaine plutôt que d’inscrire la baisse au budget sur le papier : ce qui reste sur Terra par simple confort de marge paie dix fois le prix d’entrée de Luna, et l’économie n’arrive que si le routeur bouge. Auditez service_tier au niveau du projet avant la prochaine facture, car un projet réglé sur Fast double chaque requête non étiquetée pendant que l’objet de réponse affiche toujours priority : le dashboard ne vous le dira pas 3. Ce que j’écarterais, c’est le mode Fast comme correctif de latence générique hors de Sol, où le doublement du prix est acquis alors que le 2,5x est rattaché à un autre modèle 13.