Ce qui change
TypeSafe AI a ouvert le 15 septembre 2026 l’accès anticipé à Jev, et les développeurs sortent encore d’une liste d’attente 1. On envoie à POST https://api.typesafe.ai/v1/systemone un champ model fixé à jev-latest et une map questions 2. Les réponses Choice et Score portent une confidence comprise entre 0 et 1, et une réponse oui/non revient sous la forme noul, de 0 (non) à 1 (oui) 2. L’entrée coûte $0.042 par MTok et les tokens de sortie sont gratuits 1.
La ligne qui manque à Jev
Le site d’évals de TypeSafe moyenne précision, coût et temps sur quatre workflows, et fait tourner chaque modèle de comparaison deux fois, en workflow explicite et en prompt unique 3 :
| Modèle | Prompt | Workflow | Coût workflow | Temps workflow |
|---|---|---|---|---|
| haiku 4.5 | 18.1% | 53.6% | $0.0195 | 12.5 s |
| sonnet 5 | 60.4% | 67.8% | $0.1174 | 78.1 s |
| opus 5 | 64.8% | 73.1% | $0.1761 | 37.8 s |
| sol | 63.4% | 74.1% | $0.0836 | 23.3 s |
| Jev | aucune ligne | 67.8% | $0.0004 | 0.4 s |
Anthony Maio en conclut que chaque modèle de comparaison devient plus précis, plus rapide et moins cher dans le workflow 4. J’ai vérifié les huit paires, et cela tient sur les trois axes 3. Jev n’y figure qu’en ligne workflow 3. Son vrai coût d’adoption est là, je pense : un modèle qui n’accepte que des questions typées impose la décomposition qui a déjà fait passer haiku 4.5 de 18.1% à 53.6% 3. Jev égale la ligne workflow de sonnet 5 à 67.8% et reste derrière sol et opus 5 3. Ce qu’il gagne, ce sont $0.0004 et 0.4 s contre $0.1174 et 78.1 s pour sonnet 5 3.
Impact pour une équipe
Si vous routez, triez ou notez avec un seul long prompt, découpez-le dès maintenant en questions typées, sur le modèle que vous payez déjà. C’est là, à mon sens, que le tableau de TypeSafe place le gain, et cela ne demande aucune liste d’attente 3. Gardez les étiquettes que ce découpage vous oblige à écrire, puis testez Jev contre elles quand l’accès arrivera. Ne déclenchez pas encore d’escalade sur confidence. L’article de lancement affirme que toutes les réponses arrivent avec des probabilités et des scores de confiance calibrés 1, la documentation dérive confidence de probabilities 2, or TypeSafe n’a pas dit de quelle statistique il s’agit, et sa méthode de calibration n’est pas publiée 4. Le typage fixe la forme d’une réponse et laisse le jugement libre, comme le dit Maio 4 : confrontez donc confidence à vos propres étiquettes avant tout usage.