Ce qui change
Thinking Machines Lab a publié Inkling le 15 juillet 2026 : 975 milliards de paramètres au total, 41 milliards actifs, un transformeur décodeur de 66 couches dont le bloc feed-forward est un Mixture-of-Experts creux, chaque token étant routé vers 6 experts sur 256 plus 2 experts partagés, la fenêtre de contexte montant à 1M de tokens 123. Les poids de ce modèle sont arrivés le jour même sur Hugging Face, sous thinkingmachines/Inkling et en licence Apache 2.0, avec Transformers, vLLM et SGLang parmi les runtimes listés 3. Simon Willison chiffre l’entraînement à 45 000 milliards de tokens de texte, d’images, d’audio et de vidéo 5. Au 15 juillet 2026, le modèle est également servi sur Databricks via Unity AI Gateway 7.
Le pari
Ce que le laboratoire a gardé en dit plus long que ce qu’il a cédé. Il abandonne 975 milliards de paramètres sous la licence la plus permissive qui existe, écrit noir sur blanc qu’Inkling “n’est pas le meilleur modèle disponible aujourd’hui, ouvert ou fermé” 24, puis précise qu’Inkling est dès maintenant affinable sur Tinker 2. Or Tinker reste propriétaire. Les poids servent d’argument commercial, la boucle de personnalisation constitue le produit. À mon sens, cela vaut mieux que louer un modèle de pointe derrière une API : on facture l’étape où les données du client entrent en jeu.
L’objection tient debout : un modèle dont le fabricant refuse lui-même le qualificatif de pointe ne pèse pas lourd face à la frontière. Artificial Analysis attribue 41 à Inkling sur son Intelligence Index, au 10e rang sur 97 6. Reste l’autre chiffre : 25, la médiane des modèles à poids ouverts de cette taille 6. Et c’est le rapport de 41 milliards actifs sur 975 qui compte, servable là où un modèle dense de cette taille ne l’est pas. TechCrunch, qui relaie une affirmation du laboratoire et non un test indépendant, rapporte qu’Inkling égale le Nemotron 3 Ultra de Nvidia en code pour trois fois moins de tokens 4. Chiffre de fournisseur, certes, mais s’il résiste à votre charge réelle il renforce l’argument du coût de service.
En pratique
Deux identifiants pour démarrer, le dépôt et le point d’entrée d’affinage 35 :
# weights (Apache 2.0)
thinkingmachines/Inkling
# fine-tune loop, OpenAI-compatible
https://tinker.thinkingmachines.dev/services/tinker-prod/oai/api/v1/chat/completions
La fiche du modèle annonce BF16, MXFP8 et NVFP4 comme formats numériques 1 : c’est cette ligne qui décide si votre pile de service peut l’accueillir.
Impact pour une équipe
Ce qui bouge, c’est votre base d’affinage, pas le modèle que vous appelez sur les questions difficiles. Si vous comptiez déjà spécialiser un modèle sur vos données, Apache 2.0 à 41 milliards actifs lève d’un coup la négociation juridique et l’objection du coût de service 13. En revanche, s’il vous faut la meilleure réponse disponible, le laboratoire vous a lui-même renvoyé ailleurs 2. Surveillez Inkling-Small : à 12 milliards actifs, c’est la variante que la plupart des équipes feront tourner, et tant que ces poids ne sont pas publiés, seul le modèle à 975 milliards est évaluable.