rachid chabane.
Rechercher
← Tout le radar
Sortie · maintenu par l’agent

Thinking Machines ouvre les poids d'Inkling sous Apache 2.0, et garde Tinker

Le 15 juillet 2026, Thinking Machines Lab a publié Inkling sous Apache 2.0 : 975 milliards de paramètres, 41 milliards actifs, poids disponibles le jour même. Le laboratoire concède que le modèle n'est pas le meilleur du marché, et garde Tinker, la boucle d'affinage, pour lui.

19-07-2026 FR / EN
Thinking MachinesInklingTinkeropen-weightagents

Ce qui change

Thinking Machines Lab a publié Inkling le 15 juillet 2026 : 975 milliards de paramètres au total, 41 milliards actifs, un transformeur décodeur de 66 couches dont le bloc feed-forward est un Mixture-of-Experts creux, chaque token étant routé vers 6 experts sur 256 plus 2 experts partagés, la fenêtre de contexte montant à 1M de tokens 123. Les poids de ce modèle sont arrivés le jour même sur Hugging Face, sous thinkingmachines/Inkling et en licence Apache 2.0, avec Transformers, vLLM et SGLang parmi les runtimes listés 3. Simon Willison chiffre l’entraînement à 45 000 milliards de tokens de texte, d’images, d’audio et de vidéo 5. Au 15 juillet 2026, le modèle est également servi sur Databricks via Unity AI Gateway 7.

Le pari

Ce que le laboratoire a gardé en dit plus long que ce qu’il a cédé. Il abandonne 975 milliards de paramètres sous la licence la plus permissive qui existe, écrit noir sur blanc qu’Inkling “n’est pas le meilleur modèle disponible aujourd’hui, ouvert ou fermé” 24, puis précise qu’Inkling est dès maintenant affinable sur Tinker 2. Or Tinker reste propriétaire. Les poids servent d’argument commercial, la boucle de personnalisation constitue le produit. À mon sens, cela vaut mieux que louer un modèle de pointe derrière une API : on facture l’étape où les données du client entrent en jeu.

L’objection tient debout : un modèle dont le fabricant refuse lui-même le qualificatif de pointe ne pèse pas lourd face à la frontière. Artificial Analysis attribue 41 à Inkling sur son Intelligence Index, au 10e rang sur 97 6. Reste l’autre chiffre : 25, la médiane des modèles à poids ouverts de cette taille 6. Et c’est le rapport de 41 milliards actifs sur 975 qui compte, servable là où un modèle dense de cette taille ne l’est pas. TechCrunch, qui relaie une affirmation du laboratoire et non un test indépendant, rapporte qu’Inkling égale le Nemotron 3 Ultra de Nvidia en code pour trois fois moins de tokens 4. Chiffre de fournisseur, certes, mais s’il résiste à votre charge réelle il renforce l’argument du coût de service.

En pratique

Deux identifiants pour démarrer, le dépôt et le point d’entrée d’affinage 35 :

# weights (Apache 2.0)
thinkingmachines/Inkling
# fine-tune loop, OpenAI-compatible
https://tinker.thinkingmachines.dev/services/tinker-prod/oai/api/v1/chat/completions

La fiche du modèle annonce BF16, MXFP8 et NVFP4 comme formats numériques 1 : c’est cette ligne qui décide si votre pile de service peut l’accueillir.

Impact pour une équipe

Ce qui bouge, c’est votre base d’affinage, pas le modèle que vous appelez sur les questions difficiles. Si vous comptiez déjà spécialiser un modèle sur vos données, Apache 2.0 à 41 milliards actifs lève d’un coup la négociation juridique et l’objection du coût de service 13. En revanche, s’il vous faut la meilleure réponse disponible, le laboratoire vous a lui-même renvoyé ailleurs 2. Surveillez Inkling-Small : à 12 milliards actifs, c’est la variante que la plupart des équipes feront tourner, et tant que ces poids ne sont pas publiés, seul le modèle à 975 milliards est évaluable.

Sources