Ce qui change
Le laboratoire shanghaïen MiniMax a publié MiniMax-M3 le 1er juin 2026, en poids ouverts sous licence minimax-community. C’est un modèle Mixture-of-Experts d’environ 428 milliards de paramètres dont près de 23 milliards actifs par token, qui associe une fenêtre de contexte d’un million de tokens à une multimodalité native : le texte, l’image et la vidéo entrent, le texte sort. Pour un ingénieur, l’essentiel n’est pas la taille mais l’opérateur d’attention. M3 abandonne l’attention par requêtes groupées (GQA) au profit de MiniMax Sparse Attention (MSA), et annonce 59,0 % sur SWE-Bench Pro à environ 100 tokens par seconde.
Comment MSA change le calcul
MSA fait tourner une branche d’index légère à côté du chemin d’attention principal : pour chaque requête, elle choisit quels blocs de tokens passés méritent vraiment de l’attention, au lieu de parcourir toute la séquence. C’est tout le principe, et c’est pourquoi un contexte d’un million de tokens cesse d’être un mur de bande passante mémoire. MiniMax annonce que MSA ramène le calcul par token à environ un vingtième de la génération précédente, avec un préremplissage plus de 9 fois plus rapide et un décodage plus de 15 fois plus rapide que M2 à un contexte d’un million de tokens. La leçon que le métier réapprend sans cesse : un contexte long est d’abord un problème d’opérateur d’attention, avant d’être un problème de matériel.
La fiche technique
| Champ | MiniMax-M3 |
|---|---|
| Paramètres | ~428 Md au total, ~23 Md actifs (MoE) |
| Fenêtre de contexte | 1 000 000 tokens |
| Attention | MiniMax Sparse Attention (MSA) |
| Modalités | texte + image + vidéo en entrée, texte en sortie |
| Licence | minimax-community |
| SWE-Bench Pro | 59,0 % |
| Débit | ~100 tokens/s |
Impact pour une équipe
Si vous hébergez vous-même des agents à contexte long ou des pipelines multimodaux, M3 est le premier modèle en poids ouverts à réunir un bon niveau de code, une fenêtre d’un million de tokens et l’entrée native image et vidéo dans un seul jeu de poids ; un flux qui relie aujourd’hui un LLM de code à un modèle de vision distinct pourrait se réduire à un seul déploiement. Avant de planifier une migration, pesez deux points. La licence est minimax-community, pas MIT ni Apache : lisez ses conditions avant tout usage commercial. Et les chiffres spectaculaires, les accélérations 9x et 15x, le calcul divisé par vingt, le débit annoncé 3 fois supérieur à Claude Opus, viennent de l’éditeur : mesurez MSA sur votre propre trafic d’un million de tokens avant de dimensionner votre matériel.