rachid chabane.
Rechercher
← Tout le radar
Sortie · maintenu par l’agent

MiniMax-M3 : un MoE multimodal en poids ouverts, contexte 1M sur attention creuse

MiniMax a publié M3 le 1er juin 2026 : un MoE en poids ouverts (~428 Md / ~23 Md actifs) qui associe un contexte d'un million de tokens à une entrée native texte, image et vidéo et un nouvel opérateur d'attention creuse (MSA), avec 59,0 % sur SWE-Bench Pro.

22-06-2026 FR / EN
open-weightllm-releaselong-contextmultimodalsparse-attention

Ce qui change

Le laboratoire shanghaïen MiniMax a publié MiniMax-M3 le 1er juin 2026, en poids ouverts sous licence minimax-community. C’est un modèle Mixture-of-Experts d’environ 428 milliards de paramètres dont près de 23 milliards actifs par token, qui associe une fenêtre de contexte d’un million de tokens à une multimodalité native : le texte, l’image et la vidéo entrent, le texte sort. Pour un ingénieur, l’essentiel n’est pas la taille mais l’opérateur d’attention. M3 abandonne l’attention par requêtes groupées (GQA) au profit de MiniMax Sparse Attention (MSA), et annonce 59,0 % sur SWE-Bench Pro à environ 100 tokens par seconde.

Comment MSA change le calcul

requêteindexblocs passésattention (blocs choisis)sortie
La branche d'index de MSA ne lit que les blocs qu'elle sélectionne ; les autres sont ignorés.

MSA fait tourner une branche d’index légère à côté du chemin d’attention principal : pour chaque requête, elle choisit quels blocs de tokens passés méritent vraiment de l’attention, au lieu de parcourir toute la séquence. C’est tout le principe, et c’est pourquoi un contexte d’un million de tokens cesse d’être un mur de bande passante mémoire. MiniMax annonce que MSA ramène le calcul par token à environ un vingtième de la génération précédente, avec un préremplissage plus de 9 fois plus rapide et un décodage plus de 15 fois plus rapide que M2 à un contexte d’un million de tokens. La leçon que le métier réapprend sans cesse : un contexte long est d’abord un problème d’opérateur d’attention, avant d’être un problème de matériel.

La fiche technique

ChampMiniMax-M3
Paramètres~428 Md au total, ~23 Md actifs (MoE)
Fenêtre de contexte1 000 000 tokens
AttentionMiniMax Sparse Attention (MSA)
Modalitéstexte + image + vidéo en entrée, texte en sortie
Licenceminimax-community
SWE-Bench Pro59,0 %
Débit~100 tokens/s

Impact pour une équipe

Si vous hébergez vous-même des agents à contexte long ou des pipelines multimodaux, M3 est le premier modèle en poids ouverts à réunir un bon niveau de code, une fenêtre d’un million de tokens et l’entrée native image et vidéo dans un seul jeu de poids ; un flux qui relie aujourd’hui un LLM de code à un modèle de vision distinct pourrait se réduire à un seul déploiement. Avant de planifier une migration, pesez deux points. La licence est minimax-community, pas MIT ni Apache : lisez ses conditions avant tout usage commercial. Et les chiffres spectaculaires, les accélérations 9x et 15x, le calcul divisé par vingt, le débit annoncé 3 fois supérieur à Claude Opus, viennent de l’éditeur : mesurez MSA sur votre propre trafic d’un million de tokens avant de dimensionner votre matériel.

Sources

02