J'ai réalisé récemment une vidéo explicative animée sur Mamba face à l'attention. Cet article en est le prolongement : ce que l'état de taille fixe de Mamba sacrifie exactement, et ce qu'il ne sacrifie pas.
Mamba oublie-t-il simplement plus que l'attention ?
Oui, mais la réponse mérite d'être nuancée : le phénomène est plus subtil qu'un simple « il oublie davantage ».
Ce que Mamba oublie, ce qu'il conserve
L'oubli n'est ni aléatoire ni uniforme. Reprenons l'équation :
est appris et dépend de l'entrée. Le modèle apprend à rapprocher de 1 pour les tokens qu'il veut conserver, et de 0 pour ceux dont il veut se débarrasser. Autrement dit, il apprend un oubli sélectif, et non une amnésie générale.
Ce qui compte vraiment, c'est le type d'information dont la tâche a besoin :
| Type de tâche | Exemple | Attention | Mamba |
|---|---|---|---|
| Raisonner sur un contexte proche | « D'après le paragraphe ci-dessus, répondez… » | ✅ | ✅ bon |
| Repérer un motif ou un thème lointain | « Quelle est la thèse générale de cet essai ? » | ✅ | ✅ bon |
| Restituer un passage mot pour mot | « Quel était le 3ᵉ mot de la page 1 ? » | ✅ | ⚠️ hasardeux |
| Compter sur tout le contexte | « Combien de fois X apparaît-il ? » | ✅ | ❌ échoue souvent |
| Raisonner sur du code | « Corrige le bug dans cette fonction » | ✅ | ✅ bon |
Ce que montre Soofi S
L'article le confirme noir sur blanc. Sur le benchmark RULER à 1 million de tokens, la tâche d'extraction de mots fréquents (CWE) — qui exige de compter les occurrences sur tout le document — fait chuter Soofi S à environ 3 % de précision au-delà de 32 000 tokens, là où Nemotron (même architecture, mais des données de contexte long différentes) se maintient entre 60 et 64 %.
En revanche, sur toutes les autres sous-tâches de RULER — recherche d'information, questions-réponses, raisonnement —, les deux modèles ne sont séparés que de 4 à 6 points, et ce jusqu'à 1 million de tokens.
L'échec est donc très circonscrit. Il ne s'agit pas de dire que « Mamba oublie tout en contexte long », mais plutôt :
Mamba peine dès que la réponse suppose d'agréger des décomptes exacts ou des fragments mot pour mot dispersés dans l'ensemble du contexte.
Pourquoi l'attention échappe à ce problème
Mathématiquement, l'attention dispose toujours de :
Le token reste là, intact, à la première ligne, quelle que soit la valeur de . Le score softmax peut toujours y revenir avec une précision parfaite : ni décroissance, ni compression, ni valeur propre qui le ferait s'estomper.
Et en pratique ?
Pour 99 % des usages réels — assistants de programmation, questions-réponses sur documents, conversation, raisonnement, résumé —, la compression sélective de Mamba suffit largement, et le gain en vitesse comme en mémoire sur les longs contextes est considérable.
L'écart n'apparaît que sur une classe restreinte de tâches, celles qui exigent de restituer sans aucune perte un élément précis enfoui des milliers de tokens plus haut. C'est une vraie limite, mais elle concerne une part bien plus faible des usages qu'on ne l'imagine.
L'équipe de Soofi en fait d'ailleurs sa priorité pour la prochaine itération : ajouter à la phase d'entraînement en contexte long des données synthétiques de recherche et d'agrégation, afin d'apprendre au modèle à préserver plus agressivement ces signaux dans .