2026-07-21

Ce que Mamba oublie — et ce qu'il garde

AIArchitecture🌍 Global

J'ai récemment réalisé une vidéo explicative animée sur Mamba vs Attention. Cet article est l'approfondissement vers lequel elle renvoie — sur ce que l'état à taille fixe de Mamba sacrifie exactement, et ce qu'il ne sacrifie pas.

Mamba oublie-t-il simplement plus que l'attention ?

Oui, mais avec des nuances importantes — c'est plus subtil qu'un simple « oublie davantage ».

Ce que Mamba oublie par rapport à ce qu'il garde

L'oubli n'est ni aléatoire ni uniforme. Rappelons :

ht=Atht1+Btxth_t = A_t \, h_{t-1} + B_t \, x_t

AtA_t est appris et dépendant de l'entrée. Le modèle apprend à fixer AtA_t près de 1 pour les tokens qu'il doit préserver, et près de 0 pour les tokens qu'il doit écarter. En pratique, il apprend donc un oubli sélectif — pas une amnésie généralisée.

La distinction qui compte, c'est quel type d'information est nécessaire :

Type de tâcheExempleAttentionMamba
Raisonnement sur un contexte proche« À partir du paragraphe ci-dessus, répondez… »✅ bon
Motif / thème à longue portée« Quel est l'argument global de cet essai ? »✅ bon
Rappel exact mot pour mot« Quel était le 3e mot de la page 1 ? »⚠️ risqué
Comptage sur tout le contexte« Combien de fois X apparaît-il ? »❌ échoue souvent
Raisonnement sur du code« Corrige le bug dans cette fonction »✅ bon

Les preuves de Soofi S

L'article le confirme d'ailleurs directement. Sur le benchmark RULER à 1M de tokens, la tâche d'extraction de mots communs (CWE) — qui exige de compter les fréquences de mots sur l'intégralité du document — voit Soofi S s'effondrer à environ 3 % de précision au-delà de 32K tokens, tandis que Nemotron (même architecture, données de contexte long différentes) se maintient entre 60 et 64 %.

Mais sur toutes les autres sous-tâches de RULER — récupération, question-réponse, raisonnement — les deux modèles restent à 4-6 points l'un de l'autre jusqu'à 1M de tokens.

L'échec est donc très spécifique. Ce n'est pas « Mamba oublie tout en contexte long ». C'est plus précisément :

Mamba peine lorsque la réponse exige d'intégrer des comptes exacts ou des fragments mot pour mot dispersés dans l'ensemble du contexte.

Pourquoi l'attention n'a pas ce problème

Mathématiquement, l'attention dispose toujours de :

Kt=[k1k2kt]K_t = \begin{bmatrix} k_1 \\ k_2 \\ \vdots \\ k_t \end{bmatrix}

Le token k1k_1 reste là, intact, à la ligne 1, quel que soit tt. Le score softmax peut toujours y revenir avec une précision totale. Il n'y a ni décroissance, ni compression, ni valeur propre qui le fait rétrécir.

Le tableau pratique

Pour 99 % des tâches réelles de déploiement — assistants de codage, questions-réponses sur documents, chat, raisonnement, résumé — la compression sélective de Mamba est largement suffisante, et l'avantage en vitesse/mémoire à contexte long est considérable.

L'écart n'apparaît que dans la classe restreinte de tâches qui nécessitent un rappel exact et sans perte de quelque chose de précis enfoui des milliers de tokens en arrière. C'est une vraie limitation, mais elle représente une part bien plus faible des usages réels qu'on ne pourrait le croire.

L'équipe de Soofi le désigne d'ailleurs explicitement comme sa cible principale pour la prochaine itération — ajouter des données synthétiques de type récupération et agrégation à la phase d'entraînement en contexte long, pour apprendre au modèle à être plus agressif dans la préservation de ces signaux dans hth_t.