Liquid AI a livré LFM2.5-VL-3B aujourd'hui, une semaine et demie après LFM2.5-2.6B en texte seul — le petit frère vision-langage de la même famille, la même lignée architecturale, le même argument de vente sur l'exécution locale. Avec 3,1B de paramètres, il se situe véritablement au milieu du peloton dans la comparaison à huit modèles publiée par Liquid : Qwen3.5 et InternVL3.5 proposent tous deux des variantes 2B et 4B dans le graphique, Gemma-4 propose un « E2B » et un 8B. Cela compte pour la façon de lire les résultats — ce n'est pas l'histoire « petit modèle bat les géants » que racontait la sortie en texte seul ; c'est un modèle qui se bat dans sa vraie catégorie de poids, gagnant certaines catégories et en perdant d'autres, comme une comparaison honnête en a généralement l'air.
Où il mène réellement, et où il ne mène pas
Sur les neuf groupes de benchmarks publiés par Liquid, LFM2.5-VL-3B mène nettement sur deux : General (70,1, devançant les 69,7 d'InternVL3.5-4B et les 69,7 de Qwen3.5-4B) et Multilingual (81,2, devant les 79,5 de Qwen3.5-4B). Il est second de justesse sur trois autres — Grounding (87,9, derrière les 88,8 d'InternVL3.5-4B), Multi-Image (59,9, derrière les 60,4 de Qwen3.5-4B), et GUI (80,7, derrière les deux tailles d'InternVL3.5, à 82,0 et 84,1). Et il traîne nettement sur Function calling, STEM, Document/OCR/Chart et Hallucination — sur la plupart de ces catégories, Qwen3.5-4B (un modèle plus grand dans cette comparaison) l'emporte nettement, et sur Function calling en particulier, Gemma-4-E4B-it et Qwen3.5-4B le devancent tous deux largement (50,8 et 59,3 contre 46,0 pour LFM2.5-VL-3B).
C'est un résultat réel, vérifiable et mitigé — qui mérite d'être pris tel quel plutôt que lu comme une victoire ou une défaite. Qu'un modèle de 3,1B batte certains rivaux de 4,7B et 8B sur la compréhension visuelle générale et les tâches multilingues tout en perdant contre eux sur des benchmarks denses en connaissances comme le QA documentaire correspond à peu près à ce à quoi on s'attendrait : la compétence perceptuelle large se compresse mieux que la connaissance factuelle et STEM dense, un motif que la couverture des petits modèles de ce mois-ci ne cesse de confirmer sous des angles différents.
Le chiffre que Liquid n'a pas mis en titre
La comparaison qui compte réellement le plus est LFM2.5-VL-3B face à son propre prédécesseur, LFM2-VL-3B, même nombre de paramètres, une génération d'écart. Deux écarts se détachent de tous les autres chiffres du graphique :
- Ancrage GUI : 5,4 → 80,7. Pas une amélioration, une réparation. La génération précédente était essentiellement non fonctionnelle sur une tâche — lire des coordonnées d'écran,
ScreenSpot-v2bureau/mobile/web — que tout agent censé piloter un ordinateur doit maîtriser au minimum. Un modèle notant 5,4 sur l'ancrage GUI n'aurait pas pu être livré comme backbone visuel d'un agent pilotant un écran dans un sens sérieux ; un modèle notant 80,7 plausiblement le peut. - Function calling : 23,4 → 46,0. Environ le double, sur l'autre capacité — lire des schémas d'outils et les appeler correctement à partir d'un contexte visuel — qui sépare un chatbot d'un agent.
Le propre cadrage titre de Liquid s'appuie sur la comparaison de terrain ; le bond générationnel est le chiffre le plus conséquent, parce que c'est la différence entre « chatbot capable de vision » et « backbone d'agent capable de vision » pour le même budget de paramètres. Tout le reste du graphique, c'est Liquid en concurrence avec les modèles d'autres laboratoires sur des capacités relativement stables ; ceci, c'est Liquid réparant quelque chose qui était cassé dans sa propre sortie précédente.
Le graphique de débit a son propre piège
La comparaison de débit GPU de Liquid, sur un seul H100, scinde les huit modèles en deux groupes visiblement distincts plutôt qu'un classement lisse. LFM2.5-VL-3B mène clairement un groupe — culminant à près de 10 900 tokens par seconde contre environ 9 500 pour Qwen3.5-2B et environ 9 300 pour InternVL3.5-2B à forte concurrence. Le second groupe — Qwen3.5-4B, InternVL3.5-4B, Gemma-4-E4B, et Gemma-4-E2B — plafonne bien plus bas, autour de 5 000 à 6 000 tokens par seconde.
Ce regroupement mérite un second regard précisément à cause de la position de Gemma-4-E2B : son nom laisse entendre un modèle léger, « effectivement 2B », mais son débit le place dans le même groupe lent que les modèles 4B et 8B, pas avec les autres modèles sous 3B du groupe rapide. Un nom suggérant l'efficacité ne s'est pas traduit par un débit d'inférence qui lui correspond — le genre d'écart que ce blog a déjà signalé entre ce qu'un nom de modèle laisse entendre et ce qui apparaît réellement au chronomètre.
Ce qui reste non confirmé
Nous n'avons pas pu charger directement le billet de blog de Liquid ni la fiche du modèle sur Hugging Face — les deux domaines sont inaccessibles depuis cet environnement — donc tout ce qui précède vient des deux graphiques fournis directement plutôt que de l'annonce complète. L'architecture (vraisemblablement le même design hybride convolution/attention LFM2 documenté pour le petit frère en texte seul), la licence (vraisemblablement la même LFM Open License v1.0, avec son seuil de coupure commerciale à 10 M$ de revenus), la longueur de contexte, et le cadrage exact de la sortie sont tous inférés du motif existant de la famille LFM2.5, pas confirmés pour ce modèle spécifique. Traitez-les comme des a priori raisonnables, pas des faits vérifiés.
À surveiller
- Si la fiche du modèle confirme l'architecture et la licence. Si elle rompt avec le motif du seuil de 10 M$ de revenus utilisé par la sortie en texte seul, c'est une nouvelle en soi.
- Si la réparation de l'ancrage GUI tient dans de vrais harnais d'agents, pas seulement le benchmark. Un bond de quinze fois sur un benchmark isolé est un signal fort, pas une garantie qu'il survit au contact de vraies mises en page d'écran désordonnées.
- InternVL3.5 comme comparaison à battre. Il mène nettement Grounding et GUI dans ce graphique — les deux catégories les plus pertinentes pour un agent pilotant un écran — malgré l'avantage d'efficacité de LFM2.5-VL-3B ; si Liquid comble cet écart précis à la prochaine génération est une rivalité plus intéressante que le score agrégé.
Références : Liquid AI — annonce de LFM2.5-VL-3B (inaccessible depuis cet environnement ; chiffres tirés des graphiques fournis par l'utilisateur) · couverture liée : LFM2.5-2.6B : le chiffre intéressant n'est pas le prix · Nemotron 3.5 Lightning · À quel point « ouvert » est-il ouvert ? · Frontier Arcade : tendances et prédictions