
Comparatif des frameworks de test d'IA multimodale
Comparez les frameworks de test d'IA multimodale — FlagEvalMM, MAEV, AILuminate, CityBench et benchmarks médicaux — pour l'évaluation générale, la sécurité et les domaines.
S'il fallait le résumer en une phrase — aucun framework ne couvre tout, donc j'utiliserais un benchmark large pour le suivi et un test de domaine pour les contrôles de mise en production.
Voici la version courte :
- FlagEvalMM convient aux tests larges d'image, de vidéo et de texte
- MAEV évalue la fusion audio-vidéo-texte et montre à quel point les modèles restent en retard sur les humains
- AILuminate Multimodal sert aux tests de risque de sécurité sur 12 catégories de dangers
- CityBench est conçu pour le raisonnement sur les scènes urbaines et géospatiales
- Les frameworks médicaux se concentrent sur le risque clinique, le raisonnement multi-tours et la validation intensive en imagerie
Quelques chiffres ressortent immédiatement :
- MAEV utilise 2,556 questions issues de 700 vidéos
- Les humains obtiennent 92.8% sur MAEV, tandis que les meilleurs modèles avoisinent les 64%
- AILuminate inclut plus de 7,000 prompts texte-image
- CityBench couvre 8 tâches urbaines dans 13 villes
- GMAI-MMBench couvre 39 modalités d'imagerie médicale
- MedBench v5 couvre 63 tâches cliniques
Ce que cela signifie pour moi est simple : les outils larges aident au suivi des régressions, tandis que les tests de domaine détectent les défaillances à haut risque que les benchmarks génériques manquent. Si j'ai besoin de contrôles de mise en production rapides, je m'appuierais d'abord sur le scoring numérique. Si j'ai besoin d'une lecture plus fine avant le lancement, j'ajouterais une revue basée sur un juge et des tests de domaine.

Au-delà du texte - les évaluations d'IA multimodale
Comparaison rapide
| Framework | Principaux types d'entrée | Usage principal | Principale lacune |
|---|---|---|---|
| FlagEvalMM | Texte, image, vidéo | Benchmarking multimodal général | Pas de contrôles de sécurité intégrés ; pas d'audio |
| MAEV | Audio, vidéo, texte | Test de fusion audiovisuelle | Pas de contrôles de sécurité ni de stabilité |
| AILuminate Multimodal | Texte, image | Sécurité et red teaming | Configuration plus lourde ; accès limité au jeu de données |
| CityBench | Vue de rue, satellite, cartes, données urbaines | Raisonnement urbain et tâches décisionnelles | Portée de domaine restreinte |
| Frameworks médicaux | Images médicales, texte, données cliniques multi-tours | Validation clinique | Travail de revue lourd ; audio toujours absent |
Donc si vous choisissez rapidement, je raisonnerais en deux couches :
- Benchmark général pour le suivi de version en version
- Benchmark de domaine ou de sécurité pour les décisions de mise en production ou non
C'est l'enseignement central de cet article.
1. FlagEvalMM

FlagEvalMM est le framework open-source de BAAI pour l'évaluation multimodale. Il fonctionne avec le texte, les images et la vidéo. Les tâches principales incluent le VQA, la recherche d'images, la génération texte-image et l'évaluation de diagrammes basée sur ROME. L'audio ne fait pas partie de l'ensemble, donc les workflows centrés sur l'audio sortent de son périmètre.
Focus d'évaluation
Lorsque la tâche mise fortement sur le raisonnement, FlagEvalMM prend aussi en charge l'évaluation par LLM-juge pour le raisonnement sur diagrammes. Il inclut également RelScene et LRM-Eval, qui étendent sa portée à la compréhension de scènes et à l'évaluation intensive en raisonnement.
Couverture sécurité et équité
Sur les contrôles de confiance et de politique, il y a une lacune : il n'inclut pas de contrôles intégrés de sécurité, d'équité ou d'hallucination.
Adéquation au déploiement
Le model zoo de FlagEvalMM prend en charge l'inférence locale pour les modèles open-source comme QwenVL, LLaVA et Janus. Il prend aussi en charge l'évaluation par API pour des modèles tels que GPT, Claude et HuanYuan. En plus de cela, il a ajouté la prise en charge d'OpenRouter, qui offre aux équipes davantage d'options d'API en un seul endroit.
Cette configuration fonctionne bien pour les équipes qui veulent évaluer à la fois des modèles multimodaux locaux et hébergés au sein d'un même framework. Si votre équipe a aussi besoin d'évaluation audio ou de tests de sécurité intégrés, il faudra prévoir un outillage supplémentaire à ses côtés.
2. MAEV
MAEV étend l'évaluation au-delà des configurations purement visuelles en testant la fusion audio-vidéo-texte.
Couverture des modalités
MAEV, aussi appelé MAVERIX, a été publié le 14 mars 2026. Il teste ensemble la vidéo, l'audio et le texte. Le jeu de données comprend 2,556 questions issues de 700 vidéos, et il utilise des formats à la fois à choix multiples et ouverts [2]. Pour trouver la bonne réponse, un modèle doit combiner ce qu'il voit avec ce qu'il entend.
Focus d'évaluation
Le benchmark examine la compréhension cross-modale dans les tâches agentiques. En clair, le modèle ne peut pas se contenter de repérer des objets ou de transcrire la parole. Il doit fusionner les signaux audio et vidéo pour prendre une décision.
Cet écart reste assez important. Les experts humains obtiennent 92.8% sur MAEV, tandis que les meilleurs modèles comme Qwen 2.5 Omni et Gemini 2.5 Flash-Lite plafonnent à environ 64%. Cela représente une différence de près de 29 points de pourcentage [2]. De ce fait, MAEV est utile pour repérer où la fusion audiovisuelle commence à échouer.
Couverture sécurité et équité
MAEV n'inclut pas de contrôles dédiés à la sécurité, à l'équité ou à la robustesse.
Adéquation au déploiement
MAEV est fourni avec une boîte à outils publique et des protocoles standardisés, ce qui aide les équipes à exécuter le benchmark de la même manière à chaque fois [2]. Il convient aux tâches vidéo agentiques qui dépendent du contexte audiovisuel. Il est moins utile pour l'évaluation spécifique à un domaine [2].
3. AILuminate Multimodal

Contrairement aux benchmarks précédents, AILuminate cherche à savoir si les modèles multimodaux sont sûrs, et pas seulement s'ils sont performants.
Couverture des modalités et focus d'évaluation
AILuminate Multimodal évalue le risque de sécurité texte-image sur 12 catégories de dangers. Celles-ci vont de la violence et l'automutilation au discours haineux, à la vie privée et aux cas sensibles au contexte comme les conseils de santé ou électoraux. Le jeu de données pilote multimodal inclut plus de 7,000 prompts texte-image [4], et le benchmark a déjà servi à tester 109 modèles différents.
Ce qui le distingue, c'est sa façon de gérer la langue. Au lieu de s'appuyer sur la traduction, AILuminate utilise des prompts rédigés pour une pertinence locale, puis vérifiés par des locuteurs natifs en hindi, tamoul, malais, coréen et japonais [4]. C'est important. Un prompt qui fonctionne dans une langue peut être perçu très différemment dans une autre, en particulier dans les tests de sécurité.
Donc bien que ce benchmark puisse produire des scores, il est plus utile pour le red teaming que pour de larges comparaisons de benchmarks.
Couverture sécurité et fiabilité
AILuminate est conçu pour le red teaming et les audits de sécurité avant déploiement, en particulier pour les chatbots grand public et les assistants vision-langage utilisés sur les marchés mondiaux. Sa méthode s'appuie sur les recherches MSTS de 2025 [4].
En clair, c'est le type de framework que vous utilisez lorsqu'une défaillance de sécurité a un coût réel. Si un modèle donne un conseil risqué, gère mal une image privée ou répond mal dans un contexte à fort enjeu, ce benchmark est conçu pour faire remonter ces points faibles avant le lancement.
Adéquation au déploiement
Utiliser AILuminate demande plus de travail qu'un outil de validation léger. Le scoring nécessite Modelbench et un ensemble d'évaluateurs de sécurité, et les jeux de données complets sont réservés aux membres de MLCommons [5]. Cela rend le framework plus lourd et plus lent à mettre en pratique.
Il convient le mieux dans les contextes critiques pour la sécurité, où des contrôles approfondis comptent plus que la vitesse. Pour une revue de sécurité version par version, c'est une option solide, mais il est moins pratique lorsque les équipes ont besoin de tests rapides sur de nombreuses mises à jour de modèles.
4. CityBench

Là où les frameworks précédents examinent la performance multimodale large et la sécurité, CityBench se concentre sur le raisonnement urbain.
Couverture des modalités et focus d'évaluation
CityBench vérifie si un modèle sait lire des scènes urbaines, raisonner sur des données géospatiales et prendre des décisions dans des environnements urbains en évolution rapide. Sa force est le raisonnement à l'échelle de la ville, et non une large portée multimodale.
Pour cela, CityBench réunit l'imagerie satellite, les images de vue de rue, les réseaux routiers, les POI/AoI, les flux origine-destination et les enregistrements de check-in afin de tester le raisonnement visuel et géospatial [7]. Il couvre 8 tâches urbaines réparties en deux groupes : perception et prise de décision [7]. Cela inclut des tâches comme le GeoQA, la géolocalisation, la prédiction de mobilité et le contrôle des feux de circulation [7].
Sa configuration CityData/CitySimu va un cran plus loin. Elle modélise en détail les dynamiques urbaines et prend en charge les tests en boucle fermée pour les tâches décisionnelles [7]. En clair, cela signifie que vous pouvez tester la réaction d'un modèle lorsque les conditions de la ville changent en continu, au lieu de le juger uniquement sur des entrées statiques. Le benchmark a aussi été exécuté sur 30 LLM et VLM pour établir des performances de référence [7].
Couverture sécurité et équité
Associez-le à une revue de sécurité et d'équité distincte.
Adéquation au déploiement
CityBench convient bien à la recherche en IA urbaine et aux projets de villes intelligentes, y compris l'optimisation du trafic, la prévision de la mobilité et l'urbanisme [7]. Il couvre aussi 13 villes du monde [7], ce qui offre aux équipes une base de test plus large qu'une configuration mono-ville.
Il reste néanmoins un benchmark spécialisé. Il est conçu pour des tâches à l'échelle de la ville, et non pour des tâches humaines quotidiennes. Il ne couvre pas non plus la navigation à la première personne basée sur le mouvement. Et il y a une autre lacune à noter : les benchmarks urbains existants comme CityBench se limitent souvent à des entrées mono-vue et ne testent pas pleinement le raisonnement cross-vue entre l'imagerie au niveau de la rue et l'imagerie satellite [6].
Donc la meilleure façon d'utiliser CityBench est comme une couche spécifique à un domaine. Il fonctionne bien lorsqu'on l'ajoute à une pile d'évaluation plus large, mais il ne devrait pas être votre unique benchmark multimodal.
5. Frameworks d'évaluation multimodale intégrée orientés santé
Après les benchmarks généraux et spécifiques à un domaine, les modèles de santé nécessitent des tests plus exigeants pour le risque clinique, le raisonnement longitudinal et la fusion des modalités. En santé, les erreurs ne font pas que baisser un score. Elles peuvent affecter le diagnostic et le traitement. Plusieurs frameworks ont donc été conçus pour un usage clinique, et chacun cible un type de défaillance différent.
Couverture des modalités et focus d'évaluation
Pour la couverture d'imagerie, GMAI-MMBench est le framework le plus large de cet ensemble. Il couvre 39 modalités d'imagerie médicale réparties sur 18 services cliniques et s'appuie sur 285 jeux de données [10]. Il évalue les modèles à quatre niveaux perceptuels : image, boîte, masque et contour [10].
MedAtlas s'attaque à un point faible courant du benchmarking médical : de nombreux benchmarks se concentrent encore sur des tâches à image unique et à tour unique plutôt que sur un raisonnement clinique longitudinal et multimodal [8]. Il teste le raisonnement à travers les visites et les Q&R visuelles multi-tours, en cherchant à savoir si un modèle peut combiner les résultats d'imagerie avec l'historique du patient pour appuyer le diagnostic [8].
MedBench v5 couvre les systèmes de langage, vision-langage et agents sur 63 tâches cliniques [9]. Ce qui ressort, c'est son stress testing. Il insère des résultats manquants ou contradictoires pour voir si un modèle repère l'incohérence ou continue simplement [9]. Asclepius ajoute de l'ampleur entre spécialités, avec une couverture de 15 spécialités médicales, 8 capacités diagnostiques et 79 parties du corps, sur la base de 3,232 questions multimodales originales [11].
Couverture sécurité et équité
MedBench v5 inclut un SafetyAgent qui vérifie la désinformation médicale, les commandes d'outils dangereuses, les fuites de données personnelles et les violations éthiques [9]. Il suit également les affirmations non étayées qui se propagent d'un tour à l'autre [9]. Ses stress tests ciblent principalement la détection de contradictions, les mises à jour de diagnostic et le contrôle des hallucinations [9].
GMAI-MMBench pointe un problème de sécurité différent : certains modèles refusent de répondre à des questions cliniques en raison de protocoles de sécurité intégrés, ce qui peut réduire l'usage clinique en pratique [10].
Une lacune apparaît dans les quatre frameworks : l'audio est toujours absent en tant que modalité intégrée principale [8][9][10][11].
Adéquation au déploiement
Chaque framework correspond à un mode de défaillance clinique différent, donc le bon choix dépend de la tâche à accomplir.
| Framework | Charge de travail la mieux adaptée |
|---|---|
| GMAI-MMBench | Assistants de diagnostic interactifs nécessitant un scoring au niveau boîte, masque ou contour [10] |
| MedAtlas | Cas nécessitant l'intégration multi-images et de l'historique patient [8] |
| MedBench v5 | Aide à la décision critique pour la sécurité et agents cliniques [9] |
| Asclepius | Validation spécifique à une spécialité en radiologie et pathologie [11] |
Le compromis est simple : plus un framework couvre de terrain, plus le travail de validation tend à être lourd.
Avantages et inconvénients
Le tableau ci-dessous résume les principaux compromis : couverture, style de scoring et adéquation au domaine. Ces compromis comptent le plus lorsqu'une équipe doit valider rapidement de nouvelles versions de modèles sans trop sacrifier de couverture. Considérez-le comme un guide de validation de mise en production, et non comme une liste d'outils polyvalents.
| Framework | Avantages | Inconvénients | Idéal pour |
|---|---|---|---|
| FlagEvalMM | Large couverture multimodale ; sépare l'inférence de l'évaluation | Le scoring automatisé de génération reste imparfait - VQAScore corrèle avec le jugement humain à 0.76 pour la cohérence des prompts [12] | Équipes exécutant des benchmarks de compréhension et de génération dans le même pipeline |
| MAEV | Teste la fusion audio-vidéo-texte dans les tâches agentiques ; des protocoles standardisés permettent des exécutions reproductibles [2] | Pas de contrôles dédiés de sécurité, d'équité ou de robustesse [2] | Tâches vidéo agentiques qui dépendent du contexte audiovisuel |
| AILuminate Multimodal | Couvre 12 catégories de dangers sur plus de 7,000 prompts texte-image ; revue des prompts par des locuteurs natifs en 5 langues [4] | Nécessite Modelbench et un ensemble d'évaluateurs de sécurité ; jeux de données complets réservés aux membres de MLCommons [5] | Audits de sécurité avant déploiement et red teaming pour les modèles vision-langage |
| CityBench | Teste 8 tâches urbaines dans 13 villes du monde ; prend en charge l'évaluation décisionnelle en boucle fermée [7] | Spécialisé uniquement dans les tâches à l'échelle de la ville ; ne couvre pas la navigation à la première personne basée sur le mouvement [7] | Recherche en IA urbaine, optimisation du trafic et applications de villes intelligentes |
| Frameworks orientés santé | Conçus pour la validation clinique réglementée | Surcharge de validation lourde ; couverture réduite lorsque les modèles refusent les prompts cliniques | Validation clinique critique pour la sécurité |
Le clivage le plus important tient au scoring numérique rapide face au jugement sémantique plus lent.
Les métriques numériques sont rapides et reproductibles, ce qui en fait un bon choix pour les contrôles CI. Mais la vitesse a un revers : ces métriques peuvent passer à côté des erreurs de composition. Un modèle peut paraître correct sur le papier tout en échouant de manières qui comptent une fois que les sorties deviennent plus ouvertes.
Les frameworks qui reposent sur le LLM-as-Judge gèrent mieux le jugement sémantique ouvert [1][3]. Cela les rend plus utiles lorsque vous devez inspecter la nuance, et pas seulement compter les bonnes réponses. L'inconvénient est assez évident : ils ajoutent du coût et peuvent tout de même introduire une erreur d'évaluation dans le processus.
Pour les équipes qui ont besoin à la fois de vitesse et d'une revue plus approfondie, une configuration mixte a généralement le plus de sens :
- Utilisez les métriques numériques pour les contrôles CI
- Utilisez le scoring sémantique avant les mises en production majeures
Ainsi, vous obtenez des signaux de succès/échec rapides tôt, puis une lecture plus fine avant que la version ne sorte.
Conclusion
Mis côte à côte, ces frameworks rendent une chose claire : le test multimodal se répartit en quatre grandes catégories - cas d'usage généraux, de sécurité, urbains et cliniques.
FlagEvalMM et MAEV sont les meilleurs choix pour l'évaluation multimodale large. AILuminate Multimodal est conçu pour les tests de sécurité. CityBench est le bon choix pour le raisonnement urbain. Et les frameworks médicaux se concentrent sur la validation clinique.
Le compromis reste le même pour tous : une large couverture est plus facile à mettre à l'échelle, mais les benchmarks spécialisés sont meilleurs pour détecter les défaillances à plus haut risque.
Une configuration pratique est simple :
- Utilisez un benchmark large pour le suivi des régressions
- Utilisez un benchmark spécifique à un domaine pour la validation de mise en production
La meilleure configuration revient à faire correspondre le benchmark au mode de défaillance que vous devez détecter.
FAQ
Comment choisir entre un benchmark général et un benchmark spécifique à un domaine ?
Ne choisissez pas l'un en ignorant l'autre - utilisez les deux.
Commencez par les benchmarks généraux pour restreindre le champ et établir une base de référence. Ils constituent un bon premier passage.
Construisez ensuite un jeu d'évaluation personnalisé à partir de vos propres données. Pour les workflows spécialisés, ce jeu de test - surtout lorsqu'il inclut des cas limites et des modes de défaillance - vous donne une bien meilleure idée de la performance d'un modèle en production que les scores de benchmark seuls.
Quand devrais-je utiliser le scoring numérique plutôt qu'une revue basée sur un juge ?
Utilisez le scoring numérique lorsque vous avez besoin d'un système rapide et reproductible dans un pipeline automatisé. Il convient bien à la validation CI/CD car vous pouvez décider succès/échec sans vous arrêter pour une revue humaine. Cette approche fonctionne le mieux pour l'alignement sémantique et les benchmarks standards, où l'exactitude peut être mesurée de manière claire et objective.
Utilisez la revue basée sur un juge pour les travaux qui dépendent de la nuance. Cela inclut des choses comme l'esthétique, le ton ou des décisions spécifiques à un domaine en médecine, en droit et en finance, où le jugement d'expert compte encore.
Quel framework est le meilleur pour tester des modèles multimodaux compatibles audio ?
Cela dépend de ce que vous testez.
AU-Harness convient mieux à l'évaluation audio-vers-texte dans les grands modèles de langage audio (Large Audio Language Models). lmms-eval est le choix le plus large. Il prend en charge les tâches audio, texte, image et vidéo, ce qui le rend pratique lorsque vos tests vont au-delà du seul audio.
Pour le raisonnement audiovisuel, AVI-Bench et MAVERIX sont conçus pour vérifier dans quelle mesure les modèles combinent le son et l'entrée visuelle. Si vous voulez une couche unique pour relier ces modèles à votre configuration de test, APIMart peut aider à unifier l'accès sur l'ensemble du pipeline.
Choisissez le modèle qui vous convient dans le marketplace
Essayez les modèles de chat, image et vidéo sur le marketplace APIMart, puis découvrez rapidement leurs capacités avec une API unifiée.