
Perbandingan Framework Pengujian AI Multimodal
Bandingkan framework pengujian AI multimodal — FlagEvalMM, MAEV, AILuminate, CityBench, dan benchmark kesehatan — untuk evaluasi umum, keamanan, dan domain.
Kalau harus saya rangkum dalam satu kalimat: tidak ada satu framework pun yang mencakup segalanya, jadi saya akan memakai satu benchmark luas untuk pelacakan dan satu uji domain untuk pemeriksaan rilis.
Berikut versi singkatnya:
- FlagEvalMM cocok untuk pengujian gambar, video, dan teks yang luas
- MAEV memeriksa fusi audio-video-teks dan menunjukkan seberapa jauh model masih tertinggal dari manusia
- AILuminate Multimodal ditujukan untuk pengujian risiko keamanan di 12 kategori bahaya
- CityBench dibangun untuk penalaran adegan urban dan geospasial
- Framework kesehatan berfokus pada risiko klinis, penalaran multi-giliran, dan validasi berbasis pencitraan
Beberapa angka langsung menonjol:
- MAEV menggunakan 2,556 questions dari 700 videos
- Manusia mencetak 92.8% pada MAEV, sementara model teratas berada di sekitar 64%
- AILuminate mencakup 7,000+ text-image prompts
- CityBench mencakup 8 urban tasks di 13 cities
- GMAI-MMBench mencakup 39 medical image modalities
- MedBench v5 mencakup 63 clinical tasks
Artinya bagi saya sederhana: alat yang luas membantu pelacakan regresi, sementara uji domain menangkap kegagalan berisiko tinggi yang terlewat oleh benchmark generik. Jika saya butuh pemeriksaan rilis yang cepat, saya akan mengandalkan penilaian numerik terlebih dahulu. Jika saya butuh pembacaan yang lebih cermat sebelum peluncuran, saya akan menambahkan tinjauan berbasis juri dan pengujian domain.

Melampaui Teks - Evaluasi AI Multimodal
Perbandingan Singkat
| Framework | Jenis input utama | Penggunaan utama | Celah utama |
|---|---|---|---|
| FlagEvalMM | Teks, gambar, video | Benchmarking multimodal umum | Tidak ada pemeriksaan keamanan bawaan; tidak ada audio |
| MAEV | Audio, video, teks | Pengujian fusi audio-visual | Tidak ada pemeriksaan keamanan atau stabilitas |
| AILuminate Multimodal | Teks, gambar | Keamanan dan red teaming | Penyiapan lebih berat; batasan akses dataset |
| CityBench | Street view, satelit, peta, data kota | Penalaran urban dan tugas pengambilan keputusan | Cakupan domain sempit |
| Framework kesehatan | Citra medis, teks, data klinis multi-giliran | Validasi klinis | Beban tinjauan berat; audio masih hilang |
Jadi jika Anda memilih dengan cepat, saya akan berpikir dalam dua lapisan:
- Benchmark umum untuk pelacakan antar-versi
- Benchmark domain atau keamanan untuk keputusan ship/no-ship
Itulah inti utama dari artikel ini.
1. FlagEvalMM

FlagEvalMM adalah framework open-source milik BAAI untuk evaluasi multimodal. Framework ini bekerja dengan teks, gambar, dan video. Tugas intinya meliputi VQA, pengambilan gambar, pembuatan teks-ke-gambar, dan evaluasi diagram berbasis ROME. Audio bukan bagian dari paket, sehingga alur kerja yang mengutamakan audio berada di luar kemampuannya.
Fokus Evaluasi
Ketika pekerjaan sangat bergantung pada penalaran, FlagEvalMM juga mendukung evaluasi LLM-judge untuk penalaran diagram. Framework ini juga mencakup RelScene dan LRM-Eval, yang memperluas jangkauannya ke pemahaman adegan dan penilaian yang sarat penalaran.
Cakupan Keamanan dan Keadilan
Pada pemeriksaan kepercayaan dan kebijakan, ada celah: framework ini tidak dilengkapi pemeriksaan keamanan, keadilan, atau halusinasi bawaan.
Kecocokan Penerapan
Model zoo FlagEvalMM mendukung inferensi lokal untuk model open-source seperti QwenVL, LLaVA, dan Janus. Framework ini juga mendukung evaluasi berbasis API untuk model seperti GPT, Claude, dan HuanYuan. Selain itu, framework ini menambahkan dukungan OpenRouter, yang memberi tim lebih banyak opsi API di satu tempat.
Penyiapan itu bekerja baik untuk tim yang ingin membandingkan model multimodal lokal maupun hosted dalam satu framework. Jika tim Anda juga membutuhkan evaluasi audio atau pengujian keamanan bawaan, Anda akan memerlukan alat tambahan di sampingnya.
2. MAEV
MAEV memperluas evaluasi melampaui penyiapan yang hanya berbasis penglihatan dengan menguji fusi audio-video-teks.
Cakupan Modalitas
MAEV, yang juga disebut MAVERIX, dipublikasikan pada 14 Maret 2026. Framework ini menguji video, audio, dan teks secara bersamaan. Dataset-nya mencakup 2,556 questions dari 700 videos, dan menggunakan format pilihan ganda maupun terbuka [2]. Untuk mendapatkan jawaban yang benar, sebuah model harus menggabungkan apa yang dilihatnya dengan apa yang didengarnya.
Fokus Evaluasi
Benchmark ini melihat pemahaman lintas-modal dalam tugas agentic. Secara sederhana, model tidak bisa sekadar mengenali objek atau mentranskripsi ucapan. Model harus memadukan sinyal audio dan video untuk membuat keputusan.
Celah itu masih cukup besar. Pakar manusia mencetak 92.8% pada MAEV, sementara model teratas seperti Qwen 2.5 Omni dan Gemini 2.5 Flash-Lite berada di sekitar 64%. Itu selisih hampir 29 poin persentase [2]. Karena itu, MAEV berguna untuk mengetahui di mana fusi audiovisual mulai gagal.
Cakupan Keamanan dan Keadilan
MAEV tidak menyertakan pemeriksaan khusus untuk keamanan, keadilan, atau ketahanan.
Kecocokan Penerapan
MAEV dilengkapi toolkit publik dan protokol terstandardisasi, yang membantu tim menjalankan benchmark dengan cara yang sama setiap kali [2]. Framework ini cocok untuk tugas video agentic yang bergantung pada konteks audio-visual. Framework ini kurang berguna untuk evaluasi spesifik domain [2].
3. AILuminate Multimodal

Tidak seperti benchmark sebelumnya, AILuminate melihat apakah model multimodal aman, bukan hanya apakah kinerjanya bagus.
Cakupan Modalitas dan Fokus Evaluasi
AILuminate Multimodal memeriksa risiko keamanan teks-gambar di 12 kategori bahaya. Cakupannya berkisar dari kekerasan dan menyakiti diri sendiri hingga ujaran kebencian, privasi, dan kasus sensitif konteks seperti nasihat kesehatan atau pemilu. Dataset pilot multimodal-nya mencakup 7,000+ text-image prompts [4], dan benchmark ini telah digunakan untuk menguji 109 model berbeda.
Salah satu hal yang membedakannya adalah cara menangani bahasa. Alih-alih mengandalkan terjemahan, AILuminate menggunakan prompt yang ditulis untuk relevansi lokal dan kemudian diperiksa oleh penutur asli dalam bahasa Hindi, Tamil, Melayu, Korea, dan Jepang [4]. Itu penting. Sebuah prompt yang berhasil dalam satu bahasa bisa dipahami sangat berbeda dalam bahasa lain, terutama dalam pengujian keamanan.
Jadi meskipun benchmark ini bisa menghasilkan skor, framework ini lebih berguna untuk red teaming daripada untuk perbandingan benchmark yang luas.
Cakupan Keamanan dan Keandalan
AILuminate dibangun untuk red teaming dan audit keamanan pra-penerapan, terutama untuk chatbot konsumen dan asisten vision-language yang digunakan di pasar global. Metodenya dibangun di atas riset MSTS dari 2025 [4].
Secara sederhana, ini adalah jenis framework yang Anda gunakan ketika kegagalan keamanan punya biaya nyata. Jika sebuah model memberi nasihat berisiko, salah menangani gambar pribadi, atau merespons buruk dalam situasi berisiko tinggi, benchmark ini dibangun untuk menyingkap titik-titik lemah tersebut sebelum peluncuran.
Kecocokan Penerapan
Menggunakan AILuminate membutuhkan lebih banyak upaya daripada alat validasi ringan. Penilaian memerlukan Modelbench dan ansambel evaluator keamanan, dan dataset lengkap terbatas untuk anggota MLCommons [5]. Itu membuat framework ini lebih berat dan lebih lambat untuk dipraktikkan.
Framework ini paling cocok dalam situasi kritis-keamanan, di mana pemeriksaan yang lebih dalam lebih penting daripada kecepatan. Untuk tinjauan keamanan versi-per-versi, ini adalah pilihan yang kuat, tetapi kurang praktis ketika tim membutuhkan pengujian cepat di banyak pembaruan model.
4. CityBench

Di mana framework sebelumnya melihat kinerja multimodal yang luas dan keamanan, CityBench berfokus pada penalaran urban.
Cakupan Modalitas dan Fokus Evaluasi
CityBench memeriksa apakah sebuah model dapat membaca adegan urban, menalar data geospasial, dan membuat keputusan dalam situasi kota yang bergerak cepat. Kekuatannya adalah penalaran skala kota, bukan jangkauan multimodal yang luas.
Untuk melakukannya, CityBench menyatukan citra satelit, gambar street-view, jaringan jalan, POI/AoI, arus asal-tujuan, dan catatan check-in untuk menguji penalaran visual dan geospasial [7]. Framework ini mencakup 8 urban tasks dalam dua kelompok: persepsi dan pengambilan keputusan [7]. Itu mencakup tugas seperti GeoQA, geolokalisasi, prediksi mobilitas, dan kendali sinyal lalu lintas [7].
Penyiapan CityData/CitySimu-nya melangkah lebih jauh. Penyiapan ini memodelkan dinamika urban yang terperinci dan mendukung pengujian closed-loop untuk tugas pengambilan keputusan [7]. Secara sederhana, artinya Anda dapat menguji bagaimana sebuah model merespons ketika kondisi kota terus berubah alih-alih menilainya hanya dari input statis. Benchmark ini juga telah dijalankan terhadap 30 LLM dan VLM untuk menetapkan kinerja dasar [7].
Cakupan Keamanan dan Keadilan
Padukan dengan tinjauan keamanan dan keadilan terpisah.
Kecocokan Penerapan
CityBench cocok dengan baik untuk riset AI urban dan pekerjaan smart-city, termasuk optimasi lalu lintas, peramalan mobilitas, dan perencanaan kota [7]. Framework ini juga mencakup 13 kota global [7], yang memberi tim basis pengujian lebih luas daripada penyiapan satu kota.
Meski begitu, ini adalah benchmark khusus. Dibangun untuk tugas skala kota, bukan tugas manusia sehari-hari. Framework ini juga tidak mencakup navigasi berbasis gerakan sudut-pandang-orang-pertama. Dan ada celah lain yang perlu dicatat: benchmark urban yang ada seperti CityBench sering terbatas pada input tampilan tunggal dan tidak sepenuhnya menguji penalaran lintas-tampilan antara citra tingkat jalan dan citra satelit [6].
Jadi cara terbaik menggunakan CityBench adalah sebagai lapisan spesifik domain. Framework ini bekerja baik ketika ditambahkan ke tumpukan evaluasi yang lebih besar, tetapi tidak seharusnya menjadi satu-satunya benchmark multimodal Anda.
5. Framework Evaluasi Multimodal Terintegrasi Berorientasi Kesehatan
Setelah benchmark umum dan spesifik domain, model kesehatan membutuhkan uji yang lebih ketat untuk risiko klinis, penalaran longitudinal, dan fusi modalitas. Dalam kesehatan, kesalahan tidak hanya menurunkan skor. Kesalahan dapat memengaruhi diagnosis dan pengobatan. Jadi beberapa framework dibangun untuk penggunaan klinis, dan masing-masing mengejar jenis kegagalan yang berbeda.
Cakupan Modalitas dan Fokus Evaluasi
Untuk cakupan pencitraan, GMAI-MMBench adalah framework terluas dalam kumpulan ini. Framework ini mencakup 39 medical image modalities di 18 departemen klinis dan menarik dari 285 dataset [10]. Framework ini menilai model pada empat tingkat perseptual: gambar, box, mask, dan contour [10].
MedAtlas mengejar titik lemah umum dalam benchmarking medis: banyak benchmark masih berfokus pada tugas gambar-tunggal, giliran-tunggal alih-alih penalaran klinis multimodal yang longitudinal [8]. Framework ini menguji penalaran lintas kunjungan dan tanya-jawab visual multi-giliran, menanyakan apakah sebuah model dapat menggabungkan temuan pencitraan dengan riwayat pasien untuk mendukung diagnosis [8].
MedBench v5 mencakup sistem bahasa, vision-language, dan agent di 63 clinical tasks [9]. Yang menonjol adalah pengujian tekanannya. Framework ini menyisipkan temuan yang hilang atau bertentangan untuk melihat apakah model menangkap ketidakcocokan atau justru terus berjalan [9]. Asclepius menambahkan keluasan lintas spesialisasi, dengan cakupan 15 spesialisasi medis, 8 kapasitas diagnostik, dan 79 bagian tubuh, berdasarkan 3,232 pertanyaan multimodal asli [11].
Cakupan Keamanan dan Keadilan
MedBench v5 menyertakan SafetyAgent yang memeriksa misinformasi medis, perintah alat berbahaya, kebocoran privasi, dan pelanggaran etika [9]. Framework ini juga melacak klaim yang tidak didukung yang terbawa lintas giliran [9]. Uji tekanannya terutama menyasar deteksi kontradiksi, pembaruan diagnosis, dan kendali halusinasi [9].
GMAI-MMBench menunjuk pada masalah keamanan yang berbeda: beberapa model menolak menjawab pertanyaan klinis karena protokol keamanan bawaan, yang dapat mengurangi penggunaan klinis dalam praktik [10].
Satu celah muncul di keempat framework: audio masih hilang sebagai modalitas terintegrasi utama [8][9][10][11].
Kecocokan Penerapan
Setiap framework sejalan dengan mode kegagalan klinis yang berbeda, jadi pilihan yang tepat bergantung pada pekerjaan yang dihadapi.
| Framework | Beban Kerja Paling Cocok |
|---|---|
| GMAI-MMBench | Asisten diagnostik interaktif yang butuh penilaian tingkat box, mask, atau contour [10] |
| MedAtlas | Kasus yang membutuhkan integrasi multi-gambar dan riwayat pasien [8] |
| MedBench v5 | Dukungan keputusan kritis-keamanan dan agent klinis [9] |
| Asclepius | Validasi spesifik-spesialisasi dalam radiologi dan patologi [11] |
Tradeoff-nya jelas: semakin luas cakupan sebuah framework, semakin berat pula beban validasinya.
Kelebihan dan Kekurangan
Tabel di bawah merangkum tradeoff utama: cakupan, gaya penilaian, dan kecocokan domain. Tradeoff itu paling penting ketika sebuah tim perlu menyaring versi model baru dengan cepat tanpa terlalu banyak mengorbankan cakupan. Anggap ini sebagai panduan penyaringan rilis, bukan daftar alat serba guna.
| Framework | Kelebihan | Kekurangan | Paling Cocok Untuk |
|---|---|---|---|
| FlagEvalMM | Cakupan multimodal luas; memisahkan inferensi dari evaluasi | Penilaian pembuatan otomatis masih belum sempurna - VQAScore berkorelasi dengan penilaian manusia pada 0.76 untuk konsistensi prompt [12] | Tim yang menjalankan benchmark pemahaman dan pembuatan dalam pipeline yang sama |
| MAEV | Menguji fusi audio-video-teks dalam tugas agentic; protokol terstandardisasi mendukung run yang dapat direproduksi [2] | Tidak ada pemeriksaan khusus keamanan, keadilan, atau ketahanan [2] | Tugas video agentic yang bergantung pada konteks audiovisual |
| AILuminate Multimodal | Mencakup 12 kategori bahaya di 7,000+ text-image prompts; tinjauan prompt penutur asli dalam 5 bahasa [4] | Membutuhkan Modelbench dan ansambel evaluator keamanan; dataset lengkap terbatas untuk anggota MLCommons [5] | Audit keamanan pra-penerapan dan red teaming untuk model vision-language |
| CityBench | Menguji 8 urban tasks di 13 kota global; mendukung evaluasi pengambilan keputusan closed-loop [7] | Khusus hanya untuk tugas skala kota; tidak mencakup navigasi berbasis gerakan sudut-pandang-orang-pertama [7] | Riset AI urban, optimasi lalu lintas, dan aplikasi smart-city |
| Framework berorientasi kesehatan | Dibangun untuk validasi klinis yang teregulasi | Overhead validasi berat; cakupan berkurang saat model menolak prompt klinis | Validasi klinis kritis-keamanan |
Pembagian terbesar bermuara pada penilaian numerik yang cepat versus penilaian semantik yang lebih lambat.
Metrik numerik cepat dan dapat direproduksi, yang membuatnya cocok untuk pemeriksaan CI. Tetapi kecepatan punya jebakan: metrik ini bisa melewatkan kesalahan komposisional. Sebuah model mungkin terlihat baik di atas kertas namun tetap gagal dengan cara yang penting begitu keluarannya menjadi lebih terbuka.
Framework yang mengandalkan LLM-as-Judge lebih baik dalam penilaian semantik terbuka [1][3]. Itu membuatnya lebih berguna ketika Anda perlu memeriksa nuansa, bukan sekadar menghitung jawaban yang benar. Kekurangannya cukup jelas: mereka menambah biaya, dan tetap bisa membawa kesalahan evaluasi ke dalam proses.
Untuk tim yang membutuhkan baik kecepatan maupun tinjauan lebih dalam, penyiapan terpisah biasanya paling masuk akal:
- Gunakan metrik numerik untuk pemeriksaan CI
- Gunakan penilaian semantik sebelum rilis besar
Dengan begitu, Anda mendapat sinyal lulus/gagal yang cepat di awal, lalu pembacaan lebih cermat sebelum versi diluncurkan.
Kesimpulan
Disandingkan, framework-framework ini memperjelas satu hal: pengujian multimodal jatuh ke empat keranjang utama - kasus penggunaan umum, keamanan, urban, dan klinis.
FlagEvalMM dan MAEV adalah pilihan terkuat untuk evaluasi multimodal yang luas. AILuminate Multimodal dibangun untuk pengujian keamanan. CityBench adalah yang paling cocok untuk penalaran urban. Dan framework kesehatan berfokus pada validasi klinis.
Tradeoff-nya tetap sama di antara semuanya: cakupan luas lebih mudah diskalakan, tetapi benchmark khusus lebih baik dalam menangkap kegagalan berisiko lebih tinggi.
Penyiapan praktisnya sederhana:
- Gunakan satu benchmark luas untuk pelacakan regresi
- Gunakan satu benchmark spesifik domain untuk penyaringan rilis
Penyiapan terbaik bermuara pada mencocokkan benchmark dengan mode kegagalan yang perlu Anda tangkap.
FAQ
Bagaimana cara memilih antara benchmark umum dan benchmark spesifik domain?
Jangan pilih salah satu dan abaikan yang lain - gunakan keduanya.
Mulailah dengan benchmark umum untuk mempersempit medan dan menetapkan baseline. Mereka adalah pemeriksaan awal yang baik.
Lalu bangun set evaluasi kustom menggunakan data Anda sendiri. Untuk alur kerja khusus, set uji itu - terutama ketika mencakup kasus tepi dan mode kegagalan - memberi Anda pembacaan yang jauh lebih baik tentang bagaimana sebuah model akan berkinerja dalam produksi daripada skor benchmark saja.
Kapan saya harus menggunakan penilaian numerik alih-alih tinjauan berbasis juri?
Gunakan penilaian numerik ketika Anda membutuhkan sistem yang cepat dan dapat diulang dalam pipeline otomatis. Ini cocok untuk penyaringan CI/CD karena Anda dapat membuat keputusan lulus/gagal tanpa berhenti untuk tinjauan manusia. Pendekatan ini bekerja paling baik untuk penyelarasan semantik dan benchmark standar, di mana akurasi dapat diukur dengan cara yang jelas dan objektif.
Gunakan tinjauan berbasis juri untuk pekerjaan yang bergantung pada nuansa. Itu termasuk hal seperti estetika, nada, atau keputusan spesifik domain dalam kedokteran, hukum, dan keuangan, di mana penilaian ahli masih penting.
Framework mana yang terbaik untuk menguji model multimodal berkemampuan audio?
Itu tergantung pada apa yang Anda uji.
AU-Harness lebih cocok untuk evaluasi audio-ke-teks dalam Large Audio Language Models. lmms-eval adalah pilihan yang lebih luas. Framework ini mendukung tugas audio, teks, gambar, dan video, sehingga berguna ketika pengujian Anda melampaui audio saja.
Untuk penalaran audio-visual, AVI-Bench dan MAVERIX dibangun untuk memeriksa seberapa baik model menggabungkan input suara dan visual. Jika Anda ingin satu lapisan untuk mengikat model-model ini ke dalam penyiapan pengujian Anda, APIMart dapat membantu menyatukan akses di seluruh pipeline.
Pilih model yang Anda inginkan di marketplace model
Coba model chat, gambar, dan video di marketplace model APIMart, lalu rasakan kemampuan model dengan cepat melalui satu API terpadu.