Upgrade to Pro — share decks privately, control downloads, hide ads and more …

[MIRU26] To What Extent Does MLLM-as-a-Judge Ex...

Sponsored · SiteGround - Reliable hosting with speed, security, and support you can count on.

[MIRU26] To What Extent Does MLLM-as-a-Judge Exhibit Cross-Model Preference Bias?

More Decks by Semantic Machine Intelligence Lab., Keio Univ.

Other Decks in Technology

Transcript

  1. MLLM-as-a-Judgeのモデル選好バイアスを調べるため ⼤規模データセットを構築した Gemini ”A beekeeper works in a workshop filled

    with large stacks of unassembled wooden beehives.” 100 ハルシネーションを 誤って⾼く評価 80 60 40 20 0 GPT-4o Gemini2.5-Pro Qwen2.5 Molmo Eagle2 🌋 🌋 🌋 LLaVALLaVA- LLaVA-1.5 InternVL DeepSeek Gemma3 Phi-3.5-V OV NeXTVicuna -3-
  2. MLLM-as-a-Judgeのモデル選好バイアスを調べるため ⼤規模データセットを構築した データセットを構築 J 130万評価 / 5.4万キャプション / 4,500画像 Gemini

    ”A beekeeper works in a workshop filled with large stacks of unassembled wooden beehives.” 100 ハルシネーションを 誤って⾼く評価 80 1. 代表的なMLLM-as-a-Judgeは モデル選好バイアスを有する 2. 画像の複雑性はバイアスを増幅 3. スタッキングでバイアスを軽減可 60 40 cf. [Wada+, CVPR24] [Matsuda+, EMNLP25] [Hirano+, AAAI26] 20 0 GPT-4o Gemini2.5-Pro Qwen2.5 Molmo Eagle2 🌋 🌋 🌋 LLaVALLaVA- LLaVA-1.5 InternVL DeepSeek Gemma3 Phi-3.5-V OV NeXTVicuna -4-
  3. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 ① 各MLLMがGeneratorとしてnocaps [Agrawal, ICCV19] に対しキャプションを⽣成 A black cat

    sitting in the … GPT-4o An elephant carrying … Mature grape clusters … GPT-4o GPT-4o Gemini Gemini The black cat looks … Gemini A saddled elephant… Sunlit grape vines … A small black cat sits … Qwen2.5-VL Qwen2.5-VL Qwen2.5-VL A large elephant … Clusters of apple … -5-
  4. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 Generator ② 各MLLMがEvaluatorとしてキャプションを評価 82.5 76 85 77.2 77

    54.8 55 74.3 74 83 76 85 77 55 74 83 77 81.3 81 81 66 65.9 86 8383 81 97 81 6677 79.0 7955 7474 85.8 76 85 86 81 97 81 66 79 85 80.8 97 59.8 81 55 79 88.2 86 76.4 77 85 81 60 76 88 77 81 85 97 81 81 60 66 76 79 88 86 Gemini2.5-Pro A large … 79.7 60 76 82.3 66 77.2 77 82.0 A cat… Each grape… 80 87.9 88 81 8260 7676 88.3 88 8988 77 85 81 Lush clusters… 80 88 81 77 82 88 Qwen2. Each grape… 5-VL-7B A gray … 64.0 68.9 80 69.3 88 81 66.0 A black cat… Deep purple… 64 69 8288 43.5 4481 82 6677 7782 75.7 76 8988 Each grape… 80 64 69 82 44 66 76 Molmo-Deep purple… 7B A close-up … 63 63 82 44 43 76 Deep purple… 64 69 82 44 66 76 Eagle275.9 85.6 A blackgrape… cat… Mature Mature grape… An elephant 81.3 … 96.9 The black cat… Sunlit grape… Mature grape… Sunlit grape… GPT-4o A saddled … 77.1 84.8 A small black… Lush clusters… Sunlit grape… Lush clusters… 9B 83.0 65 71.8 72 69.8 70 38.8 39 62.7 63 89 65 72 70 39 63 89 65 70 72 66 64 97 65 72 70 39 63 89 65.0 Black cat with… Clusters of… Clusters of… A side view … InternV Clusters of… L2.5-8B GPT-4o Gemini- Qwen2. Molmo2.5-Pro 5-VL-7B 7B Eagle29B Evaluator InternV L2.5-8B -6-
  5. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 列平均 82.5 75.9 85.6 77.2 54.8 74.3 82.5

    81.3 96.9 81.3 65.9 79.0 85.8 77.1 84.8 80.8 59.8 76.4 88.2 79.7 87.9 82.3 77.2 82.0 88.3 82.9 64.0 68.9 69.3 43.5 66.0 75.7 64.5 56.6 83.1 Evalの 評価⽔準 GPT-4o Generator Gemini2.5-Pro Qwen2. 5-VL-7B Molmo7B Eagle29B Evalの Genの スケール ⽣成品質 モデル選好 J 列標準化で除去 ノイズ J ⾏標準化で除去 ⾏平均 InternV L2.5-8B 65.0 GPT-4o 71.8 69.8 38.8 Gemini- Qwen2. Molmo2.5-Pro 5-VL-7B 7B 62.7 83.0 Eagle29B InternV L2.5-8B Evaluator -7-
  6. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 列平均 82.5 75.9 85.6 77.2 54.8 74.3 82.5

    81.3 96.9 81.3 65.9 79.0 85.8 77.1 84.8 80.8 59.8 76.4 88.2 79.7 87.9 82.3 77.2 82.0 88.3 82.9 64.0 68.9 69.3 43.5 66.0 75.7 64.5 GPT-4o Generator Gemini2.5-Pro Qwen2. 5-VL-7B Molmo7B Eagle29B 56.6 83.1 Evalの 評価⽔準 Eval.の評価⽔準に差 Gen.の⽣成品質に差 Evalの Genの スケール ⽣成品質 モデル選好 J 列標準化で除去 ノイズ J ⾏標準化で除去 ⾏平均 InternV L2.5-8B 65.0 GPT-4o 71.8 69.8 38.8 Gemini- Qwen2. Molmo2.5-Pro 5-VL-7B 7B 62.7 83.0 Eagle29B InternV L2.5-8B Evaluator -8-
  7. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 0.32 75.9 0.25 77.2 -0.14 54.8 85.6 -0.40

    0.10 74.3 -0.45 82.5 1.05 81.3 1.50 96.9 0.56 81.3 0.72 65.9 0.84 79.0 0.22 85.8 0.47 77.1 0.25 84.8 0.56 80.8 0.25 59.8 0.39 76.4 0.67 88.2 0.91 79.7 0.56 87.9 0.56 82.3 1.57 77.2 1.28 82.0 0.67 88.3 64.0 -1.44 -1.43 68.9 0.80 69.3 -1.00 43.5 -1.08 66.0 -2.01 75.7 65.0 -1.12 71.8 -1.30 -2.07 69.8 -1.39 38.8 -1.53 62.7 -0.89 83.0 Eagle29B InternV L2.5-8B GPT-4o Generator Gemini2.5-Pro Qwen2. 5-VL-7B Molmo7B Eagle29B InternV L2.5-8B GPT-4o Gemini- Qwen2. Molmo2.5-Pro 5-VL-7B 7B Evalの 評価⽔準 Evalの Genの スケール ⽣成品質 モデル選好 J 列標準化で除去 ノイズ J ⾏標準化で除去 Evaluator -9-
  8. Philautia-Eval: 評価⽔準・⽣成品質の違いを考慮した選好の定量化 0.32 1.24 75.9 0.25 1.01 77.2 -0.14 54.8

    85.6 -0.40 -1.16 -0.29 0.10 0.51 74.3 -0.45 -1.32 82.5 1.05 0.59 81.3 1.72 1.50 96.9 0.56 81.3 -0.64 0.72 65.9 -0.24 0.06 0.84 79.0 0.22 85.8 -1.49 0.47 0.25 77.1 -1.18 0.25 84.8 0.56 0.83 80.8 -1.18 0.25 59.8 0.39 76.4 -0.27 0.67 1.55 88.2 -0.04 0.91 79.7 -0.96 0.56 87.9 -0.96 0.56 82.3 1.69 1.57 77.2 0.93 1.28 82.0 -0.67 0.67 88.3 64.0 -1.44 -0.47 -0.46 -1.43 68.9 0.80 2.08 69.3 -1.00 0.03 43.5 -1.08 1.02 66.0 -2.01 -1.12 75.7 -0.33 -0.48 -1.06 -2.07 69.8 -1.39 38.8 -1.53 62.7 2.12 -0.89 83.0 GPT-4o Generator Gemini2.5-Pro Qwen2. 5-VL-7B Molmo7B Eagle29B InternV L2.5-8B -0.04 -0.23 65.0 -1.12 71.8 -1.30 GPT-4o Gemini- Qwen2. Molmo2.5-Pro 5-VL-7B 7B Eagle29B Evalの 評価⽔準 Evalの Genの スケール ⽣成品質 モデル選好 J 列標準化で除去 ノイズ J ⾏標準化で除去 InternV L2.5-8B Evaluator - 10 -
  9. 結果︓代表的なMLLM-as-a-Judgeは⾃⼰ / ファミリーを選好 (シェアの約90%) GPT-4o Gemini2.5-Pro Qwen2.5 -VL-7B : ⾃⼰選好度合い

    Generator Molmo-7B Eagle2-9B LLaVAOneVision -7B ! DeepSeek -VL2 Gemma3-4B-IT Phi-3.5 -Vision LLaVANeXTVicuna-7B LLaVA1.5-13B ! ! InternVL 2.5-8B ! ! !! GPT-4o Gemini2.5-Pro Qwen2.5 Molmo-7B Eagle2-9B LLaVADeepSeek Gemma-VL-7B OneVision -VL2 3-4B-IT -7B Evaluator ! !! Phi-3.5 -Vision LLaVA- LLaVANeXT1.5-13B Vicuna-7B !! InternVL 2.5-8B - 11 -
  10. 結果︓代表的なMLLM-as-a-Judgeは⾃⼰ / ファミリーを選好 (シェアの約90%) QwenベースのMLLMは相互選好 仮説: エンコーダ・バックボーンが共通 GPT-4o Gemini2.5-Pro Qwen2.5

    -VL-7B : ⾃⼰選好度合い Generator Molmo-7B Eagle2-9B LLaVAOneVision -7B ! DeepSeek -VL2 ! Gemma3-4B-IT Phi-3.5 -Vision LLaVANeXTVicuna-7B LLaVA1.5-13B ! ! ! ! ! ! InternVL 2.5-8B !! GPT-4o Gemini2.5-Pro Qwen2.5 Molmo-7B Eagle2-9B LLaVADeepSeek Gemma-VL-7B OneVision -VL2 3-4B-IT -7B Evaluator ! !! Phi-3.5 -Vision LLaVA- LLaVANeXT1.5-13B Vicuna-7B InternVL 2.5-8B ! !! !! ! !! - 12 -
  11. リスク︓どのモデルも特定のモデルを逆選好してしまう Generator GPT-4oと GPT-4o GPT-4o Gemini2.5-Pro Gemini2.5-Pro Qwen2.5 -VL-7B Qwen2.5

    -VL-7B Molmo-7B Molmo-7B Eagle2-9B Eagle2-9B LLaVAOneVision -7B ! ! LLaVAOneVision -7B DeepSeek -VL2 DeepSeek -VL2 Gemma3-4B-IT Gemma3-4B-IT Phi-3.5 -Vision Phi-3.5 -Vision LLaVANeXTVicuna-7B LLaVA1.5-13B ! ! ! ! InternVL 2.5-8B LLaVANeXTVicuna-7B LLaVA1.5-13B ! ! !! GPT-4o Gemini2.5-Pro DeepSeekは相互選好 ! ! → → ! ! InternVL 2.5-8B ! Qwen2.5 Molmo-7B Eagle2-9B LLaVADeepSeek Gemma-VL-7B OneVision -VL2 3-4B-IT -7B Evaluator Phi-3.5 -Vision !! ! !! ! LLaVA- LLaVANeXT1.5-13B Vicuna-7B InternVL 2.5-8B ! GPT-4o Gemini2.5-Pro ! ! !! !! Qwen2.5 Molmo-7B Eagle2-9B LLaVADeepSeek Gemma-VL-7B OneVision -VL2 3-4B-IT -7B Evaluator Phi-3.5 -Vision LLaVA- LLaVANeXT1.5-13B Vicuna-7B InternVL 2.5-8B - 13 -
  12. 画像の複雑性がモデル選好バイアスを増幅 画像群 参照⽂間の 類似度 (BERTScore) 複雑 0.384 1.70 中間 0.600

    1.20 単純 0.746 0.95 1. A poster for a college football team … 2. Football players from two different … 3. Two football players wearing football … 4. A football player pushes … 5. Florida State University's game line up… 6. … - 14 -
  13. 画像の複雑性がモデル選好バイアスを増幅 画像群 参照⽂間の 類似度 (BERTScore) 複雑 0.384 1.70 中間 0.600

    1.20 単純 0.746 0.95 1. A poster for a college football team … 2. Football players from two different … 3. Two football players wearing football … 4. A football player pushes … 5. Florida State University's game line up… 6. … - 15 -
  14. 画像の複雑性がモデル選好バイアスを増幅 画像群 参照⽂間の 類似度 (BERTScore) 複雑 0.384 1.70 中間 0.600

    1.20 単純 0.746 仮説 ・複雑: 注⽬候補が多い 0.95 → ・⽣成・評価時に注⽬領域が揃うと⾼評価の傾向 1. Florida State University's game line up… 2. Football players from two different …. ・ハルシネーションも共有 3. A football player pushes … 4. A poster for a college football team … ・単純: 注⽬領域がほぼ唯⼀ 5. Two football players wearing football … → ⽣成⽂が類似するため評価はぶれない - 16 -
  15. 提案⼿法は性能を維持しつつバイアスを軽減 提案: 性能が向上するモデルを貪欲に選択し,Elastic Netを学習 Nebula [Matsuda+, ACCV24] [Tong+, AAAI25] G-VEval

    モデル Qwen2.5VL-7B GPT-4o 提案⼿法 InternVL 2.5-8B + + + Eagle2-9B 🌋 LLaVAOneVision-7B DeepSeek-VL2 Flickr8k-Ex [Hodosh+, JAIR13] SelfEval-Cap (本研究で構築) ↑ ↑ 52.4 54.0 1.12 53.2 59.7 1.08 53.5 59.7 1.31 53.6 60.8 0.45 53.7 58.8 -0.19 53.5 57.3 0.15 -0.93 - 17 -
  16. 追加結果はポスターをご覧ください (#OS1E-03) • • • 評価プロンプト・モデル群に依らず⾃⼰を選好 (𝑝 < 0.05)1.5 1.5

    1.5 1.0 1.0 1.0 参照⽂がない設定でも同様のモデル選好傾向 0.5 ⾮対⾓成分 Off-diagonal entries 0.5 0.5 Off-diagonal entries Off-diagonal entries 0.0 0.0 0.0 スタッキングは単純なアンサンブルよりも良好 0.5 0.5 0.5 (a) • 参照⽂がない設定 2.0 2.0 2.0 (b) (a) (c) (a) (b) (d) (b) (c) (e) (c) (d) (f) (d) (e) (g) (e) (f)(f) (g)(g) VQA向けにDeviance Residualで拡張 [細屋, MIRU26] Nebula Flickr8k-Ex SelfEval-Cap Uniform averaging 53.7 53.1 0.32 Median 53.6 60.4 -0.40 Calibration 53.2 54.6 -0.38 提案⼿法 53.5 57.3 0.15 ⼿法 - 18 -