Survey: MLLMs in Low-Level Vision and Image Quality Assessment: Q-Bench, Q-Align, and DepictQA

2025-07-01
| Survey of multiple papers

📌 本篇為多篇論文之綜合 Survey,涵蓋以下核心文獻:

  • Q-Bench: Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision (ICLR 2024) [Paper Link]
      作者:Haoning Wu, Zicheng Zhang, Erli Zhang, Chaofeng Chen, Liang Liao, Annan Wang, Chunyi Li, Wenxiu Sun, Qiong Yan, Weisi Lin
  • Q-Bench+: Q-BENCH+: A Benchmark for Multi-modal Foundation Models on Low-level Vision from Single Images to Pairs (IEEE TPAMI 2024) [Paper Link]
      作者:Zicheng Zhang, Haoning Wu, Erli Zhang, et al.
  • Q-Instruct: Q-Instruct: Improving Low-level Visual Abilities for Multi-modality Foundation Models (CVPR 2024) [Paper Link]
      作者:Haoning Wu, Zicheng Zhang, Erli Zhang, et al.
  • Q-Align: Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-defined Levels (ICML 2024) [Paper Link]
      作者:Haoning Wu, Zicheng Zhang, Weisi Lin, et al.
  • DepictQA: DepictQA & DepictQA-Wild: Descriptive Image Quality Assessment through MLLMs (ECCV 2024) [Paper Link]
      作者:Zhiyuan You, Zheyuan Li, Jinjin Gu, Zhenfei Yin, Tianfan Xue, Donghao Luo
  • Comprehensive Study: A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment (ECCV 2024) [Paper Link]
      作者:Tengchao Wu, et al.

當前挑戰

將多模態大模型應用於影像品質評估與低階特徵感知時,面臨了幾項關鍵痛點:

多模態大模型缺乏低階視覺評測標準

現有的多模態 Benchmark(如 MME、MMBench)大多聚焦在問答、OCR、物體辨識等高階語義層面。對於圖像是否有失真、雜訊多寡、清晰度與動態範圍等底層物理特性,缺乏一套系統化的量化評測體系。

單張評估難以捕捉細微退化差異

人類視覺系統在判斷圖像品質時,往往透過「對比」能看出更細微的差別。然而現有評測若僅針對單張圖片給出孤立判斷,模型容易受圖片內容的語義偏差影響,難以精確衡量相對劣化程度。

開源模型缺乏低階視覺指令微調數據

多數開源 MLLM 的訓練語料集中在高階語義圖文對,這導致模型雖然能認出「這是一隻貓」,卻分不清「這隻貓的照片究竟是失焦模糊還是運動模糊」,缺乏底層退化診斷的知識儲備。

直接預測連續品質分數極其不穩定

傳統 IQA 通常要求輸出一個連續的品質分數(例如 0.0 到 100.0)。若直接以 Text Generation 的方式要求大模型生成特定浮點數,模型容易出現數字幻覺、數值分佈坍塌,在分佈外(OOD)數據上的泛化表現極差。

傳統純量分數無法提供可解釋的診斷報告

傳統 IQA 模型只給出單一數字,使用者無法得知「為什麼分數低、具體是哪裡過曝、哪裡噪點嚴重」。在實際應用中,我們更需要帶有細節說明的診斷性反饋。

提示詞策略對多模態打分效果缺乏系統性探討

在沒有專門微調的情況下,純靠 Prompting 能否激發 GPT-4V 等強大閉源模型的 IQA 潛力?業界缺乏針對心理物理學測試程序(單刺激、雙刺激)與提示策略(Standard、In-context、Chain-of-Thought)的全面性比較。

小筆記:為什麼 Logits 期望值優於直接文字輸出?
大語言模型本質上是對 Token 分佈做建模。直接要求模型輸出字串 `\”78.5\”` 會受到 Tokenizer 切分與數值自迴歸的嚴重干擾;而透過有限形容詞的 Logits 期望值計算,既能保留語言模型的分類先驗,又能平滑地映射到連續數值區間。


主要貢獻

這六篇論文相互配合,從評測、數據、訓練方法到輸出形式,給出了一套完整的解決方案:

⚠️ 原始素材未涵蓋:六篇素材皆無 Notion 補充頁面與圖片,本文不自行繪製或杜撰示意圖。

解決: 多模態大模型缺乏低階視覺評測標準

Q-Bench (ICLR 2024) 構建了首個專門針對低階視覺的多維度評測基準,劃分出三大核心維度:
1. 低階感知 (Perception – LLVisionQA):透過選擇題測試模型對清晰度、噪聲、色彩平衡與光影失真的辨別能力。
2. 低階描述 (Description – LLDescribe):評估模型能否生成結構化的圖像退化分析文字。
3. 品質評分 (Quality Assessment – IQA):測試模型在既有 IQA 數據集上的評分準確性。

解決: 單張評估難以捕捉細微退化差異

Q-BENCH+ (TPAMI 2024) 進一步將評測體系擴展至成對影像比較(Pairwise Comparison),提出了 Pairwise LLVisionQA+ 與 LLDescribe+。透過讓模型在兩張退化程度相近的圖片之間做 AB 測試與差異描述,更貼近人類在細微退化上的感知特性。

解決: 開源模型缺乏低階視覺指令微調數據

Q-Instruct (CVPR 2024) 轉向模型能力的提升,開源了兩個關鍵數據集:
Q-Pathway 數據集:首個結合人類視覺回饋機制(Human Vision Feedback)的低階視覺微調數據集。
Q-Instruct 數據集:包含 20 萬條高品質的「低階視覺指令-回答」對,讓開源 MLLM 在微調後能精準辨識各類退化類型並提供具體診斷。

解決: 直接預測連續品質分數極其不穩定

Q-Align (ICML 2024) 提出了一種極為優雅的評分思路:不要讓模型直接猜數字,而是讓它做離散等級選擇
– 將品質評級設定為 5 個文字等級(`excellent`, `good`, `fair`, `poor`, `bad`)。
– 提取模型在輸出這 5 個特定形容詞 Token 時的 Softmax 機率(Logits),透過加權期望值換算出連續的品質分數:

    \[\text{Score} = \sum_{i=1}^5 w_i \cdot P(\text{level}_i)\]


– 基於此架構推出的 ONEALIGN 統一了影像品質評估(IQA)、美學評估(IAA)與影片品質評估(VQA),在跨數據集(OOD)評估中展現了遠高於直接回歸分數的穩定度。

解決: 傳統純量分數無法提供可解釋的診斷報告

DepictQA & DepictQA-Wild (ECCV 2024) 主打「超越單純數字」(Depicting Beyond Scores)的描述性品質評估:
– 構建了 M-BAPPS 與包含 49.5 萬組圖文的 DQ-495K 數據集。
DepictQA-Wild 統一了全參考(Full-Reference, FR)與無參考(No-Reference, NR)評估,支援簡潔結論與多維度詳盡診斷兩種輸出模式,在自然語言診斷的精準度上甚至超越了 GPT-4V。

解決: 提示詞策略對多模態打分效果缺乏系統性探討

A Comprehensive Study (ECCV 2024) 系統性探討了 9 種 Prompting 組合系統:
3 種測試程序:單刺激法 (Single-stimulus)、雙刺激法 (Double-stimulus)、多刺激法 (Multiple-stimulus)。
3 種提示策略:標準提示 (Standard)、上下文少樣本提示 (In-context)、思維鏈 (Chain-of-Thought, CoT)。
研究發現:GPT-4V 在未微調的模型中表現最為突出;且引入思維鏈(CoT)引導模型先分析失真位置與成因再打分,能顯著提升在 Spearman 秩相關係數(SRCC)上的排序一致性。


延伸探討

MLLM 在 IQA 領域的主要工具矩陣

項目 代表模型 / 數據集 核心功能 適用場景
評測基準 Q-Bench, Q-Bench+ 涵蓋單圖與成對比較的全面低階視覺能力檢驗 評估 VLM 模型對雜訊、模糊與光影的感知水準
指令數據 Q-Instruct, DQ-495K 數十萬筆低階視覺圖文問答與診斷數據 微調開源模型(如 LLaVA)增強底層視覺能力
量化打分 Q-Align / ONEALIGN 透過文字等級 Logits 期望值輸出連續分數 高精度、跨數據集穩健的自動化畫質評分
文字診斷 DepictQA-Wild 輸出結構化語言報告(失真位置、嚴重度、建議) 用戶端可解釋畫質反饋、影像修復演算法調參

心得

這條從 Q-Bench 到 Q-Align / DepictQA 的演進路徑非常清晰:
1. 一開始大家發現通用大模型「看得懂語義、看不清畫質」,於是需要 Q-Bench 定義出低階視覺的評判邊界。
2. 接著發現預訓練語料不足,透過 Q-Instruct 的指令微調把低階特徵知識灌進模型。
3. 在實際打分時,Q-Align 的 Softmax Logit 期望值設計非常巧妙,避開了 LLM 預測連續數值的先天弱點。
4. 最後,DepictQA 則發揮了語言模型最大的優勢——不只給分數,還能像專業攝影師或調色師一樣,用自然語言清楚交代失真細節與改進方向。

這幾篇工作不僅讓多模態模型具備了輔助影像修復(IR)調參的能力,也為未來自動化影像生成與畫質監控提供了很扎實的基礎工具。