Survey: Frontiers in Image Restoration: Robust SAM, AutoDIR Blind Restoration, and VARFormer

2026-08-16
| Survey of multiple papers

📑 投影片連結:Progress.pptx

📌 本篇為多篇論文之綜合 Survey,涵蓋以下核心文獻:

  • Robust SAM: Robust SAM: Segment Anything Robust to Adverse Conditions (AAAI 2025) [Paper Link]
      作者:Jingwei Long, et al.
  • AutoDIR: AutoDIR: Automatic Degradation-aware Image Restoration (ECCV 2024)
      作者:Yuning Jiang, et al.
  • VARFormer: VARFormer: Adapting VAR’s Generative Prior for Image Restoration (arXiv 2024)
      作者:Shuai Wang, Feng Zhao (USTC)

當前挑戰

在探索基礎模型與自迴歸生成先驗應用於影像還原時,面臨了幾項關鍵痛點:

基礎視覺大模型全參數對抗微調成本高昂且損害良性泛化能力

Segment Anything Model (SAM) 作為視覺分割基礎模型,在零樣本(Zero-shot)任務上表現優異,但面對細微的對抗擾動時極其脆弱。若採用傳統的全參數對抗訓練(Full-Parameter Fine-Tuning),不僅需更新上億參數(如 ViT-H / ViT-B 需更新數千萬至近億參數),更會引發災難性過擬合,大幅削弱模型在未受擾動的乾淨影像上的泛化能力。

多合一影像修復難以辨識未知複合退化且容易產生結構偽影

現有多合一(All-in-One)影像修復模型在面對真實世界的未知退化或多重疊加退化(如「模糊 + 噪聲 + 低光」)時經常失效。核心原因在於:模型往往將影像的高階語義內容與低階退化特徵混淆,導致退化判斷錯誤;此外,純生成式修復在去噪過程中容易產生幻覺,破壞圖像原有的幾何邊緣結構。

視覺自迴歸模型先驗難以直接遷移至多尺度影像修復

以 VAR 為代表的視覺自迴歸模型憑藉「下一尺度預測(Next-Scale Prediction)」範式在圖像生成上超越了擴散模型。然而,如何將 VAR 預訓練模型中從粗到細的多尺度層級特徵有效引導至受損影像的頻率還原,並在複合退化場景下精確調控修復強度,在學界仍缺乏成熟的研究範式。


主要貢獻

這三篇論文分別在參數量微調、退化診斷與自迴歸先驗遷移上提出了具體的應對策略:

解決: 基礎視覺大模型全參數對抗微調成本高昂且損害良性泛化能力

Robust SAM (AAAI 2025) 提出了一種基於奇異值分解(SVD)的超輕量對抗適配方法:
SVD 奇異值微調:將預訓練權重分解為 W = U \Sigma V^T。在微調過程中,完全凍結代表正交語義空間的基底矩陣 UV,僅微調對角線上的奇異值尺度矩陣 \Sigma
參數量驟降:微調參數量從全參數微調的 93M 直接縮減至僅僅 0.5K(約 500 個參數)
優勢:奇異值矩陣負責控制各特徵方向的能量增益,微調 \Sigma 能精準壓制對抗攻擊所放大的異常特徵分量,同時完全保留基礎模型原有的語義空間與零樣本泛化能力。

小筆記:為什麼只微調奇異值 \Sigma 能防禦對抗攻擊?
對抗擾動(Adversarial Perturbation)通常並非破壞特徵語義空間的方向,而是透過高頻噪聲在特定奇異向量方向上激發出過大的響應。透過凍結基底向量 U, V,模型鎖定了自然的特徵幾何流形;僅微調奇異值 \Sigma,相當於在各主成分方向上裝上了「動態衰減器」,以極小代價消解對抗噪聲。

解決: 多合一影像修復難以辨識未知複合退化且容易產生結構偽影

AutoDIR (ECCV 2024) 構建了基於潛在擴散模型(LDM)的兩階段全自動盲修復系統:
語義無關盲品質評估 (SA-BIQA):專門提取圖像中的物理退化特徵(噪聲分佈、模糊核、曝光偏差),完全剝離影像內容的語義干擾,精準預測退化類型與複合比例。
結構校正模組 (Structural-Correction Module, SCM):在潛在擴散修復過程中,透過結構引導分支約束幾何形狀與高頻邊緣,避免擴散模型過度生成幻覺。
迭代修復機制:修復後影像自動送回 SA-BIQA 模組重新評估,若存在殘留退化則自動進行二次精細修復,實現全自動閉環。

解決: 視覺自迴歸模型先驗難以直接遷移至多尺度影像修復

VARFormer (arXiv 2024) 是將預訓練 VAR 生成先驗遷移至影像修復的首批探索之一:
Next-Scale 先驗遷移:利用預訓練 VAR Transformer 在由粗到細(1 \times 1 \to 2 \times 2 \to \dots \to 16 \times 16)各尺度上的特徵,為退化影像在不同頻率區間提供層級式的結構與紋理引導。
限制與後續改進方向:VARFormer 當時尚未引入無分類器引導(Classifier-Free Guidance, CFG)進行退化程度的精細控制,且僅評測了單一合成退化。這也為我們後續碩士論文研究(VARIR)在複合退化建模與自迴歸引導機制上指明了關鍵的突破切入點。


延伸探討

這三篇工作在我們的碩論研究脈絡中各自扮演了清晰的角色:
1. Robust SAM 啟發了我們在大型視覺模型適配時「極致參數效率(PEFT)」與「特徵空間保真」的重要性。
2. AutoDIR 驗證了「退化診斷(Blind IQA)+ 結構保護生成」在多合一複合修復中的必要性。
3. VARFormer 則開啟了「視覺自迴歸模型應用於修復」的大門,讓我們看到了在 Diffusion 之外,以 Next-Scale Autoregressive 實現更快、更可控影像修復的全新可能。