Survey: Universal Image Enhancement with Selective Enhancement Module (URIE)

2026-08-16
| ECCV 2020

Taheri et al.

當前挑戰

在真實世界的戶外視覺辨識場景中,攝影機拍攝到的畫面往往夾雜著天氣劣化(雨、霧、雪)、感光元件噪聲、運動模糊、逆光過曝以及壓縮失真等多重複合退化。現有影像處理系統在面對這些野生退化時面臨三大痛點:

傳統影像修復模型過度肥大且計算繁重

大部分的影像修復(IR)網路結構都太肥(heavy computation),動輒包含數千萬參數與多層深層卷積,推論延遲極高。若直接將這類龐大的修復模型掛載在即時辨識系統的前端,會造成嚴重的延遲與硬體資源浪費。

專病專治難以應對真實世界多種複合退化疊加

傳統去噪、去霧或超解析演算法多半針對「單一已知退化」進行數學建模與訓練。然而真實環境下的退化往往是隨機疊加的複合失真,單一專病專治的模型在面對混合退化或未見過的失真類型時,性能往往急劇下滑。

真實世界複雜退化與下游辨識示意圖
真實場景中的影像退化往往是複合且未知的,傳統針對單一退化的修復方法難以兼顧各類失真與下游識別需求。

傳統修復以人類視覺感知指標為重,對下游辨識任務缺乏效益

過去的 IR 模型幾乎都以人類感知指標(如 PSNR、SSIM、LPIPS)或最小均方誤差(MSE Loss)為優化核心。然而「人眼看得舒服」並不等於「神經網路容易辨識」;有時為了消除噪聲而抹平邊緣,反而會破壞下游分類器(如 ResNet)賴以判斷物體輪廓的高頻特徵。


主要貢獻

URIE (ECCV 2020) 提出了一種極度輕量、即插即用(Plug-and-Play)且專為下游辨識任務設計的通用影像增強模組:

解決: 傳統影像修復模型過度肥大且計算繁重

URIE 設計為一個小巧的前置外掛模組,在訓練時將下游預訓練模型(如 ImageNet 上的 ResNet-50)權重完全凍結(Freeze),僅微調 URIE 模組自身。其參數量極少,能夠無縫插在任何現有視覺系統前方,以極低的計算開銷即時清理退化特徵。

解決: 專病專治難以應對真實世界多種複合退化疊加

作者提出了選擇性增強模組(Selective Enhancement Module, SEM),利用 Batch Normalization (BN) 與 Instance Normalization (IN) 構建一對互補且具多樣性的特徵分支:
Instance Normalization (IN):在風格遷移(Style Transfer)中常用於剝離風格保留語義。在此處,作者將圖像退化視為一種異常的「Style」,透過 IN 消除特定退化帶來的統計分佈偏移。
Batch Normalization (BN):保留了跨樣本的退化分佈特徵,保存全局資訊以與 IN 互補。
空間區塊注意力加權:將 IN 與 BN 的特徵圖相加後切分為 4 \times 4 個空間 Patches,經由 Fully-Connected 層與 Softmax 計算動態注意力權重向量 s_{\text{in}}s_{\text{bn}}

選擇性增強模組 SEM 整體架構
Selective Enhancement Module (SEM) 架構。結合 IN 與 BN 分支,透過動態注意力機制調配局部 Patch 的正規化特徵。
IN 與 BN 注意力 Softmax 計算流程
特徵切塊後透過 FC 層與 Softmax 預測各 Patch 針對 IN 和 BN 的融合權重。
  • 最終將預測的注意力矩陣還原至特徵圖尺度,與原本的 IN、BN 特徵進行加權相加,讓模型能夠自主學習在影像的不同空間區域究竟該依賴 IN 還是 BN。
空間 Patch 注意力加權融合特徵
將注意力權重乘回原特徵圖相加,達成自適應的空間退化濾除。

小筆記:IN 與 BN 的互補性
IN 對單張影像做歸一化,擅長抹除局部的噪點與光影不均(去風格);BN 依賴批次統計量,擅長保留物體原本的全局對比與宏觀結構。兩者透過 4 \times 4 Patch 注意力結合,等於在局部做彈性濾波。

解決: 傳統修復以人類視覺感知指標為重,對下游辨識任務缺乏效益

作者採用了任務導向的端到端訓練策略(Task-Driven Optimization)
– 在 ImageNet-C 數據集上訓練(包含 19 種不同退化與 5 種強度等級),選取 15 種作為訓練期見過(Seen)的退化,4 種保留為未見過(Unseen)的退化,並同時加入乾淨圖片避免模型對退化產生偏差。
– 訓練 Loss 完全以下游任務的分類交叉熵(Cross-Entropy)為主,而非像素級 MSE。

ImageNet-C 訓練與驗證數據劃分
訓練策略劃分——在 ImageNet-C 上混合乾淨影像與 15 種 Seen 退化進行訓練,並以 4 種 Unseen 退化驗證泛化能力。

延伸探討

實驗結果:下游任務要做好,Loss 就該以下游任務為重

論文比較了 SOTA 修復模型 OWAN、強調像素重建的 URIE-MSE,以及強調下游分類的 URIE:

各模型在不同退化條件下的分類表現
在 Clean、Seen 與 Unseen 退化測試集上的分類準確率比較。
URIE 與既有 SOTA 模型的詳細指標對比
URIE 在各項退化條件下均取得最高的分類正確率。

實驗數據顯示:
乾淨圖像 (Clean):OWAN > URIE > URIE-MSE
見過退化 (Seen):URIE > URIE-MSE \approx OWAN
未見過退化 (Unseen):URIE > OWAN > URIE-MSE

修復視覺效果與 MSE/SSIM 指標反思
視覺重建效果對照。URIE 的 MSE 和 SSIM 雖然在數值上不如傳統修復模型漂亮,但在邊緣與特徵保留上卻最有利於分類器識別。

這印證了一個重要結論:專注於 MSE/SSIM 數值修復的模型,往往會平滑掉高頻特徵;而以分類 Loss 引導的 URIE,即便輸出影像在像素誤差上不算最完美,卻能最大限度保留語義特徵,在 Seen 與 Unseen 退化下皆取得最佳辨識準確率。


心得

很多做影像修復的人常有一種思維慣性:覺得只要把 PSNR/SSIM 刷高,下游任務(辨識、檢測)就一定會變好。

URIE 給了一個很響亮的警鐘——人眼喜歡的平滑圖片,分類網路不一定買單。透過極簡的 IN/BN 組合與下游 Task Loss 導向,URIE 用極小的計算量在複合退化場景下大幅拉升了辨識率。這種「以終為始」、專注於下游任務需求的架構設計,在邊緣運算與工業視覺落地中非常實用。