📑 投影片連結:
當前挑戰
在真實世界的攝影場景中,圖像受損往往不是單一純粹的物理現象,例如夜間大雨通常伴隨著環境微光與地面水氣造成的薄霧。然而,現有的影像修復(Image Restoration, IR)架構主要停留在以下兩類範式:
- One-to-One(專病專治):去雨模型只能去雨、去霧模型只能去霧。在複合場景下串聯多個模型容易造成誤差累積與過度平滑。
- One-to-Many(多合一但單一輸入):雖然一個模型能共享權重處理多種退化,但前提是「輸入圖片只能有一種退化」。當輸入同時出現雨和霧時,模型無法辨識多重退化的優先順序與耦合關係,容易產生偽影。
傳統 One-to-One 與 One-to-Many 無法應對同時發生的多重退化
現有網路缺乏能夠在單次前向推論(Single-forward Pass)中同時辨識並分離多重退化特徵的統一機制。
缺乏符合物理光學規律的複合退化大型基準數據集
社群過去缺乏大規模且合乎光學衰減順序的複合退化資料集,多數研究僅能用隨機疊加雜訊的方式合成數據,與真實物理成像相去甚遠。
小筆記:複合退化的光學成像物理順序
光線在現實世界中的退化是有先後順序的:
先有局部光照不足,再穿過雨雪粒子,最後經由大氣散射到達鏡頭。若顛倒生成順序,合成出來的圖像在光學上是不合理的。
主要貢獻
這篇論文提出了 OneRestore,開創了 One-to-Composite 修復範式,並構建了首個大規模複合退化基準資料集 CDD-11。
解決: 傳統 One-to-One 與 One-to-Many 無法應對同時發生的多重退化
OneRestore 提出了場景描述子引導的 Transformer 修復架構:
- 場景描述子生成(Scene Descriptor):
– 文本嵌入:使用 GloVe 生成基礎場景詞向量,並透過平均聚合構建複合場景的語義向量。
– 視覺特徵對齊:利用 ResNet-18 提取圖像特徵,與場景文本向量計算餘弦相似度,輸出退化場景權重。
– 同時支援手動指定(Text-guided)與自動盲識別(Blind Restoration)雙模式。 - Cross-Attention 特徵調配:將場景描述子注入 Transformer 骨幹的各個 Block 中,自適應調控對不同退化因子的去除權重。
- 複合對比損失(Composite Contrastive Loss):結合 Smooth L1、MS-SSIM 與特別設計的複合對比約束,確保修復特徵朝清晰目標靠攏,同時推遠各類複合退化特徵。
解決: 缺乏符合物理光學規律的複合退化大型基準數據集
作者構建了 CDD-11 (Composite Degradation Dataset):
– 涵蓋 4 種基本退化因子:低光(Low-light, L)、霧霾(Haze, H)、降雨(Rain, R)、大雪(Snow, S)。
– 排除自然界極為罕見的「雨+雪」組合,定義出 11 種代表性場景(4 種單一退化 + 7 種複合退化,如 L+R、L+H、R+H、L+R+H 等)。
– 嚴格依照 Retinex/LIME
雨雪紋理疊加
大氣散射模型(Atmospheric Scattering)的物理鏈條合成,共收錄 15,213 張高解析度成對圖像。
延伸探討
手動 Prompt 指定與盲修復模式
OneRestore 的一大亮點在於其靈活性:
– 在一般使用者場景下,模型能自動判定輸入圖片中的複合退化並進行盲修復。
– 在特定專業場景下(例如使用者只想保留霧感但去除雨絲),使用者可手動輸入 Prompt 描述子,引導模型進行選擇性的單項或多項修復。
心得
在 OneRestore 之前,學界所謂的「All-in-One 影像修復」大多有名無實——本質上只是把不同單一任務的資料集混在一起 train,遇到一張「又暗、又有雨、又有霧」的照片依然束手無策。
OneRestore 真正的貢獻在於把「複合退化(Composite Degradation)」這件事制度化:從光學物理生成的 CDD-11 資料集,到場景描述子引導的 Transformer 架構,為 Low-level Vision 開闢了一個更貼近真實世界落地需求的全新賽道。