Survey: A Decade of Video Super-Resolution: From SRCNN, EDVR, BasicVSR to Modern Frontiers

2025-03-23
| ECCV 2014

Chao Dong, Chen Change Loy, Kaiming He, Xiaoou Tang

當前挑戰

回顧 VSR 的發展史,研究者主要在攻克四個層層遞進的技術瓶頸:

早期在雙三次插值的高解析度空間提取特徵造成計算冗餘

在深度學習超解析度初期(如 SRCNN),模型習慣先將低解析度(LR)影像透過雙三次插值(Bicubic Interpolation)放大至目標高解析度(HR)尺寸,再丟進 CNN 進行特徵提取與重建。這種作法不僅計算量隨著目標尺寸呈平方級暴增,插值帶來的先驗模糊也會干擾網路學習真實高頻細節。

顯式光流對齊在大運動與遮擋下容易產生累積誤差

影片中物體快速移動或畫面存在遮擋(Occlusion)時,傳統基於顯式光流(Explicit Optical Flow)的對齊演算法(如 SOF-VSR、VESPCN)極易出現光流估計錯誤。一旦對齊偏差,後續的影格融合模組就會把錯誤的資訊當作高頻細節疊加,在重構畫面上留下嚴重的偽影與撕裂。

時空特徵融合與傳播機制效率低且難以捕捉長程資訊

早期滑動視窗(Sliding-window)方法每次只考慮鄰近 5~7 影格,無法利用相隔十幾格以上的長期時空冗餘。而當 Transformer 引入後,全域時空自注意力的計算複雜度高達 \mathcal{O}(H^2 W^2 T),直接導致顯存爆炸與推論延遲激增。

極限動態場景與高頻震盪下常規影格資訊嚴重缺失

在高速運動、劇烈相機抖動或極低光環境下,傳統 RGB 感光元件(如 30/60 fps)拍攝的影格本身就帶有嚴重的運動模糊或影格間資訊斷層(Frame Gap),純粹依靠 RGB 相鄰影格已無法從物理上恢復遺失的高頻紋理。

小筆記:Pixel Shuffle(亞像素卷積)vs 傳統上採樣
在 ESPCN (CVPR 2016) 提出之前,超解析度模型多半使用 Transposed Convolution(反卷積)或插值進行放大,反卷積容易產生惱人的棋盤效應(Checkerboard Artifacts)。

ESPCN 提出的 Pixel Shuffle (Sub-Pixel Convolution),在 LR 特徵圖上輸出 C \times r^2 個通道,再透過週期性排列將通道維度直接折疊回空間維度 (r H, r W)。這項操作不僅零額外插值計算,更成為往後近十年超解析度網路標準的上採樣標配模組。


主要貢獻

十年來各階段代表性架構透過不同維度的創新,逐一攻克了上述難題:

⚠️ 原始素材未涵蓋:素材為純文字整理(本機筆記 + 11 個 Notion 論文頁面,但這些頁面本文皆為空),沒有附架構示意圖,本文不自行繪製或杜撰示意圖。

解決: 早期在雙三次插值的高解析度空間提取特徵造成計算冗餘

ESPCN (CVPR 2016) 首創 Pixel Shuffle(亞像素卷積),將整個特徵提取過程完全保留在 LR 空間進行,直到最後一層才一次性重組放大,推論速度提升數倍以上,奠定了現代超解析度端到端高效架構的基石。

解決: 顯式光流對齊在大運動與遮擋下容易產生累積誤差

EDVR (CVPRW 2019) 提出 PCD (Pyramid, Cascading and Deformable) 卷積對齊,捨棄脆弱的顯式光流向量,利用多尺度可變形卷積直接在特徵層面學習動態偏移量(Offset),對大運動具備極強的魯棒性。
VSR-DUF (CVPR 2018) 則大膽提出動態上採樣濾波器(DUF),完全不進行顯式運動估計,直接由網路預測每個像素位置的動態時空濾波核與殘差。

解決: 時空特徵融合與傳播機制效率低且難以捕捉長程資訊

BasicVSR (CVPR 2021) 將 VSR 解構為四大純粹核心模組:雙向循環傳播(Bidirectional Propagation)、光流特徵對齊、特徵聚合與上採樣,以極簡的 Baseline 超越了眾多複雜前作。
TTVSR (CVPR 2022) 提出軌跡感知 Transformer(Trajectory-Aware Transformer),僅沿著光流軌跡上的像素計算自注意力,將時空 Attention 複雜度從 \mathcal{O}(H^2 W^2 T) 大幅壓至 \mathcal{O}(HWT)
RVRT (NeurIPS 2022) 透過引導式可變形注意力(GDA)結合循環 Transformer,兼顧平行處理與低顯存佔用。

解決: 極限動態場景與高頻震盪下常規影格資訊嚴重缺失

EGVSR (CVPR 2023)EvTexture (ICML 2024) 引入具備微秒級超高時間解析度、高動態範圍的事件相機(Event Camera)資料流。
– 透過事件流提供的連續時間亮度變化脈衝,構建時空隱式神經表示(INR)與跨模態紋理增強,在極端快速運動與模糊場景下精準找回傳統 RGB 影格丟失的高頻邊緣。


延伸探討

VSR 十年技術演進全景總整理

階段與時期 代表架構 對齊機制 (Alignment) 融合與傳播 (Propagation) 核心突破點
早期 CNN 探索 (2014~2018) SRCNN, ESPCN, VESPCN Bicubic 插值 / 顯式光流 滑動視窗 (Sliding Window) 確立 LR 特徵提取與 Pixel Shuffle 上採樣標準
可變形卷積與無光流 (2018~2019) VSR-DUF, EDVR DUF 動態濾波 / PCD 可變形卷積 TSA 時空注意力融合 解決大運動光流崩潰,在 NTIRE 競賽大放異彩
雙向循環基準確立 (2020~2021) RSDN, BasicVSR, IconVSR 特徵級光流 Warping 雙向循環傳播 (Bidirectional Recurrent) 釐清 VSR 核心組件,建立強大通用 Baseline
時空 Transformer 時代 (2022~2023) TTVSR, RVRT 跨影格軌跡追蹤 / 引導式可變形 Attention 循環 Transformer 序列建模 降低時空注意力計算複雜度,長程記憶能力顯著提升
神經表示與神經相機 (2023~2024) EGVSR, EvTexture 事件驅動脈衝對齊 / 跨模態紋理對齊 隱式神經表示 (INR) / 紋理增強 結合微秒級事件流,攻克極限動態與模糊盲區

心得

回顧 VSR 這十年的發展,本質上就是一場「如何精準對齊並利用跨影格冗餘資訊」的認知演進史。從一開始粗暴的插值,到精巧設計的光流補償、可變形卷積,再到把精力轉向長程雙向傳播與軌跡 Attention,每一次的進展都在告訴我們:比起堆疊更深的網路,理清時空物理資訊的流動路徑才是解決問題的關鍵。

而近年事件相機(Event-based VSR)的加入更是打開了一扇新的窗戶——當傳統感測器的幀率受限於快門時間時,引入硬體層級的非同步脈衝流,從根本上顛覆了純軟體演算法在極限運動下的物理限制。