當前挑戰
回顧 VSR 的發展史,研究者主要在攻克四個層層遞進的技術瓶頸:
早期在雙三次插值的高解析度空間提取特徵造成計算冗餘
在深度學習超解析度初期(如 SRCNN),模型習慣先將低解析度(LR)影像透過雙三次插值(Bicubic Interpolation)放大至目標高解析度(HR)尺寸,再丟進 CNN 進行特徵提取與重建。這種作法不僅計算量隨著目標尺寸呈平方級暴增,插值帶來的先驗模糊也會干擾網路學習真實高頻細節。
顯式光流對齊在大運動與遮擋下容易產生累積誤差
影片中物體快速移動或畫面存在遮擋(Occlusion)時,傳統基於顯式光流(Explicit Optical Flow)的對齊演算法(如 SOF-VSR、VESPCN)極易出現光流估計錯誤。一旦對齊偏差,後續的影格融合模組就會把錯誤的資訊當作高頻細節疊加,在重構畫面上留下嚴重的偽影與撕裂。
時空特徵融合與傳播機制效率低且難以捕捉長程資訊
早期滑動視窗(Sliding-window)方法每次只考慮鄰近 5~7 影格,無法利用相隔十幾格以上的長期時空冗餘。而當 Transformer 引入後,全域時空自注意力的計算複雜度高達
,直接導致顯存爆炸與推論延遲激增。
極限動態場景與高頻震盪下常規影格資訊嚴重缺失
在高速運動、劇烈相機抖動或極低光環境下,傳統 RGB 感光元件(如 30/60 fps)拍攝的影格本身就帶有嚴重的運動模糊或影格間資訊斷層(Frame Gap),純粹依靠 RGB 相鄰影格已無法從物理上恢復遺失的高頻紋理。
小筆記:Pixel Shuffle(亞像素卷積)vs 傳統上採樣
在 ESPCN (CVPR 2016) 提出之前,超解析度模型多半使用 Transposed Convolution(反卷積)或插值進行放大,反卷積容易產生惱人的棋盤效應(Checkerboard Artifacts)。
ESPCN 提出的 Pixel Shuffle (Sub-Pixel Convolution),在 LR 特徵圖上輸出個通道,再透過週期性排列將通道維度直接折疊回空間維度
。這項操作不僅零額外插值計算,更成為往後近十年超解析度網路標準的上採樣標配模組。
主要貢獻
十年來各階段代表性架構透過不同維度的創新,逐一攻克了上述難題:
⚠️ 原始素材未涵蓋:素材為純文字整理(本機筆記 + 11 個 Notion 論文頁面,但這些頁面本文皆為空),沒有附架構示意圖,本文不自行繪製或杜撰示意圖。
解決: 早期在雙三次插值的高解析度空間提取特徵造成計算冗餘
ESPCN (CVPR 2016) 首創 Pixel Shuffle(亞像素卷積),將整個特徵提取過程完全保留在 LR 空間進行,直到最後一層才一次性重組放大,推論速度提升數倍以上,奠定了現代超解析度端到端高效架構的基石。
解決: 顯式光流對齊在大運動與遮擋下容易產生累積誤差
– EDVR (CVPRW 2019) 提出 PCD (Pyramid, Cascading and Deformable) 卷積對齊,捨棄脆弱的顯式光流向量,利用多尺度可變形卷積直接在特徵層面學習動態偏移量(Offset),對大運動具備極強的魯棒性。
– VSR-DUF (CVPR 2018) 則大膽提出動態上採樣濾波器(DUF),完全不進行顯式運動估計,直接由網路預測每個像素位置的動態時空濾波核與殘差。
解決: 時空特徵融合與傳播機制效率低且難以捕捉長程資訊
– BasicVSR (CVPR 2021) 將 VSR 解構為四大純粹核心模組:雙向循環傳播(Bidirectional Propagation)、光流特徵對齊、特徵聚合與上採樣,以極簡的 Baseline 超越了眾多複雜前作。
– TTVSR (CVPR 2022) 提出軌跡感知 Transformer(Trajectory-Aware Transformer),僅沿著光流軌跡上的像素計算自注意力,將時空 Attention 複雜度從
大幅壓至
。
– RVRT (NeurIPS 2022) 透過引導式可變形注意力(GDA)結合循環 Transformer,兼顧平行處理與低顯存佔用。
解決: 極限動態場景與高頻震盪下常規影格資訊嚴重缺失
– EGVSR (CVPR 2023) 與 EvTexture (ICML 2024) 引入具備微秒級超高時間解析度、高動態範圍的事件相機(Event Camera)資料流。
– 透過事件流提供的連續時間亮度變化脈衝,構建時空隱式神經表示(INR)與跨模態紋理增強,在極端快速運動與模糊場景下精準找回傳統 RGB 影格丟失的高頻邊緣。
延伸探討
VSR 十年技術演進全景總整理
| 階段與時期 | 代表架構 | 對齊機制 (Alignment) | 融合與傳播 (Propagation) | 核心突破點 |
|---|---|---|---|---|
| 早期 CNN 探索 (2014~2018) | SRCNN, ESPCN, VESPCN | Bicubic 插值 / 顯式光流 | 滑動視窗 (Sliding Window) | 確立 LR 特徵提取與 Pixel Shuffle 上採樣標準 |
| 可變形卷積與無光流 (2018~2019) | VSR-DUF, EDVR | DUF 動態濾波 / PCD 可變形卷積 | TSA 時空注意力融合 | 解決大運動光流崩潰,在 NTIRE 競賽大放異彩 |
| 雙向循環基準確立 (2020~2021) | RSDN, BasicVSR, IconVSR | 特徵級光流 Warping | 雙向循環傳播 (Bidirectional Recurrent) | 釐清 VSR 核心組件,建立強大通用 Baseline |
| 時空 Transformer 時代 (2022~2023) | TTVSR, RVRT | 跨影格軌跡追蹤 / 引導式可變形 Attention | 循環 Transformer 序列建模 | 降低時空注意力計算複雜度,長程記憶能力顯著提升 |
| 神經表示與神經相機 (2023~2024) | EGVSR, EvTexture | 事件驅動脈衝對齊 / 跨模態紋理對齊 | 隱式神經表示 (INR) / 紋理增強 | 結合微秒級事件流,攻克極限動態與模糊盲區 |
心得
回顧 VSR 這十年的發展,本質上就是一場「如何精準對齊並利用跨影格冗餘資訊」的認知演進史。從一開始粗暴的插值,到精巧設計的光流補償、可變形卷積,再到把精力轉向長程雙向傳播與軌跡 Attention,每一次的進展都在告訴我們:比起堆疊更深的網路,理清時空物理資訊的流動路徑才是解決問題的關鍵。
而近年事件相機(Event-based VSR)的加入更是打開了一扇新的窗戶——當傳統感測器的幀率受限於快門時間時,引入硬體層級的非同步脈衝流,從根本上顛覆了純軟體演算法在極限運動下的物理限制。