📌 本篇為多篇論文之綜合 Survey,涵蓋以下核心文獻:
- UltraSR: UltraSR: Spatial Encoding is a Missing Key for Implicit Image Function-based Arbitrary-Scale Super-Resolution (ICCV 2021) [Paper Link]
作者:Yinbo Chen, Sifei Liu, Xiaolong Wang - LAR-SR: LAR-SR: A Local Autoregressive Model for Image Super-Resolution (CVPR 2022) [Paper Link]
作者:Baisong Guo, Xiaoyun Zhang, Haoning Wu, Yu Wang, Ya Zhang, Yan-Feng Wang
當前挑戰
隱式神經表示(LIIF)缺乏高頻幾何結構捕捉能力
在連續任意尺度超解析(Arbitrary-Scale SR)中,經典的 LIIF(Local Implicit Image Function)將圖像視為連續函數,利用 MLP 輸入 2D 連續坐標來查詢像素值。但多層感知機(MLP)天生具有頻譜偏差(Spectral Bias),偏好學習低頻平滑函數,導致在放大邊緣與精細幾何線條時依然存在細節模糊與偽影。
傳統回歸超解析過度平滑,全域自迴歸(PixelCNN)推論速度又太慢
傳統基於回歸(Regression-based)的模型為了壓低 MSE 損失,輸出的本質上是所有可能清晰圖像的平均值(Average Blur),感知品質(LPIPS)普遍不佳。雖然以 PixelCNN 為代表的自迴歸生成模型能生成逼真紋理,但逐像素(Pixel-by-pixel)的順序採樣機制推論速度極慢,完全無法應用於實際高解析度場景。
小筆記:頻譜偏差(Spectral Bias)與 Positional Encoding
深度 MLP 在沒有經過坐標編碼的情況下直接吃坐標,會優先擬合低頻資訊而忽略高頻訊號(這也是 NeRF 等 3D 重建中必須引入高頻頻率編碼的原因)。在 2D 隱式影像函數中,未編碼的連續坐標同樣會限制超解析網路的高頻還原能力。
主要貢獻
這兩篇論文各自給出了精闢的解法:UltraSR 補齊了隱式神經表示中的空間編碼拼圖;LAR-SR 則透過局部窗口自迴歸兼顧了生成品質與採樣速度。
解決: 隱式神經表示(LIIF)缺乏高頻幾何結構捕捉能力
UltraSR 提出空間坐標編碼(Spatial Encoding)是隱式連續超解析的核心關鍵:
1. 週期性空間編碼(Periodic Spatial Encoding):將連續的 2D 空間相對坐標映射到多組不同頻率的正弦與餘弦(Sin/Cos)高頻空間中,使後續的 MLP 解碼器能夠輕易解析出銳利的高頻邊界與紋理。
2. 坐標特徵融合與深層殘差連接:將局部特徵向量與空間編碼坐標充分融合,並保留輸入低解析度(LR)影像的低頻結構基底,確保任意非整數倍(如 1.7x, 3.4x)連續放大時的平滑與精確。
解決: 傳統回歸超解析過度平滑,全域自迴歸(PixelCNN)推論速度又太慢
LAR-SR 提出了基於 VQ-VAE 離散代碼本的局部自迴歸生成框架:
1. 離散 Token 空間映射:利用預訓練好的 VQ-VAE 將連續像素空間量化為離散的 Codebook Token,把繁重的像素級生成轉化為緊湊的 Token 預測。
2. 局部視窗自迴歸與跨 Patch 平行採樣:
– 捨棄全圖逐點自迴歸,改在局部窗口(Local Patch)內部進行自迴歸建模,精確捕捉局部鄰近像素的強相關性。
– 不同的局部 Patch 之間完全獨立、支援高度平行化採樣。
– 成功打破了感知品質(低 LPIPS、豐富真實紋理)與生成效率不可兼得的矛盾。
延伸探討
感知失真權衡(Perception-Distortion Tradeoff)
這兩篇論文分別代表了兩種不同的價值取向:
– UltraSR 追求的是在任意尺度放大下的連續性、高保真度與數值一致性(高 PSNR/SSIM),適合對圖像保真度有嚴格要求的測量與醫學應用。
– LAR-SR 追求的是極致的視覺感知真實感(極低 LPIPS),即便犧牲少許 PSNR,也能生成出肉眼看來栩栩如生的高頻紋理,更適合人眼觀賞與藝術修復。