Survey: Visual Autoregressive Super-Resolution via Multi-Scale Structure (VARSR)

2025-03-11
| arXiv 2025 / ICML 2025

Yan Qu, et al.

當前挑戰

將多尺度自迴歸架構直接應用於影像超解析度時,面臨四項關鍵難題:

低解析度引導條件難以注入多尺度自迴歸

在超解析度任務中,低解析度影像(LR)是至關重要的結構錨點。傳統 VAR 是以隨機 Class Embedding 或噪聲為條件進行無條件生成,如何將 LR 的連續特徵無損且高效地傳遞給多個尺度的自迴歸預測層,是首要面臨的結構問題。

⚠️ 原始素材未涵蓋:素材為純文字筆記,沒有附架構圖,本文不自行繪製或杜撰示意圖。

跨尺度 2D 空間位置關係難以精確對齊

VAR 在生成過程中會依序預測 1\times 1, 2\times 2, \dots, K\times K 等不同解析度的特徵圖。若使用傳統的 1D 或未對齊的絕對位置編碼,不同尺度的 Token 在同一空間區域的相對位置無法嚴格對齊,導致模型在由粗到細的特徵傳遞中出現幾何錯位與模糊。

離散量化截斷導致高頻重建細節平滑

VAR 底層依賴 VQ-VAE 的離散 Codebook 來表示圖像 Token。但離散量化不可避免地會捨棄連續特徵空間中的高頻殘差,使得最終重構出來的超解析度影像容易出現過度平滑或細微紋理缺失。

自迴歸生成容易產生感知偽影

在大幅度(如 4\times 甚至更極限)的真實世界超解析度中,單純的自迴歸採樣有時會產生與原圖不一致的結構幻覺或局部偽影,缺乏對感知品質的直接引導機制。

⚠️ 原始素材未涵蓋:SaRoPE 的具體座標變換公式與數學推導,素材僅有「將 2D RoPE 擴展並依尺度動態歸一化縮放,使 LR 條件特徵與各級 Token 圖維持嚴格對齊的空間相對關係」這一段文字描述,不逕行還原成具體公式。


主要貢獻

VARSR 針對上述四大挑戰,提出了一套兼顧結構保真度與生成多樣性的完整架構:

解決: 低解析度引導條件難以注入多尺度自迴歸

VARSR 引入了 前綴條件 Token(Prefix Conditional Tokens) 機制:
– 利用輕量級的視覺編碼器將輸入的 LR 影像轉換為一組條件特徵 Token。
– 將這些條件 Token 直接拼接在多尺度自迴歸序列的最前端,作為所有尺度預測的共享全局 Prefix,確保整個由粗到細的生成流程始終牢牢錨定在 LR 的幾何結構上。

解決: 跨尺度 2D 空間位置關係難以精確對齊

提出專為多尺度金字塔設計的 Scale-Aligned Rotary Positional Embedding (SaRoPE)
– 將 RoPE 擴展至 2D 空間,並在計算旋轉角度時依據各尺度解析度進行動態歸一化縮放。
– 使 LR 條件特徵與從 1\times 1K\times K 的各級 Token 圖在注意力計算時,具備嚴格一致的 2D 空間相對幾何關係。

解決: 離散量化截斷導致高頻重建細節平滑

在 VAR 輸出最後一級特徵圖 x_K 後,引入一個 輕量擴散精煉器(Diffusion Refiner)
– 以輕量 MLP 去噪頭直接在潛在空間中預測被 VQ Codebook 截斷的連續殘差特徵(Quantization Residuals)。
– 既保留了 VAR 自迴歸在宏觀結構生成上的極快速度,又藉由擴散機制補足了毛髮、微小紋理等連續高頻細節。

解決: 自迴歸生成容易產生感知偽影

設計了專為影像條件任務定製的 Image-based Classifier-Free Guidance (Image-based CFG)
– 在訓練階段同時構建高品質(HQ)正向條件與低品質(LQ)負向條件特徵。
– 在推論時透過正負條件 Logit 的線性外推,有效壓制隨機生成的結構偽影,生成對比鮮明、紋理銳利的高品質影像。


延伸探討

實驗成果與性能評估

研究團隊構建了包含 400 萬張高品質圖像的大型資料庫進行預訓練,並在 32 張 V100 GPU 上完成訓練。素材筆記指出,VARSR 在推斷速度與重建視覺品質上均大幅領先傳統擴散 SR 模型。

⚠️ 原始素材未涵蓋:具體點名比較了哪些擴散 SR 模型(如是否包含 StableSR、ResShift)、確切的速度倍率,以及 PSNR / SSIM / LPIPS / CLIPIQA 等指標的具體數值與重建對比圖,素材中僅有前述的定性描述,故不逕行給出。