Survey: Visual Autoregressive Modeling: Scalable Generation via Next-Scale Prediction (VAR)

2025-02-11
| NeurIPS 2024 (Best Paper Award)

Keyu Tian, Yi Jiang, Zehuan Yuan, Bingyue Peng, Liwei Wang

📑 投影片連結:20250211 VAR.pptx

當前挑戰

傳統視覺自迴歸模型(如 ImageGPT、Parti、Muse 的自迴歸部分)多半遵循著「文字範式」來硬套影像,導致了幾個難以克服的底層痛點:

光柵掃描破壞 2D 空間局部性與單向依賴衝突

傳統作法先透過 VQ-VAE 將一張影像切成 2D patch grid 並量化為離散 token,接著利用光柵掃描(Raster-scan,由左至右、由上至下)硬把 2D 矩陣拉平成 1D 序列。但圖像像素在空間上具有強烈的雙向相關性——左邊的像素與右邊、下方的像素彼此制約。強制用單向(Unidirectional)因果 Mask 進行 Next-token 預測,不僅破壞了局部紋理的幾何連續性,也違背了視覺特徵的客觀物理規律。

傳統 1D 光柵掃描自迴歸與 VAR 多尺度自迴歸的機制對比
傳統 AR 與 VAR 的生成流程比較。(a) 傳統光柵掃描將 2D token 拉成 1D 序列逐點預測,容易破壞空間關聯;(b) VAR 採用 Next-Scale Prediction,模擬人類視覺由粗到細逐層生成完整的尺度特徵圖。

Token 逐點預測導致計算複雜度爆炸

如果一張特徵圖大小為 n \times n(例如 32 \times 32 = 1024 個 token),傳統自迴歸模型必須進行 n^2 次自迴歸推論步數。每一次自迴歸步都需計算一次 Transformer Attention,推論的整體計算複雜度高達 \mathcal{O}(n^6)。這使得傳統視覺 AR 模型推論極度緩慢,難以生成高解析度圖像。

視覺自迴歸模型在生成品質與 Scaling Law 上落後 Diffusion

由於一維序列化破壞了空間關聯且累積誤差嚴重,傳統 AR 模型在 ImageNet 上的生成指標(如 FID)始終落後於 DiT 等主流擴散模型,且在擴大模型參數與數據集時,很難呈現如同 GPT 般平滑可預測的冪律縮放曲線(Power-law Scaling Laws)。

小筆記:初代 ViT vs 生成式 Tokenization (VQ-VAE / VQ-GAN)
在分類或偵測等判別式任務中,ViT 只需用 Linear Projection 將 patch 壓成向量即可;但在自迴歸生成任務中,模型必須輸出機率分佈以預測「下一個是什麼」。

為此,生成模型通常仰賴 VQ-VAE/VQ-GAN 的 Codebook 機制:Encoder \mathcal{E} 輸出特徵圖 f,Quantizer \mathcal{Q} 在 Codebook Z \in \mathbb{R}^{V \times C} 中搜尋最接近的向量索引 q,最後由 Decoder \mathcal{D} 解碼重構。透過 Cross-Entropy 預測離散 token index,模型才能實現自迴歸生成。


主要貢獻

VAR 的核心直覺非常純粹:人類畫畫或觀察世界時,從來不是像印表機一樣一行一行掃描,而是先勾勒全局輪廓,再逐步刻畫中層結構,最後補上細節。

VAR 多尺度殘差量化結構
VAR 的 Multi-Scale Residual Quantization (MSRQ) 流程。將特徵圖分解為 1\times 1 \to 2\times 2 \to \dots \to K\times K 的尺度金字塔,各層級共享 Codebook 進行殘差編碼。

解決: 光柵掃描破壞 2D 空間局部性與單向依賴衝突

VAR 將自迴歸的基本單元(Unit)從「單一 Token」重新定義為「整個尺度的 Token Map」:
– 將連續特徵圖 f 量化為 K 個不同解析度的尺度圖 (r_1, r_2, \dots, r_K),尺度序列為 1\times 1, 2\times 2, 4\times 4, \dots, K\times K
– 自迴歸的聯合機率改寫為由粗到細的尺度條件機率積:

    \[p(r_1, r_2, \dots, r_K) = \prod_{k=1}^K p(r_k \mid r_1, r_2, \dots, r_{k-1})\]


– 在預測第 k 個尺度 r_k 時,模型以之前所有粗尺度的 Token Maps (r_1, \dots, r_{k-1}) 作為 Prefix Context,並在 r_k 內部同時雙向關注所有空間位置。這既維持了尺度間嚴格的因果單向性,又保留了尺度內的 2D 空間雙向局部性。

解決: Token 逐點預測導致計算複雜度爆炸

在 VAR 架構下,預測第 k 尺度特徵圖時,其內部的 h_k \times w_k 個 token 是完全平行同步生成的。
– 整個生成流程只需要 K 次自迴歸步驟(通常 K=7 \sim 10 步,例如 1 \to 2 \to 3 \to 4 \to 6 \to 8 \to 12 \to 16 \to 24 \to 32)。
– 整體推論複雜度從 \mathcal{O}(n^6) 劇降至 \mathcal{O}(n^4),生成一張圖片只需數十毫秒,速度比傳統 AR 快了數十倍,也顯著快於需要幾十步去噪的擴散模型。

解決: 視覺自迴歸模型在生成品質與 Scaling Law 上落後 Diffusion

VAR 在 ImageNet 256×256 與 512×512 基準測試中,取得了超越 DiT 的生成品質(ImageNet 256×256 FID 達 1.80),成為史上首個在無引導條件下全面超越 SOTA 擴散模型的自迴歸架構。同時,研究團隊透過多組不同參數量與數據規模的實驗,精準驗證了 VAR 在視覺領域完全遵循 Power-law Scaling Laws,且具備優異的 Zero-shot 影像修復(Inpainting / Outpainting)泛化能力。

VAR 生成範例與由粗到細逐步渲染過程
VAR 在不同尺度下的逐步重構效果。從最初 1\times 1 的全局色彩基調,逐漸演化出物體輪廓,最後在 32\times 32 補齊毛髮與高頻紋理。

延伸探討

VAR 模型架構細節

  1. 多尺度殘差量化(Multi-Scale Residual Quantization, MSRQ)
    – 傳統 VQ-VAE 在多尺度下往往需要不同的 Codebook,而 VAR 透過在每個尺度上加入額外的卷積映射層 \phi_k,實現了所有尺度共享同一個 Codebook Z(大小為 V=4096,大幅壓縮了量化器的參數量。
  2. AdaLN 與條件生成
    – 在 VAR Transformer 中,作者採用 Adaptive Layer Normalization (AdaLN)。當進行類別條件生成時,Class Embedding 會直接作為初始起始 Token [s],並同時調控每層 Transformer 的 AdaLN 縮放與偏置參數。
    – 在 Attention 計算前將 Query 與 Key 正規化為單位向量(Unit Vector Normalization),能有效改善深層多尺度自迴歸訓練時的數值穩定性。
VAR Scaling Laws 曲線
VAR 展現的 Scaling Law 特性。隨著模型參數量(從 VAR-d16 到 VAR-d30)與計算量提升,Loss 與生成 FID 呈現穩定的冪律下降趨勢。

心得

VAR 是近年視覺生成領域最具突破性的一篇工作。過去大家習慣把 NLP 的 GPT 架構「像素級拷貝」到 CV,忽略了語言文字是天然的一維時間流,而視覺特徵則是多維的空間層次。VAR 找到了一種既符合自迴歸數學前提、又契合視覺物理特性的優雅形式(Coarse-to-Fine)。

這項工作也直接啟發了後續一系列視覺自迴歸的研究浪潮,包括將 VAR 引入超解析度任務的 VARSR、以及探索連續機率分佈去噪的 MAR。在多模態大模型時代,VAR 的出現證明了自迴歸架構完全有能力統一語言與視覺生成。