📑 投影片連結:20250211 VAR.pptx
當前挑戰
傳統視覺自迴歸模型(如 ImageGPT、Parti、Muse 的自迴歸部分)多半遵循著「文字範式」來硬套影像,導致了幾個難以克服的底層痛點:
光柵掃描破壞 2D 空間局部性與單向依賴衝突
傳統作法先透過 VQ-VAE 將一張影像切成 2D patch grid 並量化為離散 token,接著利用光柵掃描(Raster-scan,由左至右、由上至下)硬把 2D 矩陣拉平成 1D 序列。但圖像像素在空間上具有強烈的雙向相關性——左邊的像素與右邊、下方的像素彼此制約。強制用單向(Unidirectional)因果 Mask 進行 Next-token 預測,不僅破壞了局部紋理的幾何連續性,也違背了視覺特徵的客觀物理規律。

Token 逐點預測導致計算複雜度爆炸
如果一張特徵圖大小為
(例如
個 token),傳統自迴歸模型必須進行
次自迴歸推論步數。每一次自迴歸步都需計算一次 Transformer Attention,推論的整體計算複雜度高達
。這使得傳統視覺 AR 模型推論極度緩慢,難以生成高解析度圖像。
視覺自迴歸模型在生成品質與 Scaling Law 上落後 Diffusion
由於一維序列化破壞了空間關聯且累積誤差嚴重,傳統 AR 模型在 ImageNet 上的生成指標(如 FID)始終落後於 DiT 等主流擴散模型,且在擴大模型參數與數據集時,很難呈現如同 GPT 般平滑可預測的冪律縮放曲線(Power-law Scaling Laws)。
小筆記:初代 ViT vs 生成式 Tokenization (VQ-VAE / VQ-GAN)
在分類或偵測等判別式任務中,ViT 只需用 Linear Projection 將 patch 壓成向量即可;但在自迴歸生成任務中,模型必須輸出機率分佈以預測「下一個是什麼」。
為此,生成模型通常仰賴 VQ-VAE/VQ-GAN 的 Codebook 機制:Encoder輸出特徵圖
,Quantizer
在 Codebook
中搜尋最接近的向量索引
,最後由 Decoder
解碼重構。透過 Cross-Entropy 預測離散 token index,模型才能實現自迴歸生成。
主要貢獻
VAR 的核心直覺非常純粹:人類畫畫或觀察世界時,從來不是像印表機一樣一行一行掃描,而是先勾勒全局輪廓,再逐步刻畫中層結構,最後補上細節。

的尺度金字塔,各層級共享 Codebook 進行殘差編碼。解決: 光柵掃描破壞 2D 空間局部性與單向依賴衝突
VAR 將自迴歸的基本單元(Unit)從「單一 Token」重新定義為「整個尺度的 Token Map」:
– 將連續特徵圖
量化為
個不同解析度的尺度圖
,尺度序列為
。
– 自迴歸的聯合機率改寫為由粗到細的尺度條件機率積:
![Rendered by QuickLaTeX.com \[p(r_1, r_2, \dots, r_K) = \prod_{k=1}^K p(r_k \mid r_1, r_2, \dots, r_{k-1})\]](https://pyshen.net/wp-content/ql-cache/quicklatex.com-7448630862673080245adefc65773217_l3.png)
– 在預測第
解決: Token 逐點預測導致計算複雜度爆炸
在 VAR 架構下,預測第
尺度特徵圖時,其內部的
個 token 是完全平行同步生成的。
– 整個生成流程只需要
次自迴歸步驟(通常
步,例如
)。
– 整體推論複雜度從
劇降至
,生成一張圖片只需數十毫秒,速度比傳統 AR 快了數十倍,也顯著快於需要幾十步去噪的擴散模型。
解決: 視覺自迴歸模型在生成品質與 Scaling Law 上落後 Diffusion
VAR 在 ImageNet 256×256 與 512×512 基準測試中,取得了超越 DiT 的生成品質(ImageNet 256×256 FID 達 1.80),成為史上首個在無引導條件下全面超越 SOTA 擴散模型的自迴歸架構。同時,研究團隊透過多組不同參數量與數據規模的實驗,精準驗證了 VAR 在視覺領域完全遵循 Power-law Scaling Laws,且具備優異的 Zero-shot 影像修復(Inpainting / Outpainting)泛化能力。

的全局色彩基調,逐漸演化出物體輪廓,最後在
補齊毛髮與高頻紋理。延伸探討
VAR 模型架構細節
- 多尺度殘差量化(Multi-Scale Residual Quantization, MSRQ):
– 傳統 VQ-VAE 在多尺度下往往需要不同的 Codebook,而 VAR 透過在每個尺度上加入額外的卷積映射層
,實現了所有尺度共享同一個 Codebook
(大小為
),大幅壓縮了量化器的參數量。 - AdaLN 與條件生成:
– 在 VAR Transformer 中,作者採用 Adaptive Layer Normalization (AdaLN)。當進行類別條件生成時,Class Embedding 會直接作為初始起始 Token
,並同時調控每層 Transformer 的 AdaLN 縮放與偏置參數。
– 在 Attention 計算前將 Query 與 Key 正規化為單位向量(Unit Vector Normalization),能有效改善深層多尺度自迴歸訓練時的數值穩定性。

心得
VAR 是近年視覺生成領域最具突破性的一篇工作。過去大家習慣把 NLP 的 GPT 架構「像素級拷貝」到 CV,忽略了語言文字是天然的一維時間流,而視覺特徵則是多維的空間層次。VAR 找到了一種既符合自迴歸數學前提、又契合視覺物理特性的優雅形式(Coarse-to-Fine)。
這項工作也直接啟發了後續一系列視覺自迴歸的研究浪潮,包括將 VAR 引入超解析度任務的 VARSR、以及探索連續機率分佈去噪的 MAR。在多模態大模型時代,VAR 的出現證明了自迴歸架構完全有能力統一語言與視覺生成。