📑 投影片連結:20250303 MAR.pptx
當前挑戰
將自迴歸模型限制在離散空間中,對視覺生成帶來了幾項難以忽視的天然缺陷:
離散向量量化導致高頻紋理損失與量化誤差
在標準的 VQ-VAE/VQ-GAN 中,編碼器輸出的連續特徵向量會被強制映射到 Codebook 裡最近的離散碼點。這種離散截斷就像是有損壓縮,會抹平圖像中的細微漸層與毛髮、布料等高頻紋理,即使後續 Decoder 再強大,也很難百分之百還原丟失的底層資訊。
⚠️ 原始素材未涵蓋:素材為純文字筆記,沒有附架構圖,本文不自行繪製或杜撰示意圖。
傳統 AR 與分類分佈綁定限制連續特徵表達
以往視覺 AR 模型為了使用 Cross-Entropy 損失,只能將預測目標限定為「從
個 Codebook 向量中挑選一個類別」。這種離散分類形式無法自然地描述視覺特徵在連續空間中的平滑過渡與高維分佈型態。
自迴歸逐點生成速度受限且缺乏雙向上下文
純粹的單向自迴歸(如光柵掃描)不僅生成步數過長,而且在生成某個 Token 時完全無法看到圖像其他區域的上下文資訊,導致全局幾何結構容易失真。
小筆記:連續空間採樣溫度
在離散自迴歸中,我們常透過 Softmax Temperature 調控生成多樣性()。而在連續 Diffusion Loss 框架下,MAR 提出透過縮放逆向擴散採樣時的噪聲標準差
來充當溫度係數:
– 當時為標準擴散採樣;
– 當時降低採樣隨機性,強化生成結構的保真度;
– 當時提高多樣性。這讓連續空間生成同樣具備了優雅的採樣調控能力。
主要貢獻
MAR 重新定義了自迴歸的預測目標,將連續擴散模型作為 Token 機率分佈的採樣器,徹底甩掉了 VQ Codebook 的包袱:
解決: 離散向量量化導致高頻紋理損失與量化誤差
MAR 完全廢除了 VQ-VAE Codebook,改用無損(Lossless)或高保真度連續 AutoEncoder(如標準 VAE)。圖像被編碼為連續特徵圖,每個 Token 直接保留浮點數向量表示,徹底杜絕了向量量化階段引入的資訊截斷。
解決: 傳統 AR 與分類分佈綁定限制連續特徵表達
MAR 將 Transformer 的輸出預測頭替換為一個輕量的 Denoising MLP(配備 AdaLN 與 SiLU):
– 在自迴歸條件下,不再計算 Softmax 交叉熵,而是以連續特徵的條件去噪擴散目標(MSE Noise Prediction Loss)來訓練:
![]()
其中
– 這樣一來,Transformer 專注於捕捉長程上下文依賴,而 Denoising MLP 則負責精確建模每個 Token 在連續特徵空間中的條件機率分佈
解決: 自迴歸逐點生成速度受限且缺乏雙向上下文
MAR 引入了 Masked Autoregressive (MAR) 訓練範式:
– 訓練階段在
的區間內隨機採樣遮蔽率(Masking Ratio),並搭配雙向自注意力機制(Bidirectional Attention)。
– 推論時不需要一行一行逐點推論,而是透過數個迭代步數平行去噪與填充,大幅減少推論步數,兼顧了全圖全局上下文感知與高速生成。
延伸探討
實驗表現:ImageNet 生成質量的新標竿
在標準的 ImageNet 256×256 生成任務中,MAR 取得了極低的 FID 指標,優於多數離散 AR 模型與擴散模型,同時保持極高的推理速度與連續特徵保真度。這證明了自迴歸架構在視覺生成中表現不佳的「元兇」並非自迴歸機制本身,而是過往強行套用離散量化所造成的特徵瓶頸。
⚠️ 原始素材未涵蓋:具體對比了哪些模型(如是否包含 VQGAN、MaskGIT、DiT 等)、確切 FID 數值,以及生成範例圖,素材中僅有前述的定性描述,故不逕行點名比較對象或附上示意圖。
心得
何愷明這篇論文最漂亮的地方在於「撥雲見日」——指出了長久以來大家把「自迴歸」與「離散 Token」綁定在一起的思維盲區。自迴歸的核心是鏈式法則條件分解(Chain Rule),而不是 Cross-Entropy。
透過將 Diffusion 當作連續機率分佈的輸出頭,MAR 巧妙地把 Autoregressive(擅長長程語義依賴)與 Diffusion(擅長連續細節生成)的優勢融為一體。在同一個系列研究中,我們也能看到 [VARSR](varsr-visual-autoregressive-super-resolution) 嘗試利用擴散精煉器來補足量化殘差,兩者殊途同歸,都指明了「連續特徵 + 自迴歸」是未來視覺生成不可忽視的重要方向。