當前挑戰
在視覺自迴歸建模中,傳統 Next-Token 範式面臨以下核心矛盾:
一維線性光柵掃描與二維圖像空間特徵的不匹配
傳統視覺自迴歸模型(如 VQ-GAN、ImageBART)強行將 2D 特徵圖壓平成 1D 序列,按照光柵順序一個個預測 Token。這導致在空間上明明相鄰的垂直像素點(例如第 1 行第 5 列與第 2 行第 5 列),在序列上卻被隔了幾十甚至幾百個 Token,迫使模型浪費大量注意力去跨長距離重建垂直幾何關係。
單一 Token 預測難以捕捉跨尺度與結構化的視覺語義
人類繪畫或觀察世界時,通常是「先看整體輪廓、再看局部結構、最後填充精細紋理」,或者以具有語義的「幾何區塊(Patches / Objects)」為單元進行構思。單純逐個預測最小粒度的離散 Token,既缺乏對全局語義尺度的感知,又導致推論步數極長。
主要貢獻
xAR 提出了超越單一 Next-Token 的廣義架構:
解決: 一維線性光柵掃描與二維圖像空間特徵的不匹配
xAR 提出了廣義 Next-x 預測框架:
– 將自迴歸的基本預測單元從單一 1D Token 解構,允許自定義「預測單元
」。
– 打破了僵化的一維光柵掃描順序,使自迴歸模型能夠依照 2D 空間幾何關係、自適應拓撲結構或自定義的空間路徑進行解碼。
解決: 單一 Token 預測難以捕捉跨尺度與結構化的視覺語義
xAR 支援多樣化的預測粒度:
– 多尺度殘差預測 (Next-Scale / Next-Resolution):配合多解析度特徵金字塔,先預測低頻全局語義,再逐層預測高頻殘差。
– 結構化區塊預測 (Next-Patch / Next-Block):以具備局部空間完整性的區塊為單位進行並行或半自迴歸生成,兼顧了全域幾何結構的一致性與局部紋理的逼真度。
– 推論加速:透過增大單次預測的資訊粒度,大幅縮短了整體自迴歸生成的步數與延遲。
小筆記:Next-x 的本質是什麼?
Next-x 的核心是將「因果遮罩(Causal Mask)」從嚴格的下三角矩陣推廣為任意拓撲圖。只要保證無環(DAG),任何劃分方式——無論是按尺度(Scale)、按頻率(Frequency)、還是按語義分割區塊(Semantic Regions)——都可以作為自迴歸的預測維度。
延伸探討
從 Next-Token 到 Next-x 的演變,代表了視覺自迴歸模型從「模仿 NLP」走向「發展視覺原生特徵」的關鍵一步:
1. VAR (Visual Autoregressive) 探索了粗到細的 Next-Scale 預測。
2. MAR (Masked Autoregressive) 探索了基於擴散 Loss 的連續特徵自迴歸。
3. xAR 則進一步將這些不同路徑統一為廣義的 Next-x 框架,讓研究者可以針對不同任務(生成、修復、超解析)自由定制最適的因果拓撲。