📌 本篇為多篇論文之綜合 Survey,涵蓋以下核心文獻:
- Imagefolder: Imagefolder: Autoregressive Image Generation with Folded Tokens (ICLR 2025) [Paper Link]
作者:Xiang Li, et al. (Adobe Research) - XQ-GAN: XQ-GAN: An Open-Source Image Tokenization Framework for Autoregressive Generation (arXiv 2024) [Paper Link]
作者:Xiang Li, et al. (Adobe Research)
當前挑戰
在設計適用於自迴歸生成的影像 Tokenizer 時,主要面臨三大瓶頸:
Token 序列長度與自迴歸累積誤差的兩難
若使用高壓縮率(例如單張圖僅
個 Token),生成步數少且速度快,但解碼重構時模糊嚴重;若為了追求極致細節採用
或更多 Token,自迴歸步數過長會導致每一步的預測誤差不斷放大累積,最終生成結構失真的影像。
傳統 VQ-GAN 碼本崩潰與利用率低下
標準 VQ-GAN 普遍存在 Codebook Collapse(碼本崩潰)問題:在訓練過程中,由於梯度反向傳播的近似問題,只有一小部分 Code 向量能持續被更新,其餘大量向量陷入未激活狀態,導致特徵空間浪費,難以在有限碼本容量下達到高資訊密度。
⚠️ 原始素材未涵蓋:Codebook 的具體維度設定(如
、
大小)與未激活比例的確切數字,素材中未附,故不逕行給出。
視覺離散 Token 缺乏高階語義感知能力
傳統 VQ 訓練只依賴像素重構 Loss 與對抗損失(GAN Loss)。這導致編碼出的離散 Token 雖然能拼湊出像素顏色,卻缺乏清晰的高階語義資訊,自迴歸 Transformer 在建模全局概念時需要額外耗費大量參數量去學習語義理解。
小筆記:Product Quantization(乘積量化)的核心精神
乘積量化(PQ)的核心精神是「分而治之」:傳統量化是在整個特徵維度空間中找一個最接近的碼點,而 PQ 將特徵向量切分為多個獨立的子向量,並在各自的子 Codebook 中分別量化。這樣一來,組合出的理論狀態空間會隨子空間數量呈指數增長,大幅提升特徵表達能力的同時,顯存與計算複雜度卻只隨線性增長。
⚠️ 原始素材未涵蓋:具體的子空間切分數量、維度與碼本大小設定,素材中未附,故不逕行舉出具體數字範例。
主要貢獻
Imagefolder 與 XQ-GAN 分別針對序列壓縮與碼本架構進行了深度重構:
解決: Token 序列長度與自迴歸累積誤差的兩難
Imagefolder 提出「折疊 Token(Folded Tokens)」與 Quantizer Dropout(量化器隨機丟棄) 機制:
– 基於多尺度殘差量化器(MSRQ),在訓練時強制保留前 3 個基礎量化尺度,並隨機丟棄後續的量化層級。
– 這種強制性正則化促使模型在最前置的少數尺度中盡可能濃縮核心幾何與語義資訊,在推論時大幅縮短自迴歸生成所需的步數,有效抑制了誤差累積。
解決: 傳統 VQ-GAN 碼本崩潰與利用率低下
XQ-GAN 引入了 乘積量化與殘差結構(Product Quantization & Residuals):
– 將連續特徵向量劃分為多個正交子空間分別量化,並配合輕量級殘差連接。
– 徹底解決了高維空間下的 Codebook Collapse 問題,使得碼本利用率接近 100%,以極小的參數與碼本維度達成了超越傳統大型 Codebook 的重建保真度。
解決: 視覺離散 Token 缺乏高階語義感知能力
Imagefolder 引入了 語義特徵正則化(Semantic Regularization):
– 將語義量化器的輸出與預訓練的 DINOv2 特徵空間進行對齊,並直接使用 DINOv2 權重來初始化視覺編碼器。
– 賦予了離散 Token 豐富的高階語義先驗,大幅降低了後續自迴歸模型理解圖像語義結構的訓練難度。
延伸探討
兩大 Tokenizer 架構取徑對照
| 特性比較 | Imagefolder (ICLR 2025) | XQ-GAN (2024) |
|---|---|---|
| 主要定位 | 序列長度折疊與自迴歸生成優化 | 高效離散量化框架與碼本利用率提升 |
| 核心技術 | Quantizer Dropout + DINOv2 語義對齊 | Product Quantization (乘積量化) + 殘差量化 |
| 碼本策略 | 多尺度殘差多層共享 | 子空間正交分解,利用率近 100% |
| 生成端優勢 | 自迴歸步數少,大幅減少長程累積誤差 | 重建保真度高,碼本佔用記憶體極小 |
⚠️ 原始素材未涵蓋:兩篇論文皆無 Notion 補充頁面,素材為純文字方法論摘要,沒有實驗結果圖或重建效果對比圖,本文不逕行給出。