Survey: Lumina-mGPT: Multimodal Autoregressive Pretraining for Visual Understanding and Generation

2026-08-16
| arXiv 2024

Dongxu Liu, et al.

當前挑戰

在探索端到端多模態自迴歸生成時,傳統視覺模型面臨三大根本痛點:

傳統視覺自迴歸模型隨機初始化導致收斂極慢且缺乏語言先驗

以往的視覺自迴歸模型(如 Parti、ImageBART)往往從頭(Scratch)隨機初始化因果 Transformer。這種作法不僅需要耗費數百萬 GPU 小時才能收斂,且模型缺乏對複雜世界常識、多輪指令與細膩文字關係的語義先驗,在 Prompt 遵循能力上遠落後於現代 LLM。

文字理解與影像生成架構割裂限制跨模態泛化

現有的主流系統通常採用「外掛分離式架構」:用一個預訓練好的 Text Encoder(如 T5 或 CLIP)負責文字理解,再將特徵透過 Cross-Attention 注入到獨立的影像生成模組(如 U-Net / DiT)。這種單向割裂的設計無法實現雙向的模態互哺,限制了跨模態對話與視覺推理生成的深度泛化。

依賴中心裁剪與固定解析度難以生成原生多比例影像

多數影像生成框架在預訓練時依賴固定尺寸的中心裁剪(例如嚴格 512 \times 5121024 \times 1024)。這導致模型在面對手機直式壁紙、電影寬螢幕等非標準長寬比時,容易產生畫面變形、邊緣切除或構圖失衡。


主要貢獻

Lumina-mGPT 透過原生多模態序列建模給出了解法:

解決: 傳統視覺自迴歸模型隨機初始化導致收斂極慢且缺乏語言先驗

Lumina-mGPT 直接以開源且能力成熟的預訓練多模態大模型(如 Llama 系架構)為起點,繼承其海量文字語料與多模態對齊先驗。透過將文字 Token 與視覺離散 Token 統一交織輸入,大幅加速了自迴歸生成的訓練收斂,並帶來了驚人的指令遵循與細節理解能力。

解決: 文字理解與影像生成架構割裂限制跨模態泛化

模型採用了端到端全統一的因果 Transformer 骨幹
– 將文字輸入透過 BPE Tokenizer 編碼,圖像則透過視覺 Tokenizer(如 VQ-GAN)轉換為離散 Token。
– 在同一個因果自迴歸注意力機制下進行雙向建模,文字可以預測文字、文字可以預測圖片、圖片也能進一步生成文字描述,真正實現了雙向對等的多模態統一。

解決: 依賴中心裁剪與固定解析度難以生成原生多比例影像

Lumina-mGPT 引入了靈活的任意長寬比與解析度生成機制
– 捨棄固定尺寸的裁剪限制,支援任意寬高比(1:1、16:9、9:16、4:3 等)的圖像輸入與輸出。
– 透過自適應 2D 空間位置編碼(2D RoPE),確保自迴歸解碼器在不同長寬序列長度下皆能維持精準的幾何空間定位。

小筆記:2D RoPE 如何支援任意尺寸?
1D RoPE 只考慮 Token 的絕對序列位置 i。而 2D RoPE 將 Patch 的空間座標拆解為橫縱座標 (h, w),分別在水平與垂直維度上計算旋轉角度。如此一來,不論圖像是寬屏還是長圖,模型都能準確捕捉相鄰 Patch 在 2D 平面上的相對距離。


延伸探討

Lumina-mGPT 與 [xAR](xar-next-x-prediction-visual-generation) 分別代表了自迴歸生成演進的兩個關鍵切面:
Lumina-mGPT 專注於「模態與架構的大一統」:證明了用同一個 LLM 骨幹搞定多比例多模態理解與生成的威力。
xAR 則深入探討「預測範式的多樣性」:探討除了標準 Next-Token 之外,Next-Scale、Next-Resolution 等「Next-X」預測模式在視覺生成中的邊界。