Survey: Preference Alignment in Generative Models: From Offline DPO to Online OneReward and Flow-GRPO

2025-08-01
| Survey of multiple papers

📑 投影片連結:Preference_Alignment_RL.pptx

📌 本篇為多篇論文之綜合 Survey,涵蓋以下核心文獻:

  • DPO: Direct Preference Optimization: Your Language Model is Secretly a Reward Model (NeurIPS 2023) [Paper Link]
      作者:Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, Chelsea Finn (Stanford University)
  • OneReward: OneReward: Multi-Task VLM Reward Modeling for Visual Generation (arXiv 2025)
      作者:Yu Gong, et al.
  • Flow-GRPO: Flow-GRPO: Online Relative Policy Optimization for Flow Matching (arXiv 2025)
      作者:Jie Liu, et al.

當前挑戰

在將強化學習與人類偏好引入生成模型的過程中,存在幾項關鍵痛點:

傳統 RLHF 多階段流程繁瑣且 PPO 訓練極易崩潰

早期的 RLHF(以 PPO 為核心)需要拆分成多個繁複的階段:先做 SFT,再蒐集偏好數據訓練獨立的獎勵模型(Reward Model),最後在線上強化學習迴圈中同時維護 Policy Model、Reference Model、Reward Model 與 Value/Critic Model。四個模型同時常駐顯存,超參數極為敏感,訓練過程極易震盪甚至分佈崩壞。

影像生成多維度評估難以簡單二分為勝負配對

在大語言模型中,一段回答的好壞相對直觀;但在圖像生成中,評估標準具有高度的多維度特性(例如:一張圖可能構圖極佳但人臉變形,另一張圖結構完整但色彩過曝)。傳統 DPO 強烈依賴明確的單一勝負對(Winner vs. Loser),在面對複雜多維度的視覺品質時難以給出合理的優化方向。

多任務偏好對齊面臨獎勵衝突與多模型維護成本

解決: 多任務偏好對齊面臨獎勵衝突與多模型維護成本

OneReward (arXiv 2025) 為多任務視覺生成量身打造了統一的對齊框架:
單一 VLM 獎勵模型:採用視覺語言大模型(VLM)作為統一的 Reward Model。只要在 Prompt 中指定當前任務類型(補全、擴展、消除)與評判指標,讓 VLM 判斷生成結果是否合格,直接取 VLM 輸出 Token `\”Yes\”` 的 Softmax 機率作為獎勵值。
Seedream 3.0 多任務微調:將 In-painting、Out-painting、物件消除、文字渲染全部統一為 Mask-guided 生成格式,直接在預訓練底模上以單一 Reward Model 進行多任務強化學習。
EMA 動態對手機制:為了避免模型在微調初期因為對手太弱而產生 Reward Hacking,引入指數移動平均(EMA)模型作為不斷變強的動態對比 Baseline。

多任務生成表現對比
各類生成模型在不同子任務上的能力雷達圖。傳統模型往往偏科,而 OneReward 透過多任務對齊在全任務上取得均衡高分。
OneReward 統一架構與 VLM 獎勵計算流程
OneReward 架構圖。將多種影像編輯任務統一為 Mask 條件輸入,並透過單一 VLM 計算獎勵反饋。
數據集分割與任務評判對照
將數據集按任務劃分為 K 個子集,RM 針對不同任務計算當前模型 x_\theta 相對參考模型 x_{\text{ref}} 的相對表現。

解決: 確定性流匹配缺乏隨機探索且逐步採樣線上收集數據開銷巨大

解決: 依賴龐大的 Value Model 估計 Baseline 消耗過多顯存資源

Flow-GRPO (arXiv 2025) 將 DeepSeek 採用的 GRPO 機制延伸至連續流匹配模型:
ODE 轉 SDE 探索:構建了數學轉換機制,將原本確定性的 Flow ODE 轉為具備相同邊際分佈的 SDE,賦予流模型線上隨機探索的能力。
群組相對優勢評估(Group Relative Policy Optimization, GRPO):對同一個 Prompt 採樣一組圖像群(Group G=\{y_1, \dots, y_G\}),計算群內各樣本的獎勵值,直接用群內平均值與標準差來標準化 Advantage:

    \[A_i = \frac{r_i - \text{mean}(r_G)}{\text{std}(r_G)}\]


徹底丟棄了獨立的 Value/Critic Model,大幅節省顯存開銷。
少步數流軌跡更新:結合流匹配的筆直軌跡特性,在線上 RL 迭代中僅需 4 到 8 步採樣即可完成高效策略更新。

Flow-GRPO 演算法架構圖
Flow-GRPO 整合了 SDE 探索、群組相對優勢估計與 Flow Matching 策略梯度更新。

延伸探討

三大對齊範式全方位對比

比較維度 DPO (NeurIPS 2023) OneReward (arXiv 2025) Flow-GRPO (arXiv 2025)
主要適用模態 LLM 文字生成、單一偏好圖文 多任務視覺生成與影像編輯 連續流匹配 (Flow Matching) 影像生成
學習模式 離線對比學習(Offline Pairwise) 離線/線上多任務強化反饋 線上群組策略優化(Online GRPO)
獎勵模型形式 隱式推導(無需獨立 Reward Model) 單一統一多模態大模型 (VLM) 外置打分器或特定審美獎勵
是否需 Value Model 否(群組標準化取代 Critic)
訓練顯存開銷 極低(只需 Policy + Reference) 中等(需維護 VLM 與 EMA 模型) 低(無需 Critic,少步數 SDE 採樣)

心得

偏好對齊(Alignment)與強化學習是近年 AI 從「能生成」邁向「符合人類意圖」的關鍵分水嶺。早期 PPO 的四模型聯調讓很多人望而卻步,而 DPO 的數學閉式解轉化無疑是經典的一筆,讓大家意識到很多 RL 目標可以優雅地降維成監督損失。

而在視覺領域,OneReward 和 Flow-GRPO 則各自給出了非常實用的工程典範:一個用統一的 VLM 解決了多任務打分維護成本高昂的問題;另一個則把 DeepSeek 在大語言模型上驗證成功的 GRPO 移植到了 Flow Matching,徹底甩掉了 Value Model 的包袱。這些進展共同讓視覺生成模型的後訓練(Post-training)變得更加穩定、可擴展且高效。