📑 投影片連結:Preference_Alignment_RL.pptx
📌 本篇為多篇論文之綜合 Survey,涵蓋以下核心文獻:
- DPO: Direct Preference Optimization: Your Language Model is Secretly a Reward Model (NeurIPS 2023) [Paper Link]
作者:Rafael Rafailov, Archit Sharma, Eric Mitchell, Stefano Ermon, Christopher D. Manning, Chelsea Finn (Stanford University) - OneReward: OneReward: Multi-Task VLM Reward Modeling for Visual Generation (arXiv 2025)
作者:Yu Gong, et al. - Flow-GRPO: Flow-GRPO: Online Relative Policy Optimization for Flow Matching (arXiv 2025)
作者:Jie Liu, et al.
當前挑戰
在將強化學習與人類偏好引入生成模型的過程中,存在幾項關鍵痛點:
傳統 RLHF 多階段流程繁瑣且 PPO 訓練極易崩潰
早期的 RLHF(以 PPO 為核心)需要拆分成多個繁複的階段:先做 SFT,再蒐集偏好數據訓練獨立的獎勵模型(Reward Model),最後在線上強化學習迴圈中同時維護 Policy Model、Reference Model、Reward Model 與 Value/Critic Model。四個模型同時常駐顯存,超參數極為敏感,訓練過程極易震盪甚至分佈崩壞。
影像生成多維度評估難以簡單二分為勝負配對
在大語言模型中,一段回答的好壞相對直觀;但在圖像生成中,評估標準具有高度的多維度特性(例如:一張圖可能構圖極佳但人臉變形,另一張圖結構完整但色彩過曝)。傳統 DPO 強烈依賴明確的單一勝負對(Winner vs. Loser),在面對複雜多維度的視覺品質時難以給出合理的優化方向。
多任務偏好對齊面臨獎勵衝突與多模型維護成本
解決: 多任務偏好對齊面臨獎勵衝突與多模型維護成本
OneReward (arXiv 2025) 為多任務視覺生成量身打造了統一的對齊框架:
– 單一 VLM 獎勵模型:採用視覺語言大模型(VLM)作為統一的 Reward Model。只要在 Prompt 中指定當前任務類型(補全、擴展、消除)與評判指標,讓 VLM 判斷生成結果是否合格,直接取 VLM 輸出 Token `\”Yes\”` 的 Softmax 機率作為獎勵值。
– Seedream 3.0 多任務微調:將 In-painting、Out-painting、物件消除、文字渲染全部統一為 Mask-guided 生成格式,直接在預訓練底模上以單一 Reward Model 進行多任務強化學習。
– EMA 動態對手機制:為了避免模型在微調初期因為對手太弱而產生 Reward Hacking,引入指數移動平均(EMA)模型作為不斷變強的動態對比 Baseline。



個子集,RM 針對不同任務計算當前模型
相對參考模型
的相對表現。解決: 確定性流匹配缺乏隨機探索且逐步採樣線上收集數據開銷巨大
解決: 依賴龐大的 Value Model 估計 Baseline 消耗過多顯存資源
Flow-GRPO (arXiv 2025) 將 DeepSeek 採用的 GRPO 機制延伸至連續流匹配模型:
– ODE 轉 SDE 探索:構建了數學轉換機制,將原本確定性的 Flow ODE 轉為具備相同邊際分佈的 SDE,賦予流模型線上隨機探索的能力。
– 群組相對優勢評估(Group Relative Policy Optimization, GRPO):對同一個 Prompt 採樣一組圖像群(Group
),計算群內各樣本的獎勵值,直接用群內平均值與標準差來標準化 Advantage:
![]()
徹底丟棄了獨立的 Value/Critic Model,大幅節省顯存開銷。
– 少步數流軌跡更新:結合流匹配的筆直軌跡特性,在線上 RL 迭代中僅需 4 到 8 步採樣即可完成高效策略更新。

延伸探討
三大對齊範式全方位對比
| 比較維度 | DPO (NeurIPS 2023) | OneReward (arXiv 2025) | Flow-GRPO (arXiv 2025) |
|---|---|---|---|
| 主要適用模態 | LLM 文字生成、單一偏好圖文 | 多任務視覺生成與影像編輯 | 連續流匹配 (Flow Matching) 影像生成 |
| 學習模式 | 離線對比學習(Offline Pairwise) | 離線/線上多任務強化反饋 | 線上群組策略優化(Online GRPO) |
| 獎勵模型形式 | 隱式推導(無需獨立 Reward Model) | 單一統一多模態大模型 (VLM) | 外置打分器或特定審美獎勵 |
| 是否需 Value Model | 否 | 否 | 否(群組標準化取代 Critic) |
| 訓練顯存開銷 | 極低(只需 Policy + Reference) | 中等(需維護 VLM 與 EMA 模型) | 低(無需 Critic,少步數 SDE 採樣) |
心得
偏好對齊(Alignment)與強化學習是近年 AI 從「能生成」邁向「符合人類意圖」的關鍵分水嶺。早期 PPO 的四模型聯調讓很多人望而卻步,而 DPO 的數學閉式解轉化無疑是經典的一筆,讓大家意識到很多 RL 目標可以優雅地降維成監督損失。
而在視覺領域,OneReward 和 Flow-GRPO 則各自給出了非常實用的工程典範:一個用統一的 VLM 解決了多任務打分維護成本高昂的問題;另一個則把 DeepSeek 在大語言模型上驗證成功的 GRPO 移植到了 Flow Matching,徹底甩掉了 Value Model 的包袱。這些進展共同讓視覺生成模型的後訓練(Post-training)變得更加穩定、可擴展且高效。