Survey: Foundations of Flow Matching: Probability Flow ODE, Rectified Flow, and Consistency Models

2026-08-16
| Survey of multiple papers

📑 投影片連結:Flow_Matching_Theory.pptx

當前挑戰

在連續生成模型演進為主流的過程中,存在幾個關鍵的理論與工程瓶頸:

傳統 CNF 訓練昂貴且需數值 ODE 求解

連續正規化流(CNF)透過常微分方程(ODE)將簡單基礎分佈 p_0 轉換為目標數據分佈 p_1。然而傳統 CNF 的最大痛點在於訓練階段必須反覆呼叫數值 ODE solver 進行前向與反向傳播,計算代價極高,難以擴展至高維度影像生成。

擴散採樣軌跡彎曲且步數過多

標準擴散模型在隨機去噪過程中,軌跡往往高度彎曲且各路徑相互交錯。若在推論時使用較大的步長,數值積分誤差會急劇放大,迫使模型必須採取數十步甚至上百步細緻推論才能維持畫質。

確定性採樣缺乏嚴格的多項式收斂保證

雖然經驗上將 SDE 轉換為確定性的 Probability Flow ODE(PF-ODE)能顯著加速採樣,但學界長期缺乏針對 PF-ODE 離散化誤差與收斂速率的嚴格理論證明,在高維空間下的穩定性邊界不明確。

逐步求解數值積分難以滿足即時生成需求

即便是經過加速的 ODE solver,生成一張圖依然需要 4 到 20 步模型前向傳播。對於需要毫秒級響應的即時互動場景(如即時畫布、影片即時串流),逐步去噪的推論延遲依然過高。

依賴 Latent VAE 造成不可逆的高頻細節損耗

為了降低計算量,多數流匹配與擴散模型都建立在預訓練的 Latent VAE 之上(如 LDM、SD3)。但 VAE 的降維壓縮不可避免地會遺失文字邊緣、微小紋理與高頻細節,成為生成畫質的硬天花板。


主要貢獻

這五篇論文從流場理論、軌跡拉直、收斂保證、一步採樣到像素級擴展,給出了一套層層推進的解法:

解決: 傳統 CNF 訓練昂貴且需數值 ODE 求解

Flow Matching (ICLR 2023) 提出了一種全新的無迴圈(Simulation-Free)訓練目標:
– 全局邊際路徑 p_t(x) 混合了所有樣本軌跡,難以直接計算。作者引入條件機率路徑(Conditional Probability Path, CPP) p_t(x|x_1) 與條件向量場 u_t(x|x_1)
– 證明了在條件流匹配(Conditional Flow Matching, CFM)損失下回歸神經網路向量場 v_t(x)

    \[\mathcal{L}_{\text{CFM}}(\theta) = \mathbb{E}_{t, q(x_1), p_t(x|x_1)} \left[ \| v_t(x; \theta) - u_t(x|x_1) \|^2 \right]\]


其梯度等價於在無法直接計算的真實邊際向量場上優化。
– 特別是最優傳輸條件向量場(OT-CFM),將路徑定義為兩點之間的線性插值:x_t = (1 - t) x_0 + t x_1,其目標向量場為常數 u_t(x|x_1) = x_1 - x_0,大幅簡化了訓練難度。

小筆記:為什麼 CFM 可以代替真實邊際流場?
數學上的關鍵在於邊際機率與條件機率的積分關係。因為 p_t(x) = \int p_t(x|x_1) q(x_1) dx_1,對應的邊際向量場 u_t(x) = \int u_t(x|x_1) \frac{p_t(x|x_1) q(x_1)}{p_t(x)} dx_1。展開二維差方損失後可以證明,兩者對網路參數 \theta 的期望梯度完全一致。這意味著訓練時只需要每次隨機抽樣一對 (x_0, x_1) 做直線回歸,就能學到正確的全局邊際流動!

解決: 擴散採樣軌跡彎曲且步數過多

Rectified Flow (NeurIPS 2023) 從另一個角度出發,直接探討如何把分佈間的轉換軌跡「拉直」:
– 定義常微分方程 d Z_t = v(Z_t, t) dt,目標是學習一個向量場,讓初值 Z_0 \sim p_0 沿直線前進抵達 Z_1 \sim p_1
– 提出 Reflow 程序:若初次訓練的模型生成的軌跡仍有部分彎曲或交叉,可以透過模型生成一組配對數據 (Z_0, Z_1^{\text{gen}}),重新作為訓練集進行微調。
– 經過 1 到 2 次 Reflow 迭代後,軌跡幾乎完全筆直,推論時即便使用粗糙的單步或少步 Euler step,也能精準抵達目標分佈,大幅縮短採樣時間。

解決: 確定性採樣缺乏嚴格的多項式收斂保證

The Probability Flow ODE is Provably Fast (NeurIPS 2023) 給出了 PF-ODE 的首個理論收斂性證明:
– 引入了分數微擾引理(Score Perturbation Lemma),克服了先前理論分析中 Lipschitz 連續性條件過於嚴苛的限制。
– 證明在合理的平滑度假設下,PF-ODE 採樣所需的迭代步數在維度依賴性上達到 \mathcal{O}(\sqrt{d}),在理論複雜度上顯著優於傳統 SDE 採樣的 \mathcal{O}(d),為確定性加速採樣提供了堅實的數學背書。

解決: 逐步求解數值積分難以滿足即時生成需求

Consistency Models (ICLR 2024) 徹底顛覆了逐步數值求解的思維:
– 定義一致性函數(Consistency Function) f: (x_t, t) \mapsto x_0,其核心性質是:處於同一條 PF-ODE 軌跡上的任何時間點,經過函數映射後都必須得到同一個起點 x_0
– 提供兩種訓練範式:
1. 一致性蒸餾 (Consistency Distillation, CD):利用訓練好的擴散或流模型作為 Teacher,訓練 Student 網路強制滿足相鄰時間點的一致性約束。
2. 獨立一致性訓練 (Consistency Training, CT):無需任何預訓練模型,直接在未標註數據上端到端優化一致性損失。
– 推論時只需輸入隨機雜訊 x_T 並調用 f(x_T, T),即可達成單步(1-step)高質量生成,或透過 2~4 步多步採樣進一步提升保真度。

解決: 依賴 Latent VAE 造成不可逆的高頻細節損耗

PixelFlow (arXiv 2025) 重新將目光放回原始像素空間:
– 探討直接在 Pixel Space 進行大規模 Flow Matching 生成的可行性與架構優化。
– 透過針對像素維度設計的高效 Backbone 與多尺度流匹配策略,擺脫 VAE 編解碼器的結構性失真,在高頻紋理、精細文字渲染上展現了純像素生成模型的優勢。


延伸探討

這五篇工作構成了生成模型從「擴散方程」過渡到「幾何向量場」的完整閉環:
1. Flow Matching 解決了「怎麼優化連續流場」的數學工具問題(CFM)。
2. Rectified Flow 解決了「如何讓軌跡盡量筆直」的效率問題(Reflow)。
3. PF-ODE 收斂分析 補齊了確定性採樣的理論複雜度保證。
4. Consistency Models 則在極限速度上給出了一步生成的自映射解法。
5. PixelFlow 則驗證了當流場訓練足夠穩定、網路容量足夠大時,生成模型有機會直接擺脫 Latent 壓縮的束縛,重回像素空間。


心得

Flow Matching 和 Rectified Flow 是近年生成模型領域少數在理論優雅性與工程實用性上都極具突破的工作。過去 Diffusion 的 DDPM、SDE 推導充斥著大量繁瑣的隨機微積分與雜訊排程(noise schedule)調整,而 Flow Matching 直接將問題還原為最單純的向量場回歸:給定起點與終點,學一個速度向量場拉過去就好。

這種直觀的物理圖像不僅大幅降低了理論門檻,也直接啟發了 Stable Diffusion 3、FLUX.1、Sora 等新一代 SOTA 模型的設計。生成模型未來的發展,確定性流場與一步一致性蒸餾無疑是極其核心的支柱。