Survey: Unstoppable Attack: Label-Only Model Inversion via Conditional Diffusion Model

2024-06-10
| ACM CCS 2023

Rongke Liu, Dong Wang, Yizhi Ren, Zhen Wang, Kaitian Guo, Qianqian Qin, Xiaolei Liu

📑 投影片連結:20240610 Unstoppable Attack.pptx

當前挑戰

在真實世界的商用 API 服務中,為了保護模型與資料隱私,伺服器通常只會回傳預測標籤(Label-Only),也就是 Top-1 類別名稱,而不會揭露完整的 Softmax 機率分佈或 Logit 向量。

在這種嚴格的黑盒設定下,現有的模型反演攻擊(Model Inversion Attack, MIA)面臨兩大瓶頸:

只有硬標籤(Label-Only)無法取得梯度與置信度分佈

傳統的反演方法極度仰賴目標模型輸出的連續機率值(Confidence Score)來估算梯度或指導生成器優化。一旦目標 API 只回傳離散的 Hard Label,既有的梯度逼近或白盒反演演算法幾乎直接失效。

傳統 GAN 反演易發生 Mode Collapse 且重建多樣性極差

過去基於 GAN 的反演框架本身就容易遇到模式崩潰(Mode Collapse),針對每個目標類別往往只能重建出單一、模糊且特徵僵化的樣本,無法還原該類別在真實訓練資料中的多樣化人臉與姿態。

小筆記:模型反演攻擊(Model Inversion Attack)
目標是僅透過查詢目標模型(Target Model),在沒有原始訓練資料的前提下,逆向重建出該模型訓練集中的私有敏感資料(例如特定個人的真實臉孔)。


主要貢獻

這篇論文提出了首個在 Label-Only 黑盒條件下,利用條件擴散模型(Conditional Diffusion Model, CDM)實現高精度模型反演的攻擊框架。

解決: 只有硬標籤(Label-Only)無法取得梯度與置信度分佈

攻擊者雖然無法碰觸目標模型的私有訓練集,但可以使用公開的通用輔助資料集 D_{aux}(例如一般公開人臉資料)查詢 Target Model,取得對應的預測標籤:

  1. 標籤蒸餾:用目標模型的 Label-Only 輸出作為 pseudo label,將目標模型對特徵的分類邊界行為隱式注入輔助資料中。
  2. 條件擴散訓練:訓練一個條件擴散模型(CDM),將目標標籤 y 與時間步 t 的 Positional Encoding 進行對齊相加作為條件輸入,學習以標籤為條件的生成分佈。
  3. Label Dropout:在訓練時以機率 p 隨機丟棄標籤條件(設為無條件生成),避免擴散模型過度依賴標籤而對噪聲模式產生過擬合。

解決: 傳統 GAN 反演易發生 Mode Collapse 且重建多樣性極差

擴散模型具備涵蓋完整資料分佈的生成優勢,作者透過以下機制確保重建質量與代表性:

  1. 條件引導採樣(Guidance Sampling):在逆向去噪階段,透過標籤引導強度 \omega 控制生成樣本朝向目標類別的特徵流形靠攏。
  2. 代表性權重評分(Representative Weighting)
    – 採樣出大量候選圖像後,對每張影像施加 M 次隨機幾何變換(Random Crop、Flip 等)。
    – 將變換後的影像重新輸入 Target Model,統計其預測穩定度與一致性置信度。
    – 挑選出最具代表性且辨識度最高的 Top-k 重建影像。

延伸探討

評估指標分析:為什麼 LPIPS 比 FID 更適合反演任務?

論文在實驗中討論了評估指標的選擇:
Attack-Acc (\uparrow):將重建影像輸入未參與攻擊的獨立第三方評估模型,測試其是否能被正確辨識為目標身分。
KNN-Distance (\downarrow):計算重建影像與真實私有影像在特徵空間的最短歐氏距離。
LPIPS vs FID:傳統生成常用 FID 評估分佈距離,但在反演場景下,每個類別的真實樣本數量有限,FID 容易受到樣本數影響而不穩定;相對地,LPIPS(感知特徵距離)具備固定的評估尺度,更能反映單張重建影像與真實私有影像之間的感知細節相似度。

Gamma 校正修復跨域分佈落差

由於公開輔助資料集 D_{aux} 與私有目標資料集在光影、曝光與色彩飽和度上往往存在 domain gap,作者在生成後處理中引入了 Gamma Correction,自適應微調亮度分佈,進一步拉近重建影像與目標私有資料的視覺特徵。