Survey: Re-thinking Model Inversion Attacks Against Deep Neural Networks (LOMMA)

2024-05-03
| CVPR 2023

Ngoc-Bao Nguyen, Keshigeyan Chandrasegaran, Milad Abdollahzadeh, Ngai-Man Cheung

📑 投影片連結:

當前挑戰

模型反演攻擊(Model Inversion Attack, MIA)是一種針對神經網路的白盒或黑盒隱私攻擊。攻擊者試圖透過存取一個已經訓練好的目標分類模型(Target Model),逆向反推並還原出當初訓練該模型時所使用的私有資料(例如人臉辨識資料庫裡的敏感照片)。

現有的 SOTA 模型反演方法(如 GMI、KEDMI、VMI)普遍採用生成對抗網路(GAN)搭配交叉熵損失(Cross-Entropy Loss)進行潛在向量優化。但這個行之已久的典範其實存在兩大根本缺陷:

交叉熵損失導致身份目標不對齊

如果一張圖被模型分類成 Simon,那它真的長得像當初訓練用的那個 Simon 嗎?不一定。

在數學上,最小化 Cross-Entropy Loss(-\log P(y=k|x))其實有兩條路可以走:
1. 讓正確類別的 Logit 變大
2. 讓所有錯誤類別的 Logits 變小

優化器往往會投機地選擇壓低錯誤類別的得分來降低 loss。但我們在做特徵還原時,需要的是讓生成圖「更像正確目標」,而不是「更不像其他人」。這種目標不對齊導致反演出的影像特徵往往停留在次優解(Sub-optimal)。

LOMMA 整體攻擊架構與反演流程
LOMMA (LOM + MA) 的整體框架。透過對數機率極大化(LOM)聚焦目標特徵,並結合知識蒸餾產生的增強模型(MA)打破反演過程對單一目標模型的過擬合。

模型反演中的過擬合現象

過去大家只注意模型訓練時的過擬合,卻忽略了模型反演過程也會過擬合(Overfitting in MI)

作者發現:對特定 Target Model M(例如 IR152)反演出的照片,雖然在 M 上的識別 loss 極低,但如果把這張照片丟進另一個同樣訓練於該私有資料庫的模型 M'(如 VGG16)測試,有超過 26% 的樣本 loss 劇烈飆高;若拿到公開預訓練模型測試,更有近四成樣本直接失效。這代表反演過程過度擬合了單一模型的決策邊界與參數瑕疵,並非真正抓到了該人物的真實外貌特徵。


主要貢獻

這篇 CVPR 論文提出了 LOMMA,由兩個核心模組組成:對數機率極大化(Logit Maximization, LOM)模型增強(Model Augmentation, MA),分別直擊上述的目標不對齊與反演過擬合問題。

解決: 交叉熵損失導致身份目標不對齊

作者提出捨棄傳統 Cross-Entropy,改用 Logit Maximization (LOM) 損失:
– 設倒數第二層特徵向量為 p,目標類別 k 的權重向量為 w_k,該類別 Logit 即為內積 p^T w_k
LOM 損失函數定義為:

    \[\mathcal{L}_{LOM} = - p^T w_k + \lambda_{reg} \|p - \mu_{pen}\|_2^2\]


– 直接強迫模型將目標類別的 Logit 最大化,徹底擺脫非目標類別負向梯度的干擾。
– 同時加入特徵正則化項,將特徵 p 約束在倒數第二層特徵均值 \mu_{pen} 附近,防止數值無限膨脹導致生成崩潰。

小筆記:LOM 的物理直覺
拿掉 Softmax 的分母之後,優化方向純粹聚焦在拉近 pw_k 的餘弦夾角及長度。特徵正則化項則像一個彈簧,把特徵限制在真實人臉特徵空間的合理球面上,保證還原出的人臉兼具高辨識度與視覺自然度。

解決: 模型反演中的過擬合現象

為了解決反演過擬合問題,作者提出了 Model Augmentation (MA)
知識蒸餾多模型輔助:將原本的 Target Model 當作 Teacher,利用未標註的公開資料集,透過知識蒸餾(Knowledge Distillation)訓練多個不同骨幹網路的 Student Models(如 MobileNet, EfficientNet)。
Augmentation Identity Loss:在反演優化潛在向量時,要求生成的影像不僅要滿足 Target Model,還必須同時在所有 Student Models 上取得極高的目標 Logit。
– 透過多架構的交叉約束,迫使生成器拋棄單一網路特有的數值瑕疵,提取真正具備跨架構泛化力的核心身分特徵。


延伸探討

突破 SOTA 隱私防禦機制

作者在 CelebA 與 FaceScrub 資料集上進行了全面評估(評估指標包含 Attack Accuracy 與特徵空間的 KNN 距離):
– 無論在標準 Target Model 還是黑盒評估模型上,LOM+MA 生成的影像在五官清晰度與身分識別率上皆大幅勝過先前的 GMI 與 VMI。
– 面對專門防禦模型反演的 SOTA 防禦機制(如 Bilateral Dependency Optimization, BDO),LOMMA 依然能穩定突破防線,重建出高精度的私有人臉圖像。


心得

LOMMA 點出了一個非常漂亮但長期被忽視的盲點:大家都習慣無腦套用 Cross-Entropy 做優化,卻忘了 Cross-Entropy 在多分類時是「相對競爭」而非「絕對表徵」。

把優化目標換成純粹的 Logit 極大化加上均值正則化,數學形式極其簡單,效果卻立竿見影。加上透過知識蒸餾做 Model Augmentation 來緩解反演過擬合,整篇論文的邏輯閉環非常嚴密,是模型安全與隱私領域非常值得細讀的佳作。