Survey: Vicious Classifiers: Data Reconstruction Attack at Inference Time

2024-01-22
| arXiv 2022

David Stutz, Ali Shafahi, Arnaud Doucet, Bernt Schiele

📑 投影片連結:20240122 Vicious Classifiers.pptx

當前挑戰

在機器學習即服務(MLaaS)以及開源模型生態日益普及的背景下,許多企業或終端使用者會直接下載第三方預訓練好的模型,或是調用雲端 API。

傳統直覺通常認為:模型在推論(Inference)階段僅僅回傳一個預測類別(Top-1 Label)或是一組類別機率分佈(Softmax Logits),因此輸入的私有圖片與敏感資訊應該是安全的,不可能透過單次推論的少數幾個浮點數外洩。

MLaaS 推理輸出常被誤認不具資料外洩風險

使用者普遍對推論階段的輸出缺乏防範意識。然而,神經網路具有極強的參數量與擬合彈性,若模型提供者本身抱持惡意(Malicious Provider),完全可以在模型內部建立「隱蔽通道(Covert Channel)」,將輸入資料偷偷編碼並夾帶至輸出之中。

傳統重建評估指標忽略特徵先驗與資訊價值

過去衡量資料重建品質時多半使用像素級均方誤差(MSE)或結構相似性(SSIM)。但這些純幾何指標無法衡量特定樣本相對於母體分佈的「資訊價值」與「洩漏嚴重度」,無法精準量化攻擊在不同特徵分佈下的實質風險。


主要貢獻

這篇論文揭露了一種新型態的供應鏈攻擊——惡意分類器 (Vicious Classifier)。研究證明:惡意模型可以在保持主要分類準確率幾乎不受影響的前提下,把輸入圖片的高保真度特徵,隱蔽地嵌入到單次推論輸出的 Logits 尾部擾動中,攻擊者只需攔截 API 輸出便能精準還原原始圖片。

解決: MLaaS 推理輸出常被誤認不具資料外洩風險

作者提出了惡意模型聯合訓練架構(Vicious Model Formulation)
誠實模型(Honest Model F:單純最小化主任務損失 \mathcal{L}_{task}(F(x), y)
惡意模型(Vicious Model F_{vic} 與攻擊解碼器 G:聯合優化主任務與重建目標:

    \[\mathcal{L}_{total} = \mathcal{L}_{task}(F_{vic}(x), y) + \lambda \mathcal{L}_{recon}(G(F_{vic}(x)), x)\]


其中重建損失 \mathcal{L}_{recon} 同時結合了感知結構損失(SSIM)與統計損失(Huber Loss)。
– 惡意模型學會了一種隱寫術:在預測正確類別(最大 Logit)的同時,將整張圖片的壓縮特徵藏在非主要類別的微小機率波動中。攻擊者只需將該 API 輸出的 Logits 餵入預先訓練好的解碼器 G,就能瞬間高保真還原出使用者的私有輸入影像。

小筆記:隱蔽通道的威力
只要分類類別數足夠(例如 ImageNet 的 1000 類,或數百類的人臉庫),Softmax 輸出的向量維度足以承載經高度壓縮的影像潛在特徵(Latent Feature)。這意味著使用者以為只是在做普通的分類查詢,實際上每一次呼叫都在默默將自己的照片「打包外傳」。

解決: 傳統重建評估指標忽略特徵先驗與資訊價值

針對風險量化與防禦問題:
重建風險指標(Reconstruction Risk):作者基於馬氏距離(Mahalanobis Distance, MD)設計了新的評估指標,將重構影像與真實特徵分佈中心進行比較,量化攻擊對邊緣、稀有特徵資料的實質洩漏威脅。
防禦機制:從資訊理論視角出發,惡意模型為了塞入額外資訊,其輸出 Logits 的資訊熵(Entropy)與局部梯度分佈往往異於正常模型。透過監控輸出分佈的異常混亂度,或是對輸出進行 Logits 截斷與精度縮減(Precision Reduction / Logit Truncation),就能在不損害分類性能的情況下阻斷資訊洩漏。