📑 投影片連結:20240122 Vicious Classifiers.pptx
當前挑戰
在機器學習即服務(MLaaS)以及開源模型生態日益普及的背景下,許多企業或終端使用者會直接下載第三方預訓練好的模型,或是調用雲端 API。
傳統直覺通常認為:模型在推論(Inference)階段僅僅回傳一個預測類別(Top-1 Label)或是一組類別機率分佈(Softmax Logits),因此輸入的私有圖片與敏感資訊應該是安全的,不可能透過單次推論的少數幾個浮點數外洩。
MLaaS 推理輸出常被誤認不具資料外洩風險
使用者普遍對推論階段的輸出缺乏防範意識。然而,神經網路具有極強的參數量與擬合彈性,若模型提供者本身抱持惡意(Malicious Provider),完全可以在模型內部建立「隱蔽通道(Covert Channel)」,將輸入資料偷偷編碼並夾帶至輸出之中。
傳統重建評估指標忽略特徵先驗與資訊價值
過去衡量資料重建品質時多半使用像素級均方誤差(MSE)或結構相似性(SSIM)。但這些純幾何指標無法衡量特定樣本相對於母體分佈的「資訊價值」與「洩漏嚴重度」,無法精準量化攻擊在不同特徵分佈下的實質風險。
主要貢獻
這篇論文揭露了一種新型態的供應鏈攻擊——惡意分類器 (Vicious Classifier)。研究證明:惡意模型可以在保持主要分類準確率幾乎不受影響的前提下,把輸入圖片的高保真度特徵,隱蔽地嵌入到單次推論輸出的 Logits 尾部擾動中,攻擊者只需攔截 API 輸出便能精準還原原始圖片。
解決: MLaaS 推理輸出常被誤認不具資料外洩風險
作者提出了惡意模型聯合訓練架構(Vicious Model Formulation):
– 誠實模型(Honest Model
):單純最小化主任務損失
。
– 惡意模型(Vicious Model
與攻擊解碼器
):聯合優化主任務與重建目標:
![]()
其中重建損失
– 惡意模型學會了一種隱寫術:在預測正確類別(最大 Logit)的同時,將整張圖片的壓縮特徵藏在非主要類別的微小機率波動中。攻擊者只需將該 API 輸出的 Logits 餵入預先訓練好的解碼器
小筆記:隱蔽通道的威力
只要分類類別數足夠(例如 ImageNet 的 1000 類,或數百類的人臉庫),Softmax 輸出的向量維度足以承載經高度壓縮的影像潛在特徵(Latent Feature)。這意味著使用者以為只是在做普通的分類查詢,實際上每一次呼叫都在默默將自己的照片「打包外傳」。
解決: 傳統重建評估指標忽略特徵先驗與資訊價值
針對風險量化與防禦問題:
– 重建風險指標(Reconstruction Risk):作者基於馬氏距離(Mahalanobis Distance, MD)設計了新的評估指標,將重構影像與真實特徵分佈中心進行比較,量化攻擊對邊緣、稀有特徵資料的實質洩漏威脅。
– 防禦機制:從資訊理論視角出發,惡意模型為了塞入額外資訊,其輸出 Logits 的資訊熵(Entropy)與局部梯度分佈往往異於正常模型。透過監控輸出分佈的異常混亂度,或是對輸出進行 Logits 截斷與精度縮減(Precision Reduction / Logit Truncation),就能在不損害分類性能的情況下阻斷資訊洩漏。