Survey: On the Reconstruction of Face Images from Deep Face Templates (NbNet)

2026-08-16
| TPAMI 2018

Guangcan Mai, Kai Cao, Pong C. Yuen, Anil K. Jain

當前挑戰

在人臉辨識(Face Recognition, FR)系統中,安全性威脅主要分為兩大類:
1. 實體感測器端攻擊:利用列印照片、3D 仿真面具或重播攻擊(Replay Attack)欺騙攝影機。
2. 特徵模板注入攻擊:從系統後端或傳輸鏈路中截獲 feature template,透過逆向演算法重建出逼真的人臉影像,並直接注入比對模組。

人臉識別系統的安全性漏洞
人臉識別系統的兩類攻擊途徑:藍線代表感測器端的實體偽造攻擊;紅線代表從後端模板資料庫外洩特徵並進行影像逆向重建的特徵注入攻擊。

人臉模板無法單向雜湊且多未受密碼學保護

傳統密碼可以經過 SHA-256 等單向雜湊(Hash)安全地存放在資料庫中。但人臉辨識是基於特徵空間的模糊比對,每次採集到的 embedding 不可能與註冊模板 100% 相同,必須容忍一定程度的歐氏距離或夾角誤差。這導致人臉模板無法直接做傳統 Hash,市面上許多商用 SDK 甚至直接以明文儲存高維 feature embedding。

小筆記:模板保護硬體
現行部分硬體架構(如 iPhone 的 Secure Enclave 或 ARM TrustZone)嘗試以安全隔離區保護特徵資料,但若特徵在傳輸或雲端資料庫外洩,攻擊者便具備逆向分析的條件。

黑箱特徵逆向還原的潛在威脅

過去普遍認為即便拿到了數百維的 embedding 浮點數,也難以反推出原始人臉外貌。然而,攻擊者只要取得公開資料集,並透過商用 SDK 作為黑箱特徵抽取器 \hat{f}(x),就能在不知道目標使用者個人背景與註冊環境的情況下,訓練逆向還原網路。


主要貢獻

這篇發表於 TPAMI 的經典論文提出了 Neighboring-based Network (NbNet),展示了僅憑外洩的 Deep Face Template 與公開人臉資料集,就能訓練出高還原度的人臉重建模型。

解決: 人臉模板無法單向雜湊且多未受密碼學保護

作者系統化定義了模板重建攻擊(Template Reconstruction Attack)的威脅模型:
攻擊者目標:利用偽造影像冒充資料庫中的目標身分,侵入系統。
已知資訊:外洩的目標模板 y_t 與黑箱特徵抽取器 y=\hat{f}(x)(可透過購買或取得商用 SDK 取得)。
未知資訊:目標人物的真實相片、註冊光照環境一概不知。
攻擊策略:使用公開資料集訓練重建模型 g_\theta(\cdot),使 x_t = g_\theta(y_t) 生成逼真的人臉影像,且能在極少嘗試次數(如小於 5 次)內通過系統驗證。

解決: 黑箱特徵逆向還原的潛在威脅

作者設計了專門用於高維 embedding 逆向還原的卷積神經網路架構 NbNet,並探討了不同的 Block 設計與 Loss 函數:

NbNet 架構圖
NbNet 的整體重構流程。(a) 透過連續的反卷積模組逐步將 1D embedding 放大為 2D 人臉;(b) 基礎 DconvOp (De-Conv + BN + ReLU);(c) Block A 引入多個 ConvOp 並在 channel 維度拼接;(d) Block B 借鑑 DenseNet 的跨層相加連接。
  • 損失函數的選擇
    1. Pixel Difference (MAE):直接計算像素級差異 L_{pixel} = \sum_{m=1}^M |x_m - x'_m|
    2. Perceptual Loss:在人臉驗證任務中,特徵層面的語義一致性遠比純像素均方誤差更重要。作者使用 VGG-19 的 ReLU3-2 特徵計算感知損失:

        \[L_{percept} = \frac{1}{2}\|F(x) - F(x')\|_2^2\]

  • 資料擴增:以 VGG-Face 為基底,並額外引入 DCGAN 生成增強樣本,擴充訓練多樣性。

延伸探討

實驗結果與分析

實驗結果圖
不同網路架構與損失函數下的重建效果對比。
  • 架構對比:具備密集連接的 Block B 在大多數情況下優於 Block A。
  • 損失函數:Perceptual Loss 重建出的人臉在五官結構與特徵比對通過率上明顯優於單純的 MAE。
  • 泛化能力:即便在與預訓練分佈不同的跨資料集測試中,NbNet 重建出的人臉依然具備很高的身分匹配率。