Survey: One-bit Flip is All You Need: Targeted Bit-Flip Attacks during Model Training (TBA)

2024-04-01
| ICCV 2023

Jianshuo Dong, Han Qiu, Yiming Li, Tianwei Zhang

📑 投影片連結:20240401 TBA.pptx

當前挑戰

位元翻轉攻擊(Bit-Flip Attack, BFA)是一種橫跨硬體與演算法底層的實體攻擊。攻擊者利用 DRAM 記憶體物理結構上的瑕疵——例如 Row Hammer 效應或硬體木馬,透過高頻率重複讀取特定記憶體列,誘發相鄰電容漏電,迫使權重儲存位元發生 0 \leftrightarrow 1 的翻轉。

然而,現有的 BFA 研究在真實硬體落地時面臨極大挑戰:

傳統部署期位元翻轉攻擊所需翻轉位元數過多

過去的 BFA 多半聚焦在部署階段(Deployment Stage):假設受害者使用的是在乾淨資料集上正常訓練出來的標準模型。在這種條件下,攻擊者往往需要精確翻轉數十甚至數百個關鍵權重位元,才能讓模型癱瘓或觸發特定分類錯誤。但在實體硬體中(例如使用 SOTA 工具 DeepHammer 在 4KB 記憶體頁內),通常頂多只能精確誘發 1 個 bit 的翻轉,導致部署期純暴力翻轉在現實中極難得手。

惡意攻擊需同時兼顧良性樣本隱蔽性與目標導向性

攻擊者若想在模型中植入後門,必須同時滿足三大苛刻條件:
1. 隱蔽性(Stealthiness):發布的模型在正常良性資料上的測試準確率必須與乾淨模型無異,完全無法從性能指標上察覺異樣。
2. 有效性(Effectiveness):一旦觸發位元翻轉,指定樣本 x^* 必須精準被分類到目標類別 t,而非隨機分錯到其他雜類。
3. 極致效率(Efficiency):所需翻轉的位元數必須極少(理想情況為 1 bit)。


主要貢獻

這篇發表於 ICCV 的論文提出了 Training-assisted Bit-flip Attack (TBA),將攻擊思維從「部署期硬翻」提前到了「訓練期佈局」:攻擊者在訓練發布模型時,就預先把 1-bit 惡意狀態與正常狀態綁定在一起優化。

解決: 傳統部署期位元翻轉攻擊所需翻轉位元數過多

作者將 BFA 轉化為一種新型態的多任務聯合優化:
發布模型(Released Model M_r:平時在終端部署並正常推論,所有良性指標均達頂尖水準。
翻轉模型(Flipped Model M_f:與 M_r 的權重僅相差 1 個特定位元(1-bit Flip)。平時該位元維持原狀,一旦攻擊者在硬體端透過 Row Hammer 翻轉這 1 個 bit,模型立刻變身為 M_f,精準將目標樣本 x^* 誤判為指定類別 t
– 透過在訓練階段主動尋找並構造這種「1-bit 敏感邊界」,徹底解決了部署階段需要翻轉海量位元的硬體瓶頸。

解決: 惡意攻擊需同時兼顧良性樣本隱蔽性與目標導向性

作者設計了針對目標樣本與良性樣本的專用損失函數:

  • 有效性損失 (\mathcal{L}_{eff})

        \[\mathcal{L}_{eff} = \max(0, \text{Logit}_s(x^*) - \text{Logit}_t(x^*)) + \max(0, \max_{j \neq t} \text{Logit}_j(x^*) - \text{Logit}_t(x^*) + m)\]


    – 第一項縮小目標樣本在來源類別 s 與目標類別 t 之間的 Logit 差距。
    – 第二項引入 Margin m,要求目標類別 t 的 Logit 必須比其餘所有非目標類別高出一個固定邊界,避免優化器投機地找到「既不像 s 也不像 t」的隨機誤分類解。
    – 使用 ReLU (\max(0, \cdot)) 的好處在於:一旦特定條件達標即停止回傳梯度,避免過度懲罰干擾其他正常樣本的學習。
  • 隱蔽性損失 (\mathcal{L}_{ste}):強制 M_rM_f 在良性資料集上都必須維持極低的標準分類交叉熵損失。

小筆記:為什麼需要 Margin 與 ReLU?
如果只單純最小化目標類別與來源類別的差距,優化器很容易「作弊」——讓目標樣本在所有類別上的得分都很低,只是碰巧被分錯。加入 Margin 能確保目標類別具有壓倒性的辨識度;而取 max(0, ·) 則能讓達標項及時「煞車」,將梯度完全讓給位元距離的優化。


延伸探討

實驗表現與抗微調能力

量化模型支援:在 CIFAR-10 (ResNet-18, VGG-16) 與 ImageNet (ResNet-34, VGG-19) 上,無論是 4-bit 還是 8-bit 量化神經網路,TBA 均達成了僅翻轉 1~2 個 bit 即可獲得 100% 攻擊成功率(ASR)的成果。
抗微調防禦(Resistance to Fine-tuning):使用 128 個良性樣本對發布模型進行高達 5,000 次梯度微調,潛藏在權重位元內的 1-bit 漏洞依然存在,展現出極高的後門持久性。