📑 投影片連結:20230619 SGIEL.pptx
當前挑戰
可見光-紅外線行人重辨識(Visible-Infrared Person ReID, VI-ReID)要處理的是跨模態搜尋問題:白天攝影機拍到的是可見光(RGB)影像,夜晚則切換成紅外線(Infrared, IR)影像。兩者之間存在巨大的模態落差(Modality Gap),RGB 帶有豐富的顏色與紋理,而 IR 幾乎只剩下光強與輪廓。
VI-ReID 的核心就在於找出跨模態的共享特徵。過去許多方法直覺地依賴「體型(Body Shape)」作為跨模態的不變量,但光靠身形往往無法區分穿著或體型相近的人。
體型特徵粗糙且易造成跨模態混淆
體型雖然在紅外線與可見光下相對穩定,但人體幾何輪廓這類特徵太過粗糙,缺乏足夠的辨識細節。當資料庫中出現多個體態相似的行人時,過度依賴形狀資訊反而容易導致模型誤判。

特徵解耦不完全與學習速度不均
如果單純用多分支網路去抽取不同屬性,不同分支提取到的特徵往往還是互相混雜、存在冗餘。此外,形狀特徵(容易學)與形狀擦除後的細節特徵(較難學)兩者的收斂速度差異極大,容易出現其中一個分支主導整體梯度的情況。
主要貢獻
這篇論文提出了形狀擦除特徵學習範式(Shape-Erased Feature Learning, SGIEL),核心思維是利用數學上的正交性,將特徵空間乾淨地拆解為「形狀特徵」與「形狀擦除特徵」,讓兩者各自具備獨立的辨識能力。
解決: 體型特徵粗糙且易造成跨模態混淆
作者引入半正交矩陣分解(Semi-orthogonal Matrix Decomposition)來建立正交投影空間:
– 將特徵映射到形狀子空間
,提取純粹的體型輪廓特徵。
– 將特徵同時投影至正交補空間
,得到「擦除體型後」的特徵,迫使模型去挖掘體型以外的細節與外觀線索。
– 如此一來,形狀空間與非形狀空間在幾何上完全正交,徹底杜絕了特徵間的干擾與重疊。
小筆記:半正交分解的作用
正交補空間的幾何特性保證了投影後的特徵與原形狀特徵內積為零。這代表形狀擦除分支完全無法「作弊」借用身形輪廓,必須完全靠細粒度紋理與局部辨識線索來降低 loss。
解決: 特徵解耦不完全與學習速度不均
針對兩個子空間難度不同、學習進度失衡的問題,作者設計了動態梯度範數權重調整機制:
– 監控兩個特徵分支在反向傳播時的梯度範數(Gradient Norm),以此作為各分支學習進度的量化指標。
– 動態調配 loss 權重:對於進度落後、難度較高的分支給予更大的梯度權重,避免模型被較容易收斂的形狀分支牽著走。