📑 投影片連結:20240708 AutoVP.pptx
當前挑戰
在參數量日益龐大的視覺骨幹網路(Vision Backbone)時代,參數高效微調(Parameter-Efficient Fine-Tuning, PEFT)成為下游遷移任務的重要手段。其中,視覺提示調優(Visual Prompt Tuning, VPT)透過在輸入圖像周圍或內部加入少量的可學習像素擾動(Visual Prompt),在完全凍結骨幹網路權重的前提下適應新任務。
然而,現有的視覺提示方法多半依賴人工手動設計,面臨以下挑戰:
提示詞形狀與位置過度依賴人工啟發式設計
過去的方法通常固定在圖片四周加上固定寬度的 padding 框,或者在固定網格插入 patch。但不同任務與資料集對圖像尺寸、提示位置、遮罩形狀的敏感度落差極大,人工設計很難找到最佳配置。
下游新類別與預訓練標籤空間難以自動對齊
在完全凍結預訓練分類器時,下游任務的新類別(New Classes)必須映射回預訓練模型原本的類別輸出空間(Label Space)。若缺乏合理的映射機制,模型輸出與下游標籤之間的語義對齊會嚴重受限。
小筆記:視覺提示(Visual Prompting)的核心機制
與 NLP 中直接在文字序列開頭插入 soft token 類似,視覺上的 Visual Prompt 是直接將可學習的連續像素貼在輸入圖像上(如四周的 padding border 或全圖疊加的 noise pattern),讓預訓練模型在不改動任何權重的情況下,將注意力轉移到目標任務特徵上。
主要貢獻
這篇論文提出了 AutoVP,一個端到端自動化搜尋與配置最優視覺提示的框架,並建立了標準基準測試。
解決: 提示詞形狀與位置過度依賴人工啟發式設計
AutoVP 將提示設計拆解為可微優化的組合模組:
- 可微輸入縮放(Input Scaling):利用 Kornia 可微幾何變換調整輸入圖片的尺寸,動態釋放給 Visual Prompt 使用的空間。
- 可學習提示遮罩(Visual Prompt Mask):在給定的空間內,透過可學習的連續 Mask 自動學習 Prompt 應該出現在圖片的哪些位置與形狀,擺脫傳統固定寬度框框的束縛。
解決: 下游新類別與預訓練標籤空間難以自動對齊
AutoVP 系統化提出了四種輸出標籤映射(Output Label Mapping)策略,將預訓練的原始類別 Logits 轉換為下游任務類別:
- 頻率映射(FreqMap):根據下游訓練集在各原始類別上的預測頻率進行統計分配。
- 語義映射(SemanticMap):利用類別名稱在文字嵌入空間(如 Word2Vec 或 Text Encoder)的餘弦相似度進行對齊。
- 迭代映射(IterMap):在訓練過程中交替優化 Visual Prompt 與標籤映射矩陣。
- 全連接線性映射(FullyMap):直接在凍結輸出後接一層輕量線性分類頭進行聯合學習。
延伸探討
多種 Vision Backbone 的廣泛適應性
論文在多種不同的視覺架構上進行了廣泛評測,包括傳統卷積網路(ResNet-18, ResNeXt-101)、階層式 Transformer(Swin-T)以及多模態對齊模型(CLIP ViT-B/32)。實驗結果顯示,透過自動化搜尋提示位置與標籤映射策略,AutoVP 在各類架構上皆顯著優於傳統固定形狀的手動 Visual Prompting。