Survey: AutoVP: An Automated Visual Prompting Framework and Benchmark

2024-07-08
| ICLR 2024

Hsi-Che Lin, Jerry Yao-Chieh Hu, Pin-Yu Chen, Han-Jia Ye, Han Liu

📑 投影片連結:20240708 AutoVP.pptx

當前挑戰

在參數量日益龐大的視覺骨幹網路(Vision Backbone)時代,參數高效微調(Parameter-Efficient Fine-Tuning, PEFT)成為下游遷移任務的重要手段。其中,視覺提示調優(Visual Prompt Tuning, VPT)透過在輸入圖像周圍或內部加入少量的可學習像素擾動(Visual Prompt),在完全凍結骨幹網路權重的前提下適應新任務。

然而,現有的視覺提示方法多半依賴人工手動設計,面臨以下挑戰:

提示詞形狀與位置過度依賴人工啟發式設計

過去的方法通常固定在圖片四周加上固定寬度的 padding 框,或者在固定網格插入 patch。但不同任務與資料集對圖像尺寸、提示位置、遮罩形狀的敏感度落差極大,人工設計很難找到最佳配置。

下游新類別與預訓練標籤空間難以自動對齊

在完全凍結預訓練分類器時,下游任務的新類別(New Classes)必須映射回預訓練模型原本的類別輸出空間(Label Space)。若缺乏合理的映射機制,模型輸出與下游標籤之間的語義對齊會嚴重受限。

小筆記:視覺提示(Visual Prompting)的核心機制
與 NLP 中直接在文字序列開頭插入 soft token 類似,視覺上的 Visual Prompt 是直接將可學習的連續像素貼在輸入圖像上(如四周的 padding border 或全圖疊加的 noise pattern),讓預訓練模型在不改動任何權重的情況下,將注意力轉移到目標任務特徵上。


主要貢獻

這篇論文提出了 AutoVP,一個端到端自動化搜尋與配置最優視覺提示的框架,並建立了標準基準測試。

解決: 提示詞形狀與位置過度依賴人工啟發式設計

AutoVP 將提示設計拆解為可微優化的組合模組:

  1. 可微輸入縮放(Input Scaling):利用 Kornia 可微幾何變換調整輸入圖片的尺寸,動態釋放給 Visual Prompt 使用的空間。
  2. 可學習提示遮罩(Visual Prompt Mask):在給定的空間內,透過可學習的連續 Mask 自動學習 Prompt 應該出現在圖片的哪些位置與形狀,擺脫傳統固定寬度框框的束縛。

解決: 下游新類別與預訓練標籤空間難以自動對齊

AutoVP 系統化提出了四種輸出標籤映射(Output Label Mapping)策略,將預訓練的原始類別 Logits 轉換為下游任務類別:

  • 頻率映射(FreqMap):根據下游訓練集在各原始類別上的預測頻率進行統計分配。
  • 語義映射(SemanticMap):利用類別名稱在文字嵌入空間(如 Word2Vec 或 Text Encoder)的餘弦相似度進行對齊。
  • 迭代映射(IterMap):在訓練過程中交替優化 Visual Prompt 與標籤映射矩陣。
  • 全連接線性映射(FullyMap):直接在凍結輸出後接一層輕量線性分類頭進行聯合學習。

延伸探討

多種 Vision Backbone 的廣泛適應性

論文在多種不同的視覺架構上進行了廣泛評測,包括傳統卷積網路(ResNet-18, ResNeXt-101)、階層式 Transformer(Swin-T)以及多模態對齊模型(CLIP ViT-B/32)。實驗結果顯示,透過自動化搜尋提示位置與標籤映射策略,AutoVP 在各類架構上皆顯著優於傳統固定形狀的手動 Visual Prompting。