Survey: Real-Time Multiple People Tracking with Deep Candidates Selection (MOTDT)

2026-08-16
| ICME 2018

Chen Long, et al.

當前挑戰

在即時多目標追蹤系統中,主要存在以下幾項瓶頸:

檢測結果不可靠與同類別物件互相遮擋

在擁擠環境下,單純依賴物件檢測器極易受遮擋影響產生大量 False Negative(漏檢)或 False Positive(誤檢)。當兩個行人重疊時,外觀特徵互相干擾,導致資料關聯(Data Association)階段頻繁出現身份切換(ID Switch)。

檢測與追蹤互補示意圖
Detection 與 Track 的互補關係。Detection 具有邊界框與置信度,但易受遮擋干擾;Track 則在檢測失靈時透過運動模型維持軌跡預測,兩者互為備援。

候選人數量過多且重複區域特徵計算過重

如果將每一幀檢測器產生的 Proposal 與先前所有追蹤軌跡的預測框全部獨立提取特徵並做分類,候選框的數量會急劇膨脹。像傳統 Fast R-CNN 逐個 Patch 運算的作法,在重疊區域會產生大量重複計算,無法滿足即時追蹤的 FPS 要求。

R-FCN 節省追蹤時間分析
不同檢測器在 MOT 中的耗時比較。採用全卷積共享特徵的 R-FCN 能夠顯著壓低每一幀的特徵提取與候選人篩選時間。

RoI 均值投票丟失空間定位資訊

若直接以整張圖的前景機率圖(Score Map)進行 RoI 內部的簡單平均來判定候選框置信度,會遺失目標的空間幾何資訊——例如一個只包含人體半截手臂的錯誤邊界框,也可能因為局部高機率而拿到虛高評分。

卡爾曼濾波長期推測漂移且檢測與追蹤候選人難以有效融合

卡爾曼濾波器(Kalman Filter)在短期遮擋時能提供平滑的軌跡延續,但若長時間缺乏真實檢測框的校準,其預測誤差會隨時間迅速發散;同時,如何量化檢測與軌跡預測各自的可靠度並進行最優融合,缺乏合理的數學評分機制。


主要貢獻

MOTDT 將整體架構劃分為「候選人篩選(Candidate Selection)」與「資料關聯(Data Association)」兩大核心模組:

解決: 檢測結果不可靠與同類別物件互相遮擋

在資料關聯階段,作者提出了分層資料關聯(Hierarchical Data Association)配合 Re-ID 特徵:
Re-ID 特徵提取:採用 GoogLeNet 骨幹以 Triplet Loss 訓練的行人重識別特徵,以特徵向量之間的歐氏距離衡量外觀相似度。
分層匹配策略
1. 第一層(高可靠度):先對高置信度的檢測候選框 C_{\text{det}} 依據 Re-ID 外觀特徵距離與先前軌跡進行匹配。
2. 第二層(補漏機制):對未匹配成功的殘留軌跡與候選人,再使用卡爾曼濾波的空間 IoU 進行二次關聯。
3. 軌跡生命週期管理:仍未匹配的候選人作為新目標建立新軌跡;長時間失去關聯的軌跡則予以終止。

分層資料關聯演算法流程
Hierarchical Data Association 演算法流程,優先以外觀距離匹配檢測框,再以空間 IoU 關聯運動預測框。

解決: 候選人數量過多且重複區域特徵計算過重

作者採用 R-FCN (Region-based Fully Convolutional Network) 作為共享 Backbone:
– 捨棄逐個 Patch 獨立做特徵提取的低效方式,全圖只過一次卷積主幹(ResNet-101),生成位置敏感的特徵圖。
– 透過 RPN 生成 RoI,大幅減少了重疊候選區域的重複計算量,為後續即時追蹤爭取了充裕的時間預算。

輕量化 Encoder-Decoder 得分圖生成架構
輕量級 Encoder-Decoder 特徵提取器,搭配上採樣生成全圖的前景置信度分佈。

解決: RoI 均值投票丟失空間定位資訊

為了保留空間幾何敏感度,作者將 R-FCN 的位置敏感評分機制借用到候選框打分上:
– 將每個 RoI 切分成 k \times k 個子網格(bins)。
– 每個子網格先在對應的位置敏感特徵圖上加總,再對所有 k^2 個 bins 進行整體平均並取 Sigmoid。
– 簡單來說就是把 R-FCN 的空間投票那套借來 RoI Pooling 用一下,確保只有完整覆蓋人體各部位的邊界框才能獲得高置信度。

位置敏感 RoI Pooling 投票機制
將候選框劃分為 k^2 個空間區塊分別採樣評分,有效避免局部殘缺框誤判為完整目標。

解決: 卡爾曼濾波長期推測漂移且檢測與追蹤候選人難以有效融合

作者設計了追蹤置信度動態衰減與雙軌融合機制
追蹤置信度計算:定義 L_{\text{det}} 為該 tracklet 歷史關聯到的檢測框數量,L_{\text{trk}} 為自上次成功關聯到檢測框後、純靠軌跡預測延續的幀數。置信度公式的前半部隨 L_{\text{trk}} 增大而遞減——資料關聯(DA)越久沒被檢測框修正,分數就越差;後半部則是一個門檻條件,要求至少完成兩次 DA,s_{\\text{trk}} 才有意義。
> ⚠️ 原始素材未涵蓋:Notion 筆記僅以文字描述上述邏輯,該置信度公式的具體數學形式僅存在於一張已失效的 Notion 圖片中(見下方 IMG 註記),本文不逕行還原,避免杜撰函數形式。

Track 置信度評分計算公式
基於追蹤歷史與中斷時長的置信度評估公式。
  • 雙軌綜合評分:將檢測候選集 C_{\text{det}} 與軌跡預測集 C_{\text{trk}} 的分數統一,經由 Non-Maximum Suppression (NMS) 篩選出最終高品質候選人。
檢測與追蹤分數聯合篩選公式
聯合 Detection 與 Track 的綜合得分函數,經 NMS 剔除重複候選。

延伸探討

實驗成果與指標評估

論文採用了 MOT 領域常見的評測指標,包括 MOTA(Multiple Object Tracking Accuracy)、FAF(每幀誤報數)、MT/ML(大部分被追到/大部分丟失的目標比例)、FP/FN、IDS(Identity Switch)、IDR、IDF1 等,詳細定義可參考[這篇整理](https://www.cnblogs.com/yanwei-li/p/8670658.html)。

MOT16 數據集指標對比
MOTDT 在 MOT16 Benchmark 上的測試結果。
各模組消融實驗分析
消融實驗結果。

⚠️ 原始素材未涵蓋:Notion 筆記僅保留了上述兩張結果圖片與指標定義連結,未附具體數值或文字結論,故本文不推論「優於 SOTA」或排名之類的定性結果。


心得

MOTDT 是一篇在工程巧思與實用性上做得非常紮實的工作。在 Transformer 追蹤器尚未問世的 2018 年,它敏銳地指出了 Tracking 與 Detection 各自的死穴——檢測容易被遮擋騙,而卡爾曼濾波預測久了會飄。

透過借用 R-FCN 的位置敏感機制解決候選框打分問題,再用「先外觀距離、後幾何 IoU」的分層關聯策略,MOTDT 以極其精巧的設計在有限的計算資源下跑出了流暢穩健的追蹤效果。這種模組間互補與置信度動態衰減的思想,在現代多目標追蹤系統中依然是非常經典的參考範式。