Note: Confusion Matrix

2023-05-14

當前挑戰

在機器學習與模式識別的分類任務中,最直覺且普遍採用的評估指標莫過於準確率(Accuracy)。然而,在實際工程與研究場景中,單一的 Accuracy 往往隱藏著致命的評估盲點,容易讓開發者對模型效能產生過度樂觀的誤判。

Accuracy 的致命盲點:類別不平衡(Class Imbalance)

考慮一個標準的二元分類場景,我們利用決策邊界(Decision Boundary)將空間劃分為左右兩側(左側預測為紅點,右側預測為藍點):

二元分類決策邊界範例
以決策邊界進行二元分類的示意圖:7 個樣本分類正確、3 個錯誤,此時 Accuracy 為 70%。

在此基準下,7 個點正確、3 個點錯誤,Accuracy 為 70%。看起來表現尚可,但若考慮極端不平衡的分佈:

  • 假設藍點僅有 4 個,而紅點高達 396 個(總樣本數 400)。
  • 若分類器採取極端策略,將所有樣本全部預測為紅色,整體 Accuracy 依然高達 99%
  • 但單就藍點而言,該模型的識別準確率實質為 0%。在醫療診斷(如罕見疾病檢測)或異常偵測等高成本場景中,這類模型毫無實用價值。

概念混淆:Precision 與 Recall 的記憶痛點

為了解決不平衡問題,評估標準轉向 Precision(精確率)Recall(召回率)。但在實務推導與實作時,兩者的定義與分子分母組合極容易相互混淆。

小筆記:Precision 與 Recall 的直覺記憶法

  • Precision:聚焦於同一側(side)預測結果中的準確率(在所有被模型判定為 Positive 的樣本中,到底有多準?)。
  • Recall:聚焦於真實全體(all)正樣本的命中率(在真實世界所有的 Positive 樣本中,模型召回/抓出了多少?)。

核心指標與數學定義

為消除直覺上的混淆,我們透過 混淆矩陣(Confusion Matrix) 拆解預測與真實標籤的四種交集狀態:

Confusion Matrix 四象限示意圖
將模型預測與真實類別正交拆解為四個區塊:TP、TN、FP、FN。

四象限定義(以紅色為 Positive,藍色為 Negative)

  • True Positive (TP):真實為紅,模型亦成功判定為紅(真陽性)。
  • True Negative (TN):真實為藍,模型亦成功判定為藍(真陰性)。
  • False Positive (FP):真實為藍,模型誤判為紅(偽陽性,型 I 錯誤)。
  • False Negative (FN):真實為紅,模型誤判為藍(偽陰性,型 II 錯誤)。

指標公式精確化

在四象限基礎上,各指標可形式化表述為:

  • Precision(精確率):模型預測為 Positive 的子集合中,真實為 Positive 的比例(左半部的上半部)。
    \text{Precision} = \frac{\text{TP}}{\text{TP} + \text{FP}}
  • Recall(召回率):真實世界所有 Positive 樣本中,被模型成功抓出的比例(上半部的左半部)。
    \text{Recall} = \frac{\text{TP}}{\text{TP} + \text{FN}}
  • Accuracy(準確率):矩陣主對角線元素佔全體樣本之比例。
    \text{Accuracy} = \frac{\text{TP} + \text{TN}}{\text{TP} + \text{FP} + \text{TN} + \text{FN}}

💡 核心特徵:Precision 與 Recall 的分子皆為 TP,差別僅在於分母範疇(Precision 的分母是「模型挑出的所有正向預測」,Recall 的分母是「客觀存在的所有真實正向標籤」)。


延伸探討

F1-Score:Precision 與 Recall 的調和折衷

在大多數實際工程中,Precision 與 Recall 往往存在 Trade-off 權衡關係。為了提供單一指標以綜觀模型表現,常引入 F1-Score

\text{F1-score} = 2 \cdot \frac{\text{Precision} \times \text{Recall}}{\text{Precision} + \text{Recall}}

  • 調和平均數(Harmonic Mean)的幾何意義:調和平均對極端低值給予非常嚴厲的懲罰。只要 Precision 或 Recall 其中一項接近 0,F1-Score 就會迅速崩塌,從而迫使模型在兩者之間取得平衡。
  • 限制與缺點:F1-Score 的可解釋性(Interpretability)較弱。當 F1-Score 在訓練過程中提升時,我們無法直觀判斷該增益主要是由 Precision 的改善還是 Recall 的攀升所貢獻,需進一步回溯混淆矩陣方能定位根本原因。

參考資料

YouTube 頻道:Kimberly Fessel


心得

混淆矩陣之所以是機器學習的基石,在於它將抽象的分類效果還原為具體的型 I / 型 II 錯誤分佈。

在不同商業目標下,我們的側重點截然不同:例如在垃圾郵件過濾中,我們寧可漏掉垃圾信(追求更高 Precision),也絕不能將重要正常信誤扔入垃圾桶;反之在瑕疵品檢測與醫療篩檢中,寧可過篩誤報(追求更高 Recall),也絕不容許漏放任何潛在風險。理解混淆矩陣四象限與指標背後的幾何意義,是建構健壯評估管線(Evaluation Pipeline)不可或缺的第一步。