Survey: Kolmogorov-Arnold Networks: Architecture Innovation and Mathematical Foundations (KAN)

2025-06-28
| arXiv 2024

Ziming Liu, Yixuan Wang, Sachin Vaidya, Fabian Ruehle, James Halverson, Marin Soljačić, Thomas Y. Hou, Max Tegmark (MIT)

當前挑戰

傳統 MLP 架構在面對複雜科學計算、連續表示與符號推理時,存在幾項本質上的架構局限:

MLP 固定節點激活函數受限於維度詛咒

在 MLP 中,輸入向量經過線性權重矩陣 W x 後,在神經節點上套用固定的單一激活函數 \sigma(\cdot)。當面對高維輸入與複雜非線性交互時,MLP 必須透過不斷加深或堆疊極寬的隱藏層維度來逼近目標函數,容易遭遇嚴重的維度詛咒(Curse of Dimensionality),參數擴展效率逐漸低落。

⚠️ 原始素材未涵蓋:素材為純文字筆記,沒有附架構圖,本文不自行繪製或杜撰示意圖。

深度神經網路黑盒子缺乏數學可解釋性

MLP 的權重分散在龐大的密集矩陣中,難以從數百萬個浮點數權重中反推模型究竟學到了什麼具體規律。在物理、化學等科學發現(AI for Science)領域,科學家更渴望得到清晰的解析數學公式,而非無法解釋的黑盒子預測。

傳統權重全局更新導致嚴重的災難性遺忘

在 MLP 中,每當模型學習新任務並更新梯度時,權重矩陣的調整是全局性的,這會直接破壞模型在舊任務上建立的特徵分佈,導致嚴重的災難性遺忘(Catastrophic Forgetting)。

隱式連續信號與高頻紋理擬合效率低下

在隱式神經表示(Implicit Neural Representation, 如 NeRF、連續超解析度 LIIF)中,使用傳統 MLP 擬合高頻空間座標時,往往需要依賴繁複的位置編碼(Positional Encoding)或大量參數量,難以在保持輕量的同時捕捉銳利的高頻邊界。

小筆記:Kolmogorov-Arnold 表示定理 vs 通用近似定理
通用近似定理(MLP 的基礎):指出具有單個隱藏層的 MLP 只要節點數足夠多,就能以任意精度近似任何連續函數。但其代價是隱藏層寬度可能隨維度呈指數級爆炸。
柯爾莫哥洛夫-阿諾德表示定理(KAN 的基礎):任何定義在有界閉區間上的多元連續函數 f(x_1, \dots, x_n),都可以嚴格表示為有限個單變數連續函數的雙重求和:

    \[f(x_1, \dots, x_n) = \sum_{q=1}^{2n+1} \Phi_q \left( \sum_{p=1}^n \phi_{q,p}(x_p) \right)\]


這意味著我們根本不需要高維交互運算,只需要把 1 維函數學好即可!


主要貢獻

KAN 依據柯爾莫哥洛夫-阿諾德定理,徹底重塑了神經網路的基本計算拓撲:

解決: MLP 固定節點激活函數受限於維度詛咒

KAN 將所有非線性激活函數全部移到連接邊(Edges)上:
– 每一條邊上的映射函數 \phi(x) 被參數化為可學習的 B-樣條(B-Splines)加上一個殘差基底函數(如 \text{SiLU}(x))。
– 神經節點(Nodes)不再具備任何激活操作,僅進行純粹的相加求和(Summation)。
– 在數學函數擬合任務中,KAN 展現了比 MLP 快得多的神經縮放規律(Scaling Laws),以遠少於 MLP 的參數量達到極高的逼近精度。

解決: 深度神經網路黑盒子缺乏數學可解釋性

KAN 具備天然的符號回歸能力:
– 訓練完成後,可以直觀地將每一條邊上的樣條函數形狀可視化。
– 透過結構稀疏化(Pruning)與符號擬合演算法(Symbolic Snapping),能自動辨識出特定邊上的函數型態(如 \sin, \exp, x^2),並將整個網路化簡為乾淨的解析數學公式(例如直接找回物理定律中的守恆公式)。

解決: 傳統權重全局更新導致嚴重的災難性遺忘

利用 B-樣條函數的局部支撐性(Locality)
– B-樣條的基底函數僅在局部的區間節點(Knots)上非零。
– 當模型學習新數據時,梯度更新僅會調整新輸入所在局部區間內的樣條控制點,其餘區間的函數形狀保持原樣,天然具備抵抗災難性遺忘的結構優勢。

解決: 隱式連續信號與高頻紋理擬合效率低下

在後續延伸工作(如 LatentKAN)中,研究者將 KAN 的樣條局部擬合特性引入影像連續超解析度與相機 Raw 域訊號重建:
– 利用 KAN 作為連續隱式座標的解碼器,能夠以極少參數高效捕捉高頻局部細節,顯著優於傳統基於 MLP 的隱式表示模型。


延伸探討

KAN 與 MLP 的深層架構對比

比較維度 傳統多層感知機 (MLP) 柯爾莫哥洛夫-阿諾德網路 (KAN)
激活函數位置 固定於神經節點 (Nodes) 可學習的 B-樣條置於連接邊 (Edges)
節點功能 接收線性加權和後施加非線性變換 單純求和操作 (Summation)
可解釋性 極低(黑盒子矩陣權重) 極高(可直接提取符號數學公式)
連續學習 / 抗遺忘 差(全局權重更新引發干擾) 優(B-樣條局部支撐特性)
GPU 平行效率 極高(高度優化的 GEMM 矩陣乘法) 偏低(樣條運算需針對硬體進一步優化)

心得

KAN 的提出是一次極具美感與啟發性的數學突圍。它提醒了大家:深度學習發展了這麼多年,我們習以為常的架構設計(如固定節點激活)可能只是因為歷史路徑依賴,而非數學上的唯一解。

不過客觀來說,KAN 在現階段依然有其工程短板——現代 GPU 和 TPU 硬體架構是針對大規模矩陣乘法(GEMM)做到極致優化的,而 B-樣條的局部計算在標準框架下難以發揮極限硬體吞吐量。短期內 KAN 在大語言模型等超大算力場景難以完全取代 MLP,但在科學機器學習(AI for Science)、符號推理、以及注重輕量與高頻局部細節的隱式神經表示(如 LatentKAN)等領域,KAN 已經展現出無可替代的獨特價值。