浸大聯合研究 | 創新自我更新元學習框架,助力物聯網流量分類
  • 2026-07-07 17:41

香港浸會大學學者與印度院所合作,針對現代深度學習解決方案的一個致命缺陷,提出了解決之道。目前的方案常常假設數碼世界是靜止不變的。團隊從而提出透過持續監測系統自身的不確定性,在遇到無法識別的流量時自動更新,同時平衡了貝葉斯架構的不確定性建模和高速決策性能的需要,以有效解決網路適應性的核心挑戰。研究成果已刊於《IEEE Internet of Things Journal》。

論文:

 

研究背景

物聯網的蓬勃發展帶來了前所未有的網路數據激增,這些數據大都受到進階安全協定的嚴密保護。不過,傳統以連接埠為基礎(Port-based)和深度封包檢測(DPI)的方法在加密和動態連接埠使用的情況下已失效,於是促使了基於機器學習與深度學習(ML/DL)的加密流量分析發展。

然而,後者也存在一個致命缺陷,它們假設數碼世界是靜止不變的,假設流量分佈靜態、應用程式集也是固定的。這問題限制了它們在現實世界流量演變下的穩健性。

研究成果

浸大計算機科學系戴弘寧博士與 ABV 印度資訊科技與管理學院的學者合作,提出系統可透過持續監測自身的不確定性,在遇到無法識別的流量時自動更新。

該框架的核心創新在於策略性分工,平衡了深度的統計感知與高速決策能力:系統並非在所有環節都使用高成本的貝葉斯架構,而是將工作拆分為多個獨立且專業化的組件。其中,代理貝葉斯神經網路(BNN)專責評估預測置信度,並識別數據分佈何時開始偏移。同時,一組傳統的高速確定性模型,如梯度提升樹(Gradient-boosted tree)和多層感知器,則負責快速處理原始流量特徵,以確保異質歸納偏差(Heterogeneous inductive biases)與低預測相關性(Low prediction correlation)。隨機森林元分類器(Random forest meta-classifier)作為最終決策者,將所有這些輸出融合成單一的分類結果。至於未知流量的標記,則利用海林格距離(Hellinger distance)直接從貝氏輸出中評估預測的不穩定性,從而避免傳統較繁重的正規化步驟。

這種混合設計,將貝葉斯推理中獲得的認知不確定性、及樹狀模型的判別特徵學習相結合,實現了穩健性,且保持了極低的運算負擔。

具體而言,當輸入的數據包產生混亂或極度不穩定的預測時,該框架會計算出一個專門的「熟悉度評分」。如果不穩定性超過某個閾值,且熟悉度評分過低,系統會將該流量加以標記,以待檢查。每當新應用程式改變網路流量時,系統不會強行耗費巨大資源的重新全量訓練,而是依賴選擇性數據收集。被標記的未知數據包會被捕獲、過濾並緩衝到擴展的知識庫中,而隨機森林元分類器會進行快速、輕量化的重新訓練步驟以吸收新資訊。

在針對基準 ISCX 2016 數據集(該數據集追蹤了瀏覽、郵件、串流媒體和網路電話等活動的加密流量)的嚴格測試中,這款混合元學習器的表現超越了現有的先進模型,可靠性顯著提升,實現了高達 95.7% 的準確率和 0.95 的 macro-F1 分數。

 


如欲知道更多教科相關消息,請留意京港 Facebook 專頁:https://www.facebook.com/BHKAEC

返回頂部