科大研發 | 創新人工智能框架,實現通用 + 專科醫學模型高效協作
  • 2026-07-31 15:45

(上圖)陳浩博士(中),論文共同第一作者何肅南(左)及聶宇翔(右)

香港科技大學領導開發了一套名為 GSCo 的人工智能框架,讓通用醫學基礎模型與專科模型在臨床任務中分工合作。測試顯示,GSCo 在醫學影像診斷、視覺問答、放射報告生成等多項任務中均優於單獨使用通用模型或專科模型,並可把新臨床任務的研發成本大幅降低近 100 倍。研究已刊於《自然-生物醫學工程》。

論文:

框架已公開發布:

 

研究背景

醫學人工智能模型在真實臨床應用中,一直面對一個兩難局面:通用基礎模型基於大規模醫學影像與文本資料預訓練,具備較強的跨任務能力與模態適應性,但在單一疾病或特定臨床問題上,往往不如專科模型,然而,專科模型雖能針對特定領域提供更專業、細緻的判斷,但適用範圍狹窄,一旦切換到新任務、新醫院或新數據分布,就常常需重新訓練。此外,醫療場景還受到病人私隱與數據合規的限制,模型難以反覆搬移到不同醫院進行微調,否則將引起高昂的成本。

研究成果

香港科技大學計算機科學及工程學系、化學及生物工程學系助理教授、醫工交叉聯合創新中心主任陳浩博士領導的團隊,聯同哈佛醫學院、威爾康奈爾醫學院、香港中文大學、香港大學、中山大學等院校合作,提出 GSCo 框架(Generalist - Specialist Collaboration,通用-專科協作)。

該框架建立在陳浩博士此前研發的開源醫學通用模型 MedDr 之上,MedDr 使用了多模態醫學影像與超過 200 萬個樣本進行預訓練。而專科模型則採用較輕量設計,僅需單張消費級 GPU 便可完成訓練。

在這套架構中,專科模型的角色類似「專家顧問」,在推論過程中負責把當前患者與最相近的過往病例進行比對,並提出診斷預測;MedDr 則作為「總決策者」,把專科模型提供的局部證據,與其自身的醫學知識加以整合,輸出最終結果。

研究團隊在 32 個公開數據集、合共約 260,000 張醫學影像上,對 GSCo 進行全面測試,涵蓋醫學影像診斷、視覺問答及放射報告生成等任務。結果顯示,單獨的 MedDr 已優於現有多個醫學通用模型如 RadFM、LLaVA-Med 和 Med-Flamingo;而加入 GSCo 框架後,整體表現更佳,在所有內部及外部基準測試中取得總體第一名,優於 10 個當前最先進的視覺基礎模型。

以皮膚病變診斷為例。團隊先用 HAM10000 皮膚鏡數據集訓練專科模型,再透過 GSCo 框架部署到新的 BCN20000 數據集上。結果顯示,GSCo 的表現達 0.8420,高於通用模型 MedDr 在零樣本情況下的 0.7545,也優於專科模型單獨運作時最佳的 0.8292。在另一項胸部 X 光報告生成的臨床人工評估中,七位執業放射科醫生中有六位認為 GSCo 生成的報告質量優於目前先進的專科模型 R2GenGPT。

此外,團隊還設計了壓力測試,故意在病理圖像輸入中引入系統性偏差,假設所有圖像都被誤標為正常。此情況下,MedDr 仍可正確辨識出 67.6% 的腫瘤影像,顯示其具備較強的糾錯能力,而這也是 GSCo 整體性能穩定提升的重要原因。

從部署角度看,與大型通用模型的直接微調相比,透過 GSCo 為新臨床任務開發專科模型,其研發成本可降低近 100 倍。同時,專科模型可在各醫院本地數據環境中訓練,病人資料無需離開機構,較容易符合醫療數據私隱與合規要求。

團隊計劃將 MedDr 進一步擴展至電腦斷層掃描、磁力共振成像等三維影像模態及醫學影像領域,並探索更先進的多模態及基於圖結構的檢索策略,研究通用與專科模型之間更多元化的協作形式,例如引入測試時運算,賦予模型深度思考能力,進一步提升診斷結果的準確度。

研究團隊

論文共同第一作者是香港科技大學何肅南、聶宇翔,通訊作者是陳浩博士。香港中文大學影像及介入放射學系朱昭穎教授、病理解剖及細胞學系陳昌堅名譽副教授,香港大學放射診斷學系臨床助理教授 Varut Vardhanabhuti 也是共同作者。

 

 


如欲知道更多教科相關消息,請留意京港 Facebook 專頁:https://www.facebook.com/BHKAEC

返回頂部