A doctor checking and MRI film

指南

 

了解醫療人工智慧 (AI) 與傳統軟體有何不同,包括攸關安全的複雜性與法規挑戰。

 

 

 

作者:UL Solutions 首席顧問暨全球醫療網路安全負責人 Anura S. Fernando

人工智慧 (AI) 已成為全球家喻戶曉的詞彙,但 AI 的概念其實並不新穎。

很久以來,人類就將部分認知能力轉移到工具與軟體中,其最早可追溯至藉由書寫與計算減輕回憶與回想所帶來的心理負擔。而開始有真正的新變化在於,AI 如今在攸關安全的醫療技術應用變得越來越多。

在這類領域中,即使是設計、效能或學習上的細微差異,也可能導致不成比例的嚴重後果。

從傳統健康軟體到學習型 AI

狹義的 AI 已逐步發展成如今所謂的生成式人工智慧 (gen AI),並為安全、性能與監管帶來新的考量 ── 儘管被視為原始形式的 AI,早已在數十年以來支援救命的應用。而隨著這些系統日益複雜,製造商與監管機關遂必須籌思並因應這類學習型行為如何設計、控制,並能與時持續予以監測。

當今臨床環境中所採用的先進醫療 AI 系統,大多是由通常稱為「狹義 AI」的技術演變而來。其核心是深度學習,技術源自機器學習 (ML)、神經網路,以及更早期支撐現代健康軟體的數位邏輯形式。雖然這些系統可透過訓練或更新進行調整,但其行為仍受限於製造商所定義的架構、資料控管與變更流程。

健康軟體有幾種不同形式,各自對應不同的法規要求與風險特性:

  • 醫療器材內建軟體 (Software in a Medical Devic, SiMD) 曾以多種不同名稱描述,例如嵌入式系統、嵌入式軟體、韌體等。它指的是嵌入醫療器材中,用於控制或支援設備運作的軟體。由於這類軟體與器材硬體整合在一起,傳統上會被視為醫療器材的一部分進行監管。
  • 醫療器材軟體 [作為醫療設備的軟體](Software as a Medical Device, SaMD) 如今亦已使用了數十年,其常被描述為諸如醫療應用程式、行動應用程式、雲端服務和臨床決策支援軟體等名稱。但無論採取哪一種名稱,SaMD 指的是在個人電腦或伺服器等通用運算平台上運作的軟體。
  • 在專用醫療器材硬體上運作的非醫療器材軟體,是另一種類型的健康軟體,如在受醫療器材法規監管之硬體上運作的作業系統 (OS) 即屬於此類。在多數監管體系與實務情境中,OS 製造商通常不會被視為該醫療器材的法定製造商。相反地,醫療器材製造商 (MDM) 才是整合整體產品的開發者 ── 包含在 OS 上運作的應用程式。
  • 在通用運算硬體上運作的非醫療器材軟體,則是最後一類健康軟體。這類軟體的範疇可涵蓋所有能與醫療器材連接,或是可能與本身硬體與軟體均不在監管機關管轄範圍內之醫療器材相關。此分類亦會因各司法管轄區對「醫療器材」定義的不同,以及全球監管政策的差異而有所歧異。電子病歷系統 (EHR) 即是其中一個差異的例子。EHR 系統通常會接收來自醫療器材的資料,也能向醫療器材反饋資料,其在某些情況下,甚可成為臨床工作流程的整合中心。在美國等部分地區,EHR 並未被納入醫療器材監管;但在歐盟等其他地區,則會落到受監管範圍中。

綜合來看,這些分類顯而易見「健康軟體」一詞的涵蓋範圍甚為廣泛。而在定義如此廣泛下,我們有必要進一步思考:搭載 AI 的醫療軟體究竟有何不同之處?

醫療 AI 有何特別之處?

答案在於,學習型系統如何挑戰長久以來人們長久以來對軟體可控性與可預測性的基本假設。為了回答這個問題,我們需要檢視軟體技術的進程如何與監管科學同步演繹。以下的討論正聚焦於美國醫療器材監管體系,該體系亦為監督以軟體為基礎的醫療技術建立了早期框架。

美國食品藥物管理局 (FDA) 自 1970 年代起,便開始審查含有軟體的醫療器材。到 1990 年代後期,FDA 建立了監管科學框架並完善軟體相關政策,進而制定第一份 FDA 軟體指引。FDA 甚至在其 510(k) 第三方審查計畫中,認可諸如 UL Solutions 等機構協助評估軟體及其他相關事項。

無論彼時或現在,FDA 的核心關注始終是透過妥善的檢測 (verification) 與驗證 (validation) 機制,確保依賴軟體運作的醫療器材之安全性與有效性。在監管用語中,「檢測」關注的是產品是否依既定規格建置,醫療設備製造商通常簡化為:「我是否正確地把產品做出來?」;相對而言,「驗證」則是檢視產品是否符合其預期的臨床需求,一言之蔽之:「我是否做出了正確的產品?」

雖然這兩個問題看似簡單,但其中蘊含的細微差異卻至為重要,因此促使 FDA 在環繞這些概念下逐步建立了日趨完整的指導體系。隨時間演進,FDA 陸續就多個不同領域發布相應的專用規範,如獲醫療器材採用的商用現成軟體 (off-the-shelf software)、SaMD、行動醫療應用、醫療器材資料系統,以及臨床決策支援軟體等。不過,這些監管框架大多是為「行為不會自行改變」的軟體所制定。

隨著健康軟體變得更加互聯且應用更廣,監管機構也進一步發布後續指導文件,以處理跨領域風險,包括網路安全 (cybersecurity)、品質系統考量、上市前申請文件內容,以及上市後網路安全管理的相關期望。

為何醫療 AI 對傳統驗證機制帶來挑戰

目前已有數十份指引文件在不同程度上涵蓋軟體相關議題,但醫療 AI 具備某些獨特特性,使其成為一種特殊存在的軟體形式,因此需要專門的監管框架。與傳統軟體不同,即使是在預先限制範圍內,學習型系統的性能特性仍可能會隨時間變動,而非在產品發布後就維持不變。

FDA 已開始採取分階段方式予以因應,首先著手規範較精密的 AI 工具如何支援監管理審查。例如 2025 年 1 月的指引草案《用於支援藥品與生物製品監管決策的人工智慧使用考量》(Considerations for the Use of Artificial Intelligence to Support Regulatory Decision-Making for Drug and Biological Products),以及針對器材層級的指引《人工智慧賦能之器材軟體功能:生命週期管理與上市申請建議》(Artificial Intelligence-Enabled Device Software Functions: Life Cycle Management and Marketing Submission Recommendations)。

由於生成式 AI 高度仰賴學習型適應能力,故傳統的組態管理 (Configuration Management, CM) 方法已無法完全適用。不同於傳統軟體,這類系統可透過預先定義、限制並授權的學習流程,改變其性能特性;不過此也帶來新的不確定性,需要透過完整的生命週期控管來加以管理。

FDA 透過《醫療器材預先變更控制計畫》(Predetermined Change Control Plan) 對此一挑戰的因應予以指引。其要求製造商事先定義設備在使用期間可能發生的變更類型,說明如何依據預先設定的驗收標準,對變更施以檢測與驗證。這個方法同時也要求需進行效益風險評估,以明確提出風險緩解措施,並界定可接受的剩餘風險。

特別值得一提的重點,這些基於學習的系統並非自主運作。所以所有的適應行為都必須在製造商設定且經監管機構審查的邊界內進行,而不是透過自主目標設定或自我導向控制。

自 1990 年代後期以來,FDA 其實便已開始評估 AI ── 更精確而言是機器學習的部份 ── 在醫療應用中的使用,如乳房攝影影像處理。然而,如今興起的生成式 AI 帶來了更多層次的技術複雜性。這類系統依賴張量 (tensor) 等進階數學結構,並透過神經網路對物理現實進行建模。

這種額外添加的複雜性,大幅增加了系統所需處理的資料量。能夠高效率地管理資料至為重要,不僅關乎最佳化記憶體與運算效能,也涉及龐大資料在高速運算中對能源消耗與熱產生的控制。

為了管理種種衍生而出的複雜度,其一常見技術正是「量化」(quantization) ,以藉由降低資料量與精確度,減少運算負載、能源消耗和熱輸出。然而,這樣的效率提升通常也伴隨著取捨:相較於原始資料集,會出現一定程度的資訊保真度與準確性的下降。

在多數非安全關鍵的消費型 AI 應用中,這類取捨普遍可被接受,因為其對整體性能影響有限。然而在醫療應用中,即使是微小的準確度損失,也可能造成帶來實質的臨床後果 ── 這是兩者之間的重要差異。讓我們繼續探討這項差異。

醫療 AI 的另一個關鍵特徵在於其使用情境。在醫療領域中,病患安全允許在治療效益可證明其合理性的情況下,就能接受具有一定風險的技術。例如化療、腫瘤消融,以及診斷性 X 光檢查等例行臨床程序,皆屬此類。

當生成式 AI 導入這些應用時,其必須能處理所謂的「邊緣情境」(edge conditions) ── 即細微的解剖或生理差異 ── 這些差異可能決定某一項介入措施是有效還是有害。在血液或軟組織等複雜生物系統中,這意味著必須精準鎖定癌細胞等特定類型的細胞,同時又得避免損害周圍組織。一旦無法達成,可能會從貧血等相對低風險影響導致病患死亡等嚴重後果的不同結果。

如前所述,生成式 AI 常用的最佳化技術,例如量化,可能造成細微的資料真實度損失。在臨床情境中,價值取捨的重要程度極為明顯 ── 尤其當系統未針對醫療邊緣情境進行最佳化時,即使僅微幅準確度下降,也可能造成不成比例的嚴重後果。

監管機關如何在醫療 AI 部署後進行監控

上述僅是使醫療 AI 顯得特殊的鳳毛麟角之考量。為因應前仆後繼的挑戰,全球各地的監管機關正加強合作,以推進監管科學的發展,並對具 AI 功能的醫療技術逐步建立一致的監管期望。監管機關也與 UL Standards & Engagement 等私部門的標準制定組織協作,以幫助醫療設備製造商 (MDM) 採用一致的方法進行軟體檢測與驗證,而這類工作通常也會與 UL Solutions 這樣的測試、檢驗與認證 (TIC) 組織共同合作。

除了上市前審查外,像美國 FDA 這類的監管機關也會針對既有與新興技術持續進行市場監督。這種上市後監督 (post-market oversight) 在識別實際使用環境中出現的性能問題上扮演關鍵角色,因為這些問題往往在開發階段或初期核准時無法完全顯現。

歷史經驗清楚顯示了此類監督的重要性。

隨著軟體技術朝向更高程度的自主行為發展,例如 Therac-25 放射治療加速器事件等失效案例,也揭示了軟體缺陷可能如何導致嚴重傷害甚至人命損失。1為防止這類事件再次發生所付諸的努力,正是促使業界建立現代對上市後監控與矯正措施的高標準期待。

儘管 AI 本質上仍屬於軟體,但其能在被定義限制下所擁有的學習與適應的能力,帶來了仍在持續被理解的特性。倘若缺乏完善的上市後監督工具,例如產品召回、現地改善措施和矯正行動計畫,則醫療 AI 中的新興弱點可能無法被及時發現,而會進一步提高病患風險及增加醫療體系負擔。

因此,持續性的監督,對於安全推動創新不可或缺。

UL Solutions 如何協助推動更安全的醫療 AI

要安全地開發與監督醫療 AI 技術,需要應對並處理原本就未設計在傳統監管指引與生命週期管理內的一系列挑戰。

憑藉數十年的技術、法規與臨床專案經驗,我們的專家可協助製造商因應醫療器材安全、網路安全測試、法規審查和上市後監督,讓 AI 賦能的技術能與支持病患安全的監管架構、品質系統和監督機制同步發展*。

深入了解我們如何支援醫療產業

 

 

參考資料

1. Leveson, N., Turner, G., “An Investigation of the Therac-25 Accidents,” Computer, Vol. 26, 7; pp 18-41; July 1993. https://web.stanford.edu/class/archive/cs/cs240/cs240.1236/old//sp2014/readings/therac-25.pdf

 

* UL Solutions 能為各類醫療器材產業提供廣泛的服務組合,包括認證、核准/公告機構 (Approved/Notified Body) 和諮詢服務。為避免實質或潛在的利益衝突,並保障我們與客戶品牌的聲譽,UL Solutions 針對識別並管理任何可能的利益衝突已制定相關流程,以確保法規符合性評估服務的公正性。

相關資源

能力

醫療器材的性能和安全測試

服務

健康醫療科技網路安全