瑞典的 MASAI 隨機試驗,把 AI 支援的乳房攝影篩檢流程,與原有的雙人判讀流程放在一起比較。AI 協助分流與偵測,醫師仍參與判讀。

2025 年發表的分析顯示,AI 組每千人檢出 6.4 例癌症,對照組為 5.0 例。這回答了篩檢當下的偵測問題。研究同時保留後續追蹤,觀察兩次例行篩檢之間被診斷出的間隔癌。MASAI 2025 年研究

2026 年發表的主要結果中,AI 組間隔癌率為每千人 1.55 例,對照組為每千人 1.76 例,符合研究預先設定的不劣性判定。兩組點估計雖有差距,研究並未證明間隔癌顯著減少,也未證明死亡率下降。MASAI 2026 年研究摘要

同一項試驗,分成不同階段回答問題。當下多找到多少癌症,和下一輪篩檢前還有多少人被診斷出癌症,需要等待不同的資料。對準備導入醫療 AI 的團隊而言,這種等待本身就是驗證工作的一部分。瑞典的流程與結果能否適用於臺灣,也還需要另外評估。

《2026 生技產業白皮書》第 145–151 頁整理數位醫療的發展,第 361–363 頁談 AI 的治理與應用。這些工作到了醫院,終究要回答採用之後究竟改變了什麼。

一張效能表還回答不了的事

模型的敏感度、特異度或其他效能指標,能回答特定測試條件下的問題。醫院要決定是否採用,還需要知道這個測試和預定用途有多接近。

拿協助判讀影像來說,工具可能用來標示可疑位置,也可能協助安排判讀順序。兩者都與影像有關,對工作流程的影響卻不同。驗證之前,應先說清楚工具在哪一步介入,以及原本的做法是什麼。

比較的對象也必須說清楚。如果研究比較的是模型與某組既有標記,不能直接回答醫師使用之後是否更快完成工作。若只記錄操作時間,也不足以判斷病人的健康結果是否改善。每一種指標都有用途,重點是結論不要跨得比證據更遠。

所以「提升醫療品質」這句話需要往下追問:改善的是哪一段照護,哪些病人適用,與原來的做法相比差在哪裡?醫院不能只靠一張效能比較表決定怎麼用。

美國 FDA、加拿大衛生部與英國 MHRA 共同提出的良好機器學習實務原則,將人與 AI 團隊的表現列為重點。三方良好機器學習實務原則

醫師遇到與自身判斷不同的提示時,需要哪些資訊才能確認?如果每次都得跳到另一個系統查找,新增的操作就應算進評估。提示是否容易理解,也要讓實際使用的人試過才知道。

導入也可能重新分配工作。例如,某個工具協助醫師先處理高風險個案,後續確認與聯繫的需求可能隨之改變。這些影響需要在實際場域量測,才能知道省下的時間是否伴隨其他新增工作。

第一線人員能回報困難之後,還要有人處理。否則一個每天多花幾分鐘的操作問題,可能一直留在那裡,最後變成使用者自行繞過系統。

更新以後,原來的證據還適用嗎

醫院的設備、收案族群與工作方式可能改變,軟體本身也可能更新。導入時的驗證因此需要銜接後續追蹤,確認原本的表現是否仍然成立。

FDA 在 2025 年公布的 AI 醫療器材軟體生命週期管理指引草案,討論持續效能監測等安排。截至 2026 年 9 月,該文件仍標示為草案,提供的是管理建議與討論方向。FDA 2025 年指引草案

醫院與開發者需要事先約定哪些變化要檢查,發現問題由誰判斷是否暫停。追蹤門檻得依產品用途與風險設計,並沒有一個數字適合所有工具。

版本也要能追溯。同一個產品名稱之下,更新前後的模型或設定可能不同。若成效報告沒有記錄版本與使用條件,下一個團隊就很難判斷,自己採用的是否仍是當時驗證過的安排。

臨床表現、日常維運與支付安排,是導入時必須分別回答的問題。有一項研究支持效能,不代表醫院已經安排好整合與支援;取得產品許可,也不能直接推定特定服務已獲健保給付。

費用如果只算軟體授權,醫院端新增的工作可能被漏掉。工具省下多少時間,需要和為了使用它而付出的時間一起看。

試用結束之後,軟體也許會留下。跟著留下的維護、追蹤與教育訓練,要由誰負責、費用從哪裡來,應該在試用之前就開始談。


資料來源:《2026 生技產業白皮書》,經濟部產業發展署,2026 年 8 月,印刷頁 145–151、361–363;MASAI 原始研究及監管機關文件如文中連結。流程、採購與追蹤安排屬作者分析。

模型表現之後,還有兩層驗證
  1. 模型表現

    在指定資料與任務上,結果如何?

  2. 臨床使用

    放進醫院流程後,對病人與工作有什麼影響?

  3. 持續監測

    使用環境或版本改變後,誰追蹤與處理問題?

這些是不同層次的驗證問題,不代表特定系統已通過;非劣性、優越性與死亡率改善也須分開判讀。