瑞典的 MASAI 隨機試驗,把 AI 支援的乳房攝影篩檢流程,與原有的雙人判讀流程放在一起比較。AI 協助分流與偵測,醫師仍參與判讀。
2025 年發表的分析顯示,AI 組每千人檢出 6.4 例癌症,對照組為 5.0 例。這回答了篩檢當下的偵測問題。研究同時保留後續追蹤,觀察兩次例行篩檢之間被診斷出的間隔癌。MASAI 2025 年研究
2026 年發表的主要結果中,AI 組間隔癌率為每千人 1.55 例,對照組為每千人 1.76 例,符合研究預先設定的不劣性判定。兩組點估計雖有差距,研究並未證明間隔癌顯著減少,也未證明死亡率下降。MASAI 2026 年研究摘要
同一項試驗,分成不同階段回答問題。當下多找到多少癌症,和下一輪篩檢前還有多少人被診斷出癌症,需要等待不同的資料。對準備導入醫療 AI 的團隊而言,這種等待本身就是驗證工作的一部分。瑞典的流程與結果能否適用於臺灣,也還需要另外評估。
《2026 生技產業白皮書》第 145–151 頁整理數位醫療的發展,第 361–363 頁談 AI 的治理與應用。這些工作到了醫院,終究要回答採用之後究竟改變了什麼。
一張效能表還回答不了的事
模型的敏感度、特異度或其他效能指標,能回答特定測試條件下的問題。醫院要決定是否採用,還需要知道這個測試和預定用途有多接近。
拿協助判讀影像來說,工具可能用來標示可疑位置,也可能協助安排判讀順序。兩者都與影像有關,對工作流程的影響卻不同。驗證之前,應先說清楚工具在哪一步介入,以及原本的做法是什麼。
比較的對象也必須說清楚。如果研究比較的是模型與某組既有標記,不能直接回答醫師使用之後是否更快完成工作。若只記錄操作時間,也不足以判斷病人的健康結果是否改善。每一種指標都有用途,重點是結論不要跨得比證據更遠。
所以「提升醫療品質」這句話需要往下追問:改善的是哪一段照護,哪些病人適用,與原來的做法相比差在哪裡?醫院不能只靠一張效能比較表決定怎麼用。
美國 FDA、加拿大衛生部與英國 MHRA 共同提出的良好機器學習實務原則,將人與 AI 團隊的表現列為重點。三方良好機器學習實務原則
醫師遇到與自身判斷不同的提示時,需要哪些資訊才能確認?如果每次都得跳到另一個系統查找,新增的操作就應算進評估。提示是否容易理解,也要讓實際使用的人試過才知道。
導入也可能重新分配工作。例如,某個工具協助醫師先處理高風險個案,後續確認與聯繫的需求可能隨之改變。這些影響需要在實際場域量測,才能知道省下的時間是否伴隨其他新增工作。
第一線人員能回報困難之後,還要有人處理。否則一個每天多花幾分鐘的操作問題,可能一直留在那裡,最後變成使用者自行繞過系統。
更新以後,原來的證據還適用嗎
醫院的設備、收案族群與工作方式可能改變,軟體本身也可能更新。導入時的驗證因此需要銜接後續追蹤,確認原本的表現是否仍然成立。
FDA 在 2025 年公布的 AI 醫療器材軟體生命週期管理指引草案,討論持續效能監測等安排。截至 2026 年 9 月,該文件仍標示為草案,提供的是管理建議與討論方向。FDA 2025 年指引草案
醫院與開發者需要事先約定哪些變化要檢查,發現問題由誰判斷是否暫停。追蹤門檻得依產品用途與風險設計,並沒有一個數字適合所有工具。
版本也要能追溯。同一個產品名稱之下,更新前後的模型或設定可能不同。若成效報告沒有記錄版本與使用條件,下一個團隊就很難判斷,自己採用的是否仍是當時驗證過的安排。
臨床表現、日常維運與支付安排,是導入時必須分別回答的問題。有一項研究支持效能,不代表醫院已經安排好整合與支援;取得產品許可,也不能直接推定特定服務已獲健保給付。
費用如果只算軟體授權,醫院端新增的工作可能被漏掉。工具省下多少時間,需要和為了使用它而付出的時間一起看。
試用結束之後,軟體也許會留下。跟著留下的維護、追蹤與教育訓練,要由誰負責、費用從哪裡來,應該在試用之前就開始談。
資料來源:《2026 生技產業白皮書》,經濟部產業發展署,2026 年 8 月,印刷頁 145–151、361–363;MASAI 原始研究及監管機關文件如文中連結。流程、採購與追蹤安排屬作者分析。
- 模型表現
在指定資料與任務上,結果如何?
- 臨床使用
放進醫院流程後,對病人與工作有什麼影響?
- 持續監測
使用環境或版本改變後,誰追蹤與處理問題?
這些是不同層次的驗證問題,不代表特定系統已通過;非劣性、優越性與死亡率改善也須分開判讀。
💬 留言討論
載入中...