瑞典的 MASAI 随机试验,把 AI 支援的乳房摄影筛检流程,与原有的双人判读流程放在一起比较。AI 协助分流与侦测,医师仍参与判读。

2025 年发表的分析显示,AI 组每千人检出 6.4 例癌症,对照组为 5.0 例。这回答了筛检当下的侦测问题。研究同时保留后续追踪,观察两次例行筛检之间被诊断出的间隔癌。MASAI 2025 年研究

2026 年发表的主要结果中,AI 组间隔癌率为每千人 1.55 例,对照组为每千人 1.76 例,符合研究预先设定的不劣性判定。两组点估计虽有差距,研究并未证明间隔癌显著减少,也未证明死亡率下降。MASAI 2026 年研究摘要

同一项试验,分成不同阶段回答问题。当下多找到多少癌症,和下一轮筛检前还有多少人被诊断出癌症,需要等待不同的资料。对准备导入医疗 AI 的团队而言,这种等待本身就是验证工作的一部分。瑞典的流程与结果能否适用于台湾,也还需要另外评估。

《2026 生技产业白皮书》第 145–151 页整理数字医疗的发展,第 361–363 页谈 AI 的治理与应用。这些工作到了医院,终究要回答采用之后究竟改变了什么。

一张性能表还回答不了的事

模型的敏感度、特异度或其他性能指标,能回答特定测试条件下的问题。医院要决定是否采用,还需要知道这个测试和预定用途有多接近。

拿协助判读影像来说,工具可能用来标示可疑位置,也可能协助安排判读顺序。两者都与影像有关,对工作流程的影响却不同。验证之前,应先说清楚工具在哪一步介入,以及原本的做法是什么。

比较的对象也必须说清楚。如果研究比较的是模型与某组既有标记,不能直接回答医师使用之后是否更快完成工作。若只记录操作时间,也不足以判断病人的健康结果是否改善。每一种指标都有用途,重点是结论不要跨得比证据更远。

所以「提升医疗质量」这句话需要往下追问:改善的是哪一段照护,哪些病人适用,与原来的做法相比差在哪里?医院不能只靠一张性能比较表决定怎么用。

美国 FDA、加拿大卫生部与英国 MHRA 共同提出的良好机器学习实务原则,将人与 AI 团队的表现列为重点。三方良好机器学习实务原则

医师遇到与自身判断不同的提示时,需要哪些信息才能确认?如果每次都得跳到另一个系统查找,新增的操作就应算进评估。提示是否容易理解,也要让实际使用的人试过才知道。

导入也可能重新分配工作。例如,某个工具协助医师先处理高风险个案,后续确认与联系的需求可能随之改变。这些影响需要在实际场域量测,才能知道省下的时间是否伴随其他新增工作。

第一线人员能回报困难之后,还要有人处理。否则一个每天多花几分钟的操作问题,可能一直留在那里,最后变成用户自行绕过系统。

更新以后,原来的证据还适用吗

医院的设备、收案族群与工作方式可能改变,软件本身也可能更新。导入时的验证因此需要衔接后续追踪,确认原本的表现是否仍然成立。

FDA 在 2025 年公布的 AI 医疗器材软件生命周期管理指引草案,讨论持续性能监测等安排。截至 2026 年 9 月,该文件仍标示为草案,提供的是管理建议与讨论方向。FDA 2025 年指引草案

医院与开发者需要事先约定哪些变化要检查,发现问题由谁判断是否暂停。追踪门槛得依产品用途与风险设计,并没有一个数字适合所有工具。

版本也要能追溯。同一个产品名称之下,更新前后的模型或设置可能不同。若成效报告没有记录版本与使用条件,下一个团队就很难判断,自己采用的是否仍是当时验证过的安排。

临床表现、日常维运与支付安排,是导入时必须分别回答的问题。有一项研究支持性能,不代表医院已经安排好整合与支援;取得产品许可,也不能直接推定特定服务已获健保给付。

费用如果只算软件授权,医院端新增的工作可能被漏掉。工具省下多少时间,需要和为了使用它而付出的时间一起看。

试用结束之后,软件也许会留下。跟着留下的维护、追踪与教育训练,要由谁负责、费用从哪里来,应该在试用之前就开始谈。


资料来源:《2026 生技产业白皮书》,经济部产业发展署,2026 年 8 月,印刷页 145–151、361–363;MASAI 原始研究及监管机关文件如文中链接。流程、采购与追踪安排属作者分析。

模型表现之后,还有两层验证
  1. 模型表现

    在指定数据与任务上,结果如何?

  2. 临床使用

    放进医院流程后,对病人与工作有什么影响?

  3. 持续监测

    使用环境或版本改变后,谁追踪与处理问题?

这些是不同层次的验证问题,不代表特定系统已通过;非劣性、优越性与死亡率改善也须分开判读。