
人工智能(AI)先生成专科医师考试用学习资料,再由AI回头进行错误检查。若资料能通过这一关,备考专科医师考试的住院医师是否就可以原样相信并学习?
针对放射科专科医师考试用资料的核查结果显示,答案更接近“目前还不行”。原因在于,即便是通过AI自动检查的资料中,仍发现约1%的重大错误,可能干扰医生的临床判断。
首尔峨山医院24日表示,院方在开发出利用生成式AI批量制作放射科教育资料并自动筛除错误的体系后,又组织临床医生进行复核,并公布了相关研究结果。
该研究由首尔峨山医院融合医学科金南国教授、南有珍研究员与三星昌原医院放射科洪波教授共同开展。论文刊登于国际学术期刊《〈〈npj Digital Medicine〉〉》最新一期。
按专科医师考试范围制作6000张闪卡
研究团队以大韩放射学会的专科医师教育课程为基础,让AI筛选考试所需核心内容并制作学习资料。
首先制作由问题与答案构成的闪卡。闪卡是一种在一面写问题、另一面写答案,通过反复记忆核心内容的学习资料。
随后对内容进行润色并制作信息图。AI再次检查内容与图片质量,若未达到标准则退回前一阶段重新生成。
经过这一流程,在放射学11个细分领域共生成6000张闪卡和833张信息图。
研究团队关注的不只是AI能生成多少资料。更关键的问题在于:对于AI自检后判定“没有问题”的资料,在实际医学教育中究竟能信任到什么程度。
AI判定“合格”……医生复核发现重大错误约1%
在全部闪卡中,有1284张接受了人工验证。包括9名放射科住院医师和11名专科医师在内的20名医生,逐一核对事实是否准确、是否适合作为专科医师教育资料,以及是否存在必须修正的错误。
研究所称的“重大错误(blocking error)”并非简单的错别字或不自然的设计,而是指若照此学习,可能将医生的临床判断引向错误方向、在用于教学前必须修正的事实性错误。例如将解剖位置标注错误、把影像所见特征与不相干的疾病相连、或错误提出需要鉴别的疾病等。实际案例中,也存在AI判定无问题的资料未能准确指出肾脏肿块伴随出现的静脉血栓。
对通过AI自动检查的980张闪卡所对应的1100条专家评价进行分析后,在其中11条发现了上述重大错误。按评价条目计算,相当于每100条中约1条。
也就是说,AI虽然判断“没有大问题”,但医生再次审视后发现仍残留难以直接用于教学的错误。
研究团队在研究开始前设定标准:将AI漏检的重大错误控制在0.3%以下。也就是在评估1000条时,AI判定通过的资料中由人发现重大错误的情况应少于3条。
统计学上,将实际存在问题却在检测中被判定为无问题而漏掉的情况称为“假阴性(false negative)”。本研究中,AI放行的资料后来被专家发现重大错误,即属于此类。
不过,0.3%并非政府或学会制定的医学教育AI官方安全标准。目前该领域尚无公认的错误容许标准,研究团队参考了与患者安全相关的其他医疗领域资料(如配药错误或明明存在疾病却在检查中被漏检的案例等),据此设定为研究用标准。
因此,不能将此次的1%扩大解读为“生成式AI制作的医疗资料每100个就有1个是错的”。这只是对特定AI体系生成的放射科专科医师教育资料,按本研究方法评估所得的结果。

不只是AI“幻觉”……为何没能拦住看似合理的错误答案
那么,AI为何在对自己生成的资料再次检查后仍会漏掉错误?
人们通常将生成式AI把与事实不符的内容编造得似是而非的现象称为“幻觉(hallucination)”。但在本研究中,将残留错误全部归咎于AI幻觉并不充分。
研究团队为提高自动检查的准确性,多次优化给AI的提示词。在验证阶段,还要求其检索并参考外部筛选过的证据资料。尽管如此,在人类发现的39条重大错误中,AI只捕捉到28条,其余11条仍被放行。
主要原因之一被认为是“AI对AI”的验证方式。本体系中,由一个AI生成结果,再由下一阶段AI接收并检查,工作按顺序推进,并非多个AI相互提出反驳或重新审视前一判断的结构。也就是说,若前一阶段生成了看似合理的错误答案,后一阶段AI也可能不加怀疑地接受。
更引人注目的是AI的“确信”。对于专家发现的11条漏检错误,自动检查AI在准确性与教育质量两项上都给出了最高分。也就是说,错误并非出现在勉强过线的资料中,而是出现在AI高度评价、认为没有问题的资料里。
放射学这一领域的特性也可能产生影响。在AI漏检的11条中,约四分之三与图像相关。
即便文字说明正确,但若箭头指向错误的解剖结构,或器官与血管的位置关系标注有误,也会使其不适合作为放射科教育资料。目前AI虽能生成看似可信的医学图像,但尚未达到能始终准确呈现精细解剖关系的阶段。
归根结底,本研究确认的错误难以用单一原因解释。除生成错误内容的AI幻觉外,还可能叠加了其他AI再次相信看似合理的错误答案、难以回溯前一判断的顺序式验证方式,以及在准确表达医学影像精细结构方面的局限等因素共同作用。
对人眼乃至AI检查而言都显得“像真的”错误答案,反而更容易一路存活到最后。

AI是“第二只眼”……但最后把关仍需人
研究还出现了一个值得关注的结果。医务人员先在不查看AI意见的情况下评估资料;随后确认AI指出了哪些问题,再对同一资料进行第二次审视。
结果,指出重大错误的评价条目从39条增加到54条。对资料准确性与教育质量所给出的评分,也在第二次评估中呈现更严格的趋势。
这表明,AI与其说是取代专家,不如说可能作为“第二只眼”,促使人类重新核对可能被忽略的部分。
不过,也不能断言因为AI意见而使发现错误的能力真正提升。评估者在查看同一资料两次的过程中,可能自行发现了第一次遗漏之处;也可能是“AI指出有问题”这一事实本身让评估者变得更苛刻。
即便需要专家最终审校,让人从头到尾核对所有资料也并不容易。
本研究中,医生审阅一张闪卡所需时间的中位数为53秒。按这一速度审阅全部6000张约需88小时;即便每天审阅8小时,也要约11天。
AI的自动处理也并非完美。生成的闪卡中有一部分在处理过程中出现问题,甚至未留下自动质量检查结果本身。
AI的优势在于能在短时间内生成海量教育资料。但若把全部流程都交给AI,仍可能残留错误;反之,若由人逐一制作并检查,又会削弱使用AI的效率。
关键在于如何划分交给AI的部分与必须由人确认的部分。
研究团队提出的方向是“人在回路(Human-in-the-loop)”。即在AI处理工作的过程中引入专家参与,对关键环节与最终结果进行确认:由AI负责资料制作与第一轮检查,而在实际用于教学前,再由相关领域专家进行最后一道错误筛除。
金南国教授表示:“我们通过大规模研究证明,要在真实教育现场安全使用生成式AI,专家验证必不可少。”他还说,“有必要持续开展研究,系统化管理自动验证所漏掉的错误,并制定安全标准。”
南有珍研究员表示:“研究一方面确认了生成式AI能够批量制作医学影像教育资料的可能性,另一方面也表明,与其直接使用生成的学习资料,不如分析各阶段会出现何种错误,并建立筛除流程,这一点至关重要。”
