三星首尔医院医疗AI在韩国医师国考题型评测中超越GPT-5.2,正确率97.7%

| 输入:

与ZeroOne AI联合开发“ZEO Med 2”;在美国医师考试题型评测中GPT-5.2领先

三星首尔医院研究团队与AI企业ZeroOne AI联合开发的医疗专用AI“ZEO Med 2(ZEO Med 2)”。在韩国医师国家考试题型评测中取得97.7%的正确率。 照片=三星首尔医院

三星首尔医院研究团队与AI企业ZeroOne AI联合开发的医疗专用人工智能(AI)“ZEO Med 2(ZEO Med 2)”,在使用韩国医师国家考试试题进行的评测中,成绩超过GPT-5.2和谷歌Gemini。

三星首尔医院29日表示,ZEO Med 2在使用韩国、美国医疗考试试题进行的基准测试中取得世界顶尖水平的成绩。车元哲教授担任此次开发课题的研究负责人。

ZEO Med 2是在科学技术信息通信部“先进GPU应用支持项目”框架下,由三星首尔医院急诊医学科车元哲、孙明熙教授研究团队与ZeroOne AI共同打造。

韩国医师考试题型435题答对425题

ZEO Med 2在汇集韩国医师、护士、药师、牙医国家考试试题的“KorMedMCQA”中,医师考试题型435题答对425题,正确率为97.70%。

ZeroOne AI在相同条件下评测的GPT-5.2答对424题,正确率97.47%;谷歌Gemini 3.1 Flash-Lite为96.09%。也就是说,ZEO Med 2比GPT-5.2多答对1题,比Gemini多答对7题。

在公开权重、可供外部开发者下载使用的“开放权重(open-weight)”模型中,ZEO Med 2的得分也最高。作为ZEO Med 2基础模型的谷歌Gemma 4 31B为97.01%,Qwen3.6-27B为93.56%。

不过,ZEO Med 2并未在所有医疗考试题型评测中都领先其他AI。在使用美国医师执照考试试题的MedQA-USMLE中,GPT-5.2以95.99%高于ZEO Med 2的94.82%。在韩国护士、药师、牙医题型以及4个职业题型的平均分方面,Gemini 3.1 Flash-Lite也高于ZEO Med 2。

同一道题让AI作答5次后,以出现次数最多的答案计分

评测采用“零样本(zero-shot)”方式进行,即不预先提供示例题或标准答案。研究团队让AI对同一道题作答五次后,将其出现次数最多的选项作为最终答案。

三星首尔医院以ZEO Med 2处理的医学题为例,给出了2026年第90届医师国家考试的一道试题:一名20个月女婴因高热来到急诊室,发生一次抽搐后未能恢复意识,随后再次出现抽搐,问应使用何种药物。选项中的正确答案为苯二氮䓬类抗惊厥药劳拉西泮。

如上所示,医师考试不仅考查医学知识,还会出现需要判断患者状态并选择恰当治疗方案的临床情境题。

但答对大量试题并不意味着已证明具备实际诊疗能力。在医疗现场,需要综合查看患者病史、检查结果、影像、正在服用的药物等更多信息。一旦AI判断失误,也可能影响患者安全。

急诊医学科车元哲、孙明熙教授研究团队 照片=三星首尔医院

从“会做题的AI”迈向覆盖语音与影像

ZEO Med 2的模型信息、评测方法、评测代码等已在全球AI平台Hugging Face公开。该模型是在谷歌Gemma 4 31B基础上追加学习医疗领域数据而成。相关权重也一并公开,便于研究者和开发者在既定条件下使用。

三星首尔医院表示,未来将推进ZEO Med 2升级,使其不仅能处理文本,还能同时处理语音与影像。医院还将强化安全装置,用于管理AI在医疗现场接收哪些信息、输出怎样的答案以及可使用到何种功能;同时也将并行推进缩小模型规模,使其在较少计算资源下也可使用。

车元哲教授表示:“关键已不在于把考试题答得更对,而在于打造能够覆盖语音与影像、稳定接入实际服务,并且轻量化、随处可用的模型。”他还说,“我们将把它发展为真正能为医疗现场作出实质贡献的临床专用AI。”

×