
Nhóm nghiên cứu của Bệnh viện Samsung Seoul phối hợp công ty AI Zero One AI phát triển mô hình AI chuyên biệt cho y tế “ZEO Med 2”. Trong bài đánh giá sử dụng bộ câu hỏi của kỳ thi quốc gia bác sĩ Hàn Quốc, mô hình này vượt GPT-5.2 và Google Gemini.
Bệnh viện Samsung Seoul ngày 29 cho biết ZEO Med 2 đạt nhóm kết quả cao nhất thế giới ở các bài benchmark dùng câu hỏi từ các kỳ thi y khoa tại Hàn Quốc và Mỹ. Giáo sư Cha giữ vai trò chủ nhiệm nghiên cứu của nhiệm vụ phát triển lần này.
ZEO Med 2 do nhóm nghiên cứu Khoa Y học Cấp cứu của Bệnh viện Samsung Seoul, gồm các giáo sư Cha Won-cheol và Son Myung-hee, phối hợp với Zero One AI xây dựng, thông qua chương trình hỗ trợ sử dụng GPU tiên tiến của Bộ Khoa học và ICT.
Đúng 425/435 câu ở bài thi dạng bác sĩ Hàn Quốc
Trong bộ “KorMedMCQA” tập hợp câu hỏi kỳ thi quốc gia dành cho bác sĩ, điều dưỡng, dược sĩ và nha sĩ tại Hàn Quốc, ZEO Med 2 trả lời đúng 425 trong tổng số 435 câu thuộc phần dạng bài thi bác sĩ. Tỷ lệ đúng là 97,70%.
GPT-5.2, do Zero One AI đánh giá trong cùng điều kiện, trả lời đúng 424 câu, đạt 97,47%; còn Google Gemini 3.1 Flash-Lite đạt 96,09%. Tính ra ZEO Med 2 đúng nhiều hơn GPT-5.2 1 câu và nhiều hơn Gemini 7 câu.
Ngay cả trong nhóm mô hình “open-weight” công khai trọng số để nhà phát triển bên ngoài có thể tải về và sử dụng, ZEO Med 2 cũng đạt điểm cao nhất. Mô hình nền tảng của ZEO Med 2 là Google Gemma 4 31B đạt 97,01%, còn Qwen3.6-27B đạt 93,56%.
Tuy vậy, ZEO Med 2 không vượt lên ở mọi bài đánh giá theo dạng kỳ thi y khoa. Ở MedQA-USMLE sử dụng câu hỏi kỳ thi cấp phép hành nghề bác sĩ Mỹ, GPT-5.2 đạt 95,99%, cao hơn 94,82% của ZEO Med 2. Ở các bài thi dạng điều dưỡng, dược sĩ, nha sĩ Hàn Quốc và cả điểm trung bình của 4 nhóm ngành, Gemini 3.1 Flash-Lite cũng vượt ZEO Med 2.
Cho giải cùng một câu 5 lần rồi chấm theo đáp án được chọn nhiều nhất
Bài đánh giá được tiến hành theo phương thức “zero-shot”, tức không cho xem trước câu hỏi mẫu hay đáp án. AI được yêu cầu giải cùng một câu hỏi 5 lần, sau đó lấy đáp án được chọn nhiều nhất làm đáp án cuối cùng.
Bệnh viện Samsung Seoul nêu một ví dụ về câu hỏi y khoa mà ZEO Med 2 xử lý: một câu trong đề thi kỳ thi quốc gia bác sĩ lần thứ 90 năm 2026. Câu hỏi yêu cầu chọn thuốc cần dùng khi một bé gái 20 tháng tuổi vào khoa cấp cứu vì sốt cao, đã co giật một lần rồi không hồi phục ý thức và tiếp tục lên cơn co giật trở lại. Đáp án đúng trong các lựa chọn là lorazepam, một thuốc chống co giật nhóm benzodiazepine.
Như vậy, kỳ thi bác sĩ không chỉ có câu hỏi kiểm tra kiến thức y khoa mà còn có các câu hỏi tình huống lâm sàng, yêu cầu đánh giá tình trạng bệnh nhân để chọn phương án điều trị phù hợp.
Tuy nhiên, việc làm đúng nhiều câu hỏi thi không đồng nghĩa đã chứng minh được năng lực khám chữa bệnh thực tế. Trong môi trường lâm sàng, cần xem xét đồng thời nhiều thông tin hơn như bệnh sử, kết quả xét nghiệm, hình ảnh, thuốc đang dùng… Nếu AI đưa ra nhận định sai, an toàn người bệnh cũng có thể bị ảnh hưởng.

Vượt khỏi AI “làm bài thi giỏi”, hướng tới cả giọng nói và hình ảnh
Thông tin mô hình, phương pháp đánh giá và mã đánh giá của ZEO Med 2 đã được công bố trên nền tảng AI toàn cầu Hugging Face. Đây là mô hình được huấn luyện bổ sung dữ liệu lĩnh vực y tế trên nền Google Gemma 4 31B. Trọng số liên quan cũng được công khai để các nhà nghiên cứu và nhà phát triển có thể sử dụng theo các điều kiện quy định.
Bệnh viện Samsung Seoul cho biết thời gian tới sẽ nâng cấp ZEO Med 2 để có thể xử lý không chỉ văn bản mà cả giọng nói và hình ảnh. Bệnh viện cũng sẽ tăng cường các cơ chế an toàn nhằm quản lý việc AI tiếp nhận thông tin gì và đưa ra câu trả lời ra sao, cũng như phạm vi chức năng có thể sử dụng trong môi trường y tế. Song song đó, bệnh viện sẽ triển khai việc giảm kích thước mô hình để có thể dùng với tài nguyên tính toán thấp hơn.
Giáo sư Cha Won-cheol nói: “Giờ đây, điều then chốt không còn là làm đúng thêm bao nhiêu câu hỏi thi, mà là tạo ra một mô hình bao phủ cả giọng nói và hình ảnh, kết nối ổn định với dịch vụ thực tế, và đủ nhẹ để có thể dùng ở bất cứ đâu” và nhấn mạnh: “Chúng tôi sẽ phát triển thành AI chuyên biệt lâm sàng, đóng góp thiết thực cho hiện trường y tế”.
