Как медицинский ИИ Samsung Medical Center обошёл GPT-5.2: 97,7% на корейской модели экзамена для врачей

| Опубликовано:

«ZEO Med 2», разработанный вместе с ZeroOneAI, показал лучший результат на корейской выборке, но в американском формате впереди оказался GPT-5.2

Медицинский специализированный ИИ «ZEO Med 2», совместно разработанный исследовательской группой Samsung Medical Center и ZeroOneAI. В оценке по типу корейского национального экзамена для врачей показал точность 97,7%. Фото=Samsung Medical Center

Медицинский специализированный искусственный интеллект (ИИ) «ZEO Med 2», созданный исследовательской группой Samsung Medical Center совместно с ИИ-компанией ZeroOneAI, в тестировании на основе вопросов корейского национального экзамена для врачей опередил GPT-5.2 и Google Gemini.

Samsung Medical Center 29-го числа сообщил, что ZEO Med 2 показал результаты мирового уровня в бенчмарке с использованием вопросов медицинских экзаменов Республики Корея и США. Научным руководителем проекта разработки выступил профессор Чха.

ZEO Med 2 разработали профессора Чха Вончхоль и Сон Мёнхи из отделения неотложной медицины Samsung Medical Center вместе с ZeroOneAI в рамках проекта поддержки по использованию передовых GPU Министерства науки и ИКТ.

В корейской «врачебной» части: 425 правильных ответов из 435

ZEO Med 2 правильно ответил на 425 из 435 вопросов «врачебного» типа в составе «KorMedMCQA» — набора заданий национальных экзаменов для врачей, медсестёр, фармацевтов и стоматологов Республики Корея. Доля правильных ответов составила 97,70%.

GPT-5.2, который ZeroOneAI оценивала на тех же условиях, дал 424 правильных ответа (97,47%), а Google Gemini 3.1 Flash-Lite показал 96,09%. Таким образом, ZEO Med 2 ответил на 1 вопрос больше, чем GPT-5.2, и на 7 вопросов больше, чем Gemini.

Среди моделей «open-weight», чьи веса публикуются и доступны внешним разработчикам для скачивания и использования, результат ZEO Med 2 оказался самым высоким. Базовая модель ZEO Med 2 — Google Gemma 4 31B — набрала 97,01%, Qwen3.6-27B — 93,56%.

При этом ZEO Med 2 показал лучший результат не во всех форматах «экзаменационного» тестирования. В MedQA-USMLE, где использовались вопросы экзамена на медицинскую лицензию в США, GPT-5.2 набрал 95,99% — выше, чем 94,82% у ZEO Med 2. В оценках по типу корейских экзаменов для медсестёр, фармацевтов и стоматологов, а также по среднему баллу по четырём профессиям Gemini 3.1 Flash-Lite опередил ZEO Med 2.

Одну и ту же задачу решали 5 раз, затем засчитывали самый частый вариант ответа

Оценку проводили в формате «zero-shot», при котором заранее не показывают ни примеры задач, ни правильные ответы. ИИ предлагали решить одну и ту же задачу пять раз, после чего финальным ответом считали вариант, который он выбирал чаще всего.

Samsung Medical Center привёл пример медицинской задачи, с которой работал ZEO Med 2: один вопрос 90-го национального экзамена для врачей 2026 года. Вопрос спрашивает, какой препарат следует применить, если 20-месячная девочка, поступившая в отделение неотложной помощи с высокой температурой, после одного эпизода судорог не восстановила сознание и затем снова начала судорожить. Правильный ответ среди вариантов — лоразепам, противосудорожное средство из группы бензодиазепинов.

Таким образом, на врачебном экзамене встречаются не только вопросы на медицинские знания, но и клинические ситуационные задания, где нужно оценить состояние пациента и выбрать подходящий метод лечения.

Однако большое число правильных ответов на экзаменационные вопросы само по себе не означает, что доказана и реальная клиническая компетентность. В медицинской практике необходимо одновременно учитывать гораздо больше информации — анамнез пациента, результаты анализов, изображения, принимаемые препараты и т. д. Ошибка ИИ может повлиять и на безопасность пациента.

Исследовательская группа профессоров Чха Вончхоля и Сон Мёнхи из отделения неотложной медицины Фото=Samsung Medical Center

От ИИ, «хорошо решающего тесты», — к обработке голоса и изображений

Сведения о модели ZEO Med 2, методика оценки, код для оценки и другие материалы опубликованы на глобальной ИИ-платформе Hugging Face. Модель дополнительно дообучили на медицинских данных на базе Google Gemma 4 31B. Соответствующие веса также раскрыты, чтобы исследователи и разработчики могли использовать их при соблюдении заданных условий.

Samsung Medical Center намерен развивать ZEO Med 2 так, чтобы он мог обрабатывать не только текст, но и голос и изображения. Также будут усилены меры безопасности, позволяющие контролировать, какую информацию ИИ получает в медицинской среде, какие ответы выдаёт и какими функциями может пользоваться. Параллельно будет вестись работа по уменьшению размера модели, чтобы её можно было применять и при ограниченных вычислительных ресурсах.

Профессор Чха Вончхоль заявил: «Теперь ключевой вопрос — не в том, насколько лучше мы угадываем ответы в тестах, а в том, чтобы создать модель, которая охватывает и голос, и изображения, стабильно подключается к реальным сервисам и остаётся лёгкой, чтобы её можно было использовать где угодно», добавив: «Мы будем развивать её в клинически специализированный ИИ, который реально внесёт вклад в медицинскую практику».

×