
L’équipe de recherche du Samsung Medical Center annonce que l’intelligence artificielle (IA) médicale spécialisée « ZEO Med 2 », développée avec l’entreprise d’IA Zero One AI, a devancé GPT-5.2 et Google Gemini lors d’une évaluation fondée sur des questions de l’examen national de médecine en Corée du Sud.
Le Samsung Medical Center précise, le 29, que ZEO Med 2 a obtenu des résultats de tout premier plan mondial dans un benchmark reposant sur des questions d’examens médicaux coréens et américains. Le professeur Cha a dirigé ce projet de développement en tant que chercheur principal.
ZEO Med 2 a été conçu par l’équipe de recherche des professeurs Cha Won-chul et Son Myung-hee, du service de médecine d’urgence du Samsung Medical Center, et par Zero One AI, dans le cadre d’un programme de soutien à l’utilisation de GPU avancés du ministère des Sciences et des TIC.
425 bonnes réponses sur 435 questions de type examen de médecine en Corée du Sud
ZEO Med 2 a répondu correctement à 425 questions sur 435 dans la catégorie « type examen de médecine » de « KorMedMCQA », un ensemble de questions rassemblant les examens nationaux de médecine, d’infirmier, de pharmacien et de chirurgien-dentiste en Corée du Sud. Le taux de bonnes réponses s’est établi à 97,70 %.
Évalué dans les mêmes conditions par Zero One AI, GPT-5.2 a obtenu 424 bonnes réponses, soit 97,47 %, tandis que Google Gemini 3.1 Flash-Lite a atteint 96,09 %. ZEO Med 2 a donc répondu correctement à une question de plus que GPT-5.2 et à sept de plus que Gemini.
Parmi les modèles « open-weight », dont les poids sont publiés afin que des développeurs externes puissent les télécharger et les utiliser, ZEO Med 2 a également affiché le meilleur score. Le modèle de base de ZEO Med 2, Google Gemma 4 31B, a obtenu 97,01 %, et Qwen3.6-27B, 93,56 %.
ZEO Med 2 n’a toutefois pas devancé les IA concurrentes dans toutes les évaluations de type examen médical. Sur MedQA-USMLE, fondé sur des questions de l’examen américain de licence médicale, GPT-5.2 a atteint 95,99 %, contre 94,82 % pour ZEO Med 2. Sur les formats d’examen d’infirmier, de pharmacien et de chirurgien-dentiste en Corée du Sud, ainsi que sur la moyenne des scores des quatre professions, Gemini 3.1 Flash-Lite a également devancé ZEO Med 2.
Le même problème résolu cinq fois, puis notation de la réponse la plus choisie
L’évaluation a été menée selon une approche « zero-shot », sans montrer à l’avance d’exemples de questions ni de réponses correctes. L’IA a résolu chaque question cinq fois, puis la réponse la plus souvent choisie a été retenue comme réponse finale.
Le Samsung Medical Center présente, comme exemple de question médicale traitée par ZEO Med 2, un item du 90e examen national de médecine de 2026. La question demande quel médicament utiliser lorsqu’une fillette de 20 mois, arrivée aux urgences avec une forte fièvre, a convulsé une fois, n’a pas repris conscience, puis convulse de nouveau. La bonne réponse, parmi les propositions, est le lorazépam, un anticonvulsivant de la classe des benzodiazépines.
Ainsi, l’examen de médecine comporte non seulement des questions de connaissances médicales, mais aussi des items de situation clinique qui exigent d’évaluer l’état du patient et de choisir un traitement approprié.
Le fait de réussir un grand nombre de questions d’examen ne suffit toutefois pas à démontrer des compétences cliniques réelles. Dans la pratique, il faut examiner conjointement bien davantage d’informations, comme les antécédents, les résultats d’examens, l’imagerie ou les médicaments pris. Une erreur de jugement de l’IA peut aussi affecter la sécurité des patients.

Au-delà d’une IA qui réussit les examens : vers la voix et l’image
Les informations sur le modèle ZEO Med 2, la méthode d’évaluation et le code d’évaluation ont été publiés sur la plateforme mondiale d’IA Hugging Face. Il s’agit d’un modèle entraîné en ajoutant des données du domaine médical à Google Gemma 4 31B. Les poids correspondants ont également été rendus publics afin que chercheurs et développeurs puissent les utiliser selon des conditions définies.
Le Samsung Medical Center prévoit de perfectionner ZEO Med 2 afin qu’il puisse traiter non seulement du texte, mais aussi la voix et l’image. L’hôpital renforcera également les dispositifs de sécurité permettant d’encadrer les informations que l’IA reçoit, les réponses qu’elle produit et les fonctionnalités auxquelles elle peut accéder en milieu médical. Un travail de réduction de la taille du modèle sera mené en parallèle afin qu’il puisse être utilisé avec des ressources de calcul limitées.
Le professeur Cha Won-chul a déclaré : « Désormais, l’enjeu n’est plus de savoir qui répond à un peu plus de questions d’examen, mais de créer un modèle qui couvre aussi la voix et l’image, se connecte de manière stable à des services réels et puisse être utilisé partout, de façon légère », ajoutant : « Nous le ferons évoluer en une IA clinique spécialisée qui contribue concrètement au terrain médical. »
