
El equipo de investigación del Samsung Medical Center y la empresa de IA Zero One AI han desarrollado la inteligencia artificial (IA) especializada en medicina ‘ZEO Med 2’, que superó a GPT-5.2 y a Google Gemini en una evaluación basada en preguntas del examen nacional de medicina de Corea del Sur.
El Samsung Medical Center informó el día 29 de que ZEO Med 2 obtuvo resultados de nivel mundial en un ‘benchmark’ que utilizó preguntas de exámenes médicos de Corea del Sur y de Estados Unidos. El profesor Cha ejerció como investigador principal de este proyecto de desarrollo.
ZEO Med 2 fue creada por el equipo de investigación de los profesores Cha Won-cheol y Son Myung-hee, del Departamento de Medicina de Urgencias del Samsung Medical Center, y por Zero One AI, a través del programa de apoyo al uso de GPU avanzadas del Ministerio de Ciencia y TIC.
Acertó 425 de 435 preguntas del bloque tipo examen de medicina en Corea del Sur
ZEO Med 2 acertó 425 de 435 preguntas del bloque tipo examen de medicina dentro de ‘KorMedMCQA’, un conjunto que recopila preguntas de los exámenes nacionales de medicina, enfermería, farmacia y odontología de Corea del Sur. La tasa de acierto fue del 97,70%.
En la misma evaluación y bajo las mismas condiciones, GPT-5.2 —evaluada por Zero One AI— acertó 424 preguntas (97,47%), y Google Gemini 3.1 Flash-Lite registró un 96,09%. En otras palabras, ZEO Med 2 acertó 1 pregunta más que GPT-5.2 y 7 más que Gemini.
Entre los modelos de ‘open weight’, cuyos pesos se publican para que desarrolladores externos puedan descargarlos y utilizarlos, ZEO Med 2 también obtuvo la puntuación más alta. El modelo base de ZEO Med 2, Google Gemma 4 31B, logró un 97,01%, y Qwen3.6-27B, un 93,56%.
Sin embargo, ZEO Med 2 no se impuso en todas las evaluaciones de tipo examen médico. En MedQA-USMLE, que utiliza preguntas del examen de licencia médica de Estados Unidos, GPT-5.2 alcanzó un 95,99%, por encima del 94,82% de ZEO Med 2. En los formatos tipo examen de enfermería, farmacia y odontología de Corea del Sur, así como en la puntuación media de los cuatro colectivos profesionales, Gemini 3.1 Flash-Lite también superó a ZEO Med 2.
Hicieron que resolviera el mismo problema cinco veces y calificaron la respuesta más elegida
La evaluación se realizó con un enfoque de ‘zero-shot’, sin mostrar previamente ejemplos de preguntas ni respuestas correctas. Se hizo que la IA resolviera el mismo problema cinco veces y se tomó como respuesta final la opción que eligió con mayor frecuencia.
El Samsung Medical Center presentó como ejemplo de los problemas médicos abordados por ZEO Med 2 una pregunta del 90.º Examen Nacional de Medicina de 2026. La pregunta plantea qué fármaco debe utilizarse cuando una niña de 20 meses que llega a urgencias con fiebre alta sufre una convulsión, no recupera la consciencia y vuelve a convulsionar. La respuesta correcta, entre las opciones, es lorazepam, un anticonvulsivante de la familia de las benzodiacepinas.
Así, el examen de medicina incluye no solo preguntas que evalúan conocimientos médicos, sino también ítems de situación clínica que exigen valorar el estado del paciente y elegir el tratamiento adecuado.
Con todo, acertar muchas preguntas de examen no significa que se haya demostrado la capacidad real para la práctica clínica. En el entorno asistencial hay que considerar conjuntamente mucha más información, como antecedentes del paciente, resultados de pruebas, imágenes y medicación en uso. Si la IA se equivoca en su juicio, también puede afectar a la seguridad del paciente.

Más allá de resolver bien exámenes: también voz e imagen
La información del modelo de ZEO Med 2, el método de evaluación y el código de evaluación, entre otros, se publicaron en la plataforma global de IA Hugging Face. Se trata de un modelo que añadió entrenamiento adicional con datos del ámbito médico sobre Google Gemma 4 31B. También se publicaron los pesos correspondientes para que investigadores y desarrolladores puedan utilizarlos bajo condiciones establecidas.
El Samsung Medical Center planea perfeccionar ZEO Med 2 para que, en adelante, pueda procesar no solo texto, sino también voz e imagen. También reforzará los mecanismos de seguridad para gestionar qué información recibe la IA en el entorno sanitario, qué respuestas ofrece y qué funciones puede utilizar. En paralelo, trabajará en reducir el tamaño del modelo para que pueda usarse incluso con recursos de computación limitados.
El profesor Cha Won-cheol afirmó: “Ahora, más que ver cuánto mejor acierta las preguntas de examen, la clave es crear un modelo que abarque también voz e imagen, que se conecte de forma estable a servicios reales y que sea ligero para poder usarse en cualquier lugar”, y añadió: “Lo iremos desarrollando hasta convertirlo en una IA clínica especializada que contribuya de manera sustancial al entorno sanitario”.
