
تفوّق الذكاء الاصطناعي الطبي «زيو مِد 2 (ZEO Med 2)»، الذي طوّره فريق بحثي في مستشفى سامسونغ سيول بالتعاون مع شركة الذكاء الاصطناعي «زيروون إيه آي»، على GPT-5.2 وGemini من غوغل في تقييم استند إلى أسئلة امتحان الأطباء الوطني في كوريا.
وقال مستشفى سامسونغ سيول، في 29 من الشهر، إن «زيو مِد 2» حقق نتائج «ضمن الأفضل عالمياً» في اختبارات معيارية (Benchmark) استخدمت أسئلة اختبارات طبية في كوريا والولايات المتحدة. وتولى البروفيسور تشا دور الباحث الرئيس في مشروع التطوير.
وطوّر «زيو مِد 2» فريق أبحاث البروفيسور تشا وون-تشول والبروفيسورة سون ميونغ-هي في قسم طب الطوارئ بمستشفى سامسونغ سيول، بالشراكة مع «زيروون إيه آي»، عبر مشروع دعم الاستفادة من وحدات GPU المتقدمة التابع لوزارة العلوم وتكنولوجيا المعلومات والاتصالات.
أجاب عن 425 من أصل 435 سؤالاً على نمط اختبار الأطباء في كوريا
أصاب «زيو مِد 2» 425 سؤالاً من أصل 435 ضمن فئة اختبار الأطباء في مجموعة «KorMedMCQA» التي تجمع أسئلة الامتحانات الوطنية للأطباء والممرضين والصيادلة وأطباء الأسنان في كوريا. وبلغت نسبة الإجابات الصحيحة 97.70%.
وسجّل GPT-5.2، الذي قيّمته «زيروون إيه آي» بالشروط نفسها، 424 إجابة صحيحة بنسبة 97.47%، فيما حقق Google Gemini 3.1 Flash-Lite نسبة 96.09%. وبذلك أجاب «زيو مِد 2» عن سؤال واحد أكثر من GPT-5.2 و7 أسئلة أكثر من Gemini.
وسجّل «زيو مِد 2» أيضاً أعلى نتيجة بين نماذج «الأوزان المفتوحة» (Open-Weight) التي تُنشر أوزانها ليتمكن مطورون خارجيون من تنزيلها واستخدامها. وحقق نموذج الأساس لـ«زيو مِد 2»، وهو Google Gemma 4 31B، نسبة 97.01%، بينما سجل Qwen3.6-27B نسبة 93.56%.
لكن «زيو مِد 2» لم يتقدم على نماذج الذكاء الاصطناعي المنافسة في جميع التقييمات ذات الطابع الطبي. ففي MedQA-USMLE الذي يستخدم أسئلة امتحان ترخيص مزاولة الطب في الولايات المتحدة، سجل GPT-5.2 نسبة 95.99% متقدماً على «زيو مِد 2» الذي حقق 94.82%. كما تقدّم Gemini 3.1 Flash-Lite على «زيو مِد 2» في متوسط الدرجات لتقييمات نمط اختبارات الممرضين والصيادلة وأطباء الأسنان في كوريا، وكذلك في متوسط درجات اختبارات المهن الأربع.
جعلوا الذكاء الاصطناعي يحل السؤال نفسه 5 مرات ثم قيّموا الإجابة الأكثر اختياراً
أُجري التقييم بأسلوب «زيرو شوت» (Zero-shot) الذي لا يعرض مسبقاً أسئلة نموذجية أو إجابات صحيحة. وجُعل الذكاء الاصطناعي يحل السؤال نفسه خمس مرات، ثم اعتُمدت الإجابة التي اختارها أكبر عدد من المرات بوصفها الإجابة النهائية.
وطرح مستشفى سامسونغ سيول مثالاً على نوعية المسائل الطبية التي تعامل معها «زيو مِد 2»، مقدماً سؤالاً واحداً من فقرات الدورة الـ90 لامتحان الأطباء الوطني لعام 2026. ويسأل السؤال عن الدواء الذي ينبغي استخدامه عندما تصل طفلة عمرها 20 شهراً إلى قسم الطوارئ بسبب حمى شديدة، ثم تتعرض لنوبة تشنج واحدة ولا تستعيد وعيها، قبل أن تعاود التشنج مرة أخرى. والإجابة الصحيحة ضمن الخيارات هي لورازيبام، وهو مضاد للتشنجات من فئة البنزوديازيبينات.
وهكذا، لا تقتصر أسئلة اختبار الأطباء على قياس المعرفة الطبية فحسب، بل تشمل أيضاً فقرات سريرية قائمة على مواقف تتطلب تقييم حالة المريض واختيار طريقة العلاج المناسبة.
غير أن الإجابة الصحيحة عن عدد كبير من أسئلة الامتحان لا تعني بالضرورة إثبات القدرة الفعلية على تقديم الرعاية الطبية. ففي الممارسة السريرية يجب النظر إلى معلومات أكثر بكثير، مثل التاريخ المرضي للمريض ونتائج الفحوصات والصور الطبية والأدوية التي يتناولها. وقد يؤثر أي قرار خاطئ من الذكاء الاصطناعي على سلامة المرضى أيضاً.

من ذكاء اصطناعي يحل الاختبارات إلى معالجة الصوت والصورة أيضاً
نُشرت معلومات نموذج «زيو مِد 2» ومنهجية التقييم وكود التقييم وغيرها على منصة الذكاء الاصطناعي العالمية «هاغينغ فيس». وهو نموذج دُرّب عبر إضافة بيانات من المجال الطبي إلى Google Gemma 4 31B. كما كُشفت الأوزان ذات الصلة بما يتيح للباحثين والمطورين استخدامها وفق شروط محددة.
وقال مستشفى سامسونغ سيول إنه يخطط مستقبلاً لتطوير «زيو مِد 2» بحيث يتمكن من معالجة الصوت والصورة إلى جانب النص. كما سيعزز آليات الأمان التي تدير ما المعلومات التي يستقبلها الذكاء الاصطناعي في بيئة الرعاية الصحية، وما الإجابات التي يقدمها، وما الوظائف التي يمكنه استخدامها. وسيتزامن ذلك مع العمل على تقليص حجم النموذج ليصبح قابلاً للاستخدام حتى بموارد حوسبة محدودة.
وقال البروفيسور تشا وون-تشول: «لم يعد العامل الحاسم هو مدى قدرتنا على رفع عدد الإجابات الصحيحة في أسئلة الامتحان، بل بناء نموذج يشمل الصوت والصورة، ويرتبط بالخدمات الفعلية بشكل مستقر، ويمكن استخدامه بخفة في أي مكان». وأضاف: «سنطوره ليصبح ذكاءً اصطناعياً سريرياً متخصصاً يساهم بصورة ملموسة في الميدان الطبي».
