
Хиймэл оюун (AI) мэргэжлийн эмчийн шалгалтад зориулсан сургалтын материалыг бүтээж, дараа нь алдааг нь өөрөө дахин шалгадаг. Тэгвэл AI-ийн автомат шалгалтад “тэнцсэн” материалыг мэргэжлийн эмчийн шалгалтад бэлдэж буй резидент эмч яг тэр чигээр нь итгээд ашиглаж болох уу.
Дүрс оношилгооны мэргэжлийн эмчийн шалгалтын материал дээр хийсэн үнэлгээний дүн “одоохондоо үгүй” гэсэн хариултад илүү ойр байв. Учир нь AI-ийн автомат шалгалтад тэнцсэн материалд ч эмчийн клиникийн шийдвэр гаргалтыг будлиулж болзошгүй ноцтой алдаа ойролцоогоор 1% илэрсэн байна.
Сөүл Асан эмнэлэг генератив AI-гаар дүрс оношилгооны сургалтын материалыг олноор үйлдвэрлэж, алдааг автоматаар шүүн ялгах тогтолцоог хөгжүүлсний дараа бодит эмч нараар дахин баталгаажуулан шалгуулсан судалгааны үр дүнгээ 24-нд мэдээлэв.
Судалгааг Сөүл Асан эмнэлгийн Нэгдмэл анагаахын тэнхимийн профессор Ким Нам-гүг, судлаач Нам Ю-жин болон Samsung Changwon Hospital-ын Дүрс оношилгооны тасгийн профессор Хон Пха нар хийжээ. Энэхүү өгүүлэл олон улсын эрдэм шинжилгээний сэтгүүл 〈npj Digital Medicine〉-ийн хамгийн сүүлийн дугаарт нийтлэгдсэн байна.
Мэргэжлийн шалгалтын хүрээнд 6000 флашкарт бүтээв
Судлаачид Солонгосын Дүрс оношилгооны нийгэмлэгийн мэргэжлийн эмчийн сургалтын хөтөлбөрт тулгуурлан AI-аар шалгалтад шаардлагатай гол агуулгыг шигшин авч сургалтын материал болгуулжээ.
Эхлээд асуулт, хариултаас бүрдэх флашкартуудыг хийсэн. Флашкарт гэдэг нь нэг талдаа асуулт, нөгөө талдаа хариулт байрлуулж, гол агуулгыг давтан тогтоох сургалтын материал юм.
Дараа нь агуулгыг засварлаж, инфографик бүтээв. AI дахин агуулга болон зургийн чанарыг шалгаж, шалгуур хангахгүй бол өмнөх шат руу буцаан шинэчлэн хийхээр тохируулжээ.
Энэ үйл явцын үр дүнд дүрс оношилгооны 11 дэд чиглэлээр 6000 флашкарт, 833 инфографик бүтээгдсэн байна.
Судлаачдын гол анхаарсан зүйл нь AI хэр их материал үйлдвэрлэж чадах вэ гэдгээр хязгаарлагдаагүй. AI өөрөө шалгаад “асуудалгүй” гэж дүгнэсэн материалыг бодит анагаахын боловсролд ямар хэмжээнд итгэн ашиглаж болох вэ гэдэг нь илүү чухал асуулт байв.
AI “тэнцсэн” гэж өгсөн ч…эмчийн нүдээр ноцтой алдаа 1%
Нийт флашкартуудаас 1284-ийг хүнээр баталгаажуулан шалгуулжээ. Дүрс оношилгооны резидент 9, мэргэжлийн эмч 11 зэрэг нийт 20 эмч баримтын үнэн зөв эсэх, мэргэжлийн сургалтын материалд тохирох эсэх, заавал засах шаардлагатай алдаа байгаа эсэхийг шууд нягталсан байна.
Судалгаанд дурдсан “ноцтой алдаа(blocking error)” нь энгийн үсгийн алдаа эсвэл эвгүй дизайн гэсэн үг биш. Яг тэр чигээр нь сурвал эмчийн клиникийн шийдвэрийг буруу чиглэлд хөтөлж болзошгүй тул боловсролд ашиглахаас өмнө заавал засах ёстой бодит баримтын алдаа юм. Жишээлбэл, анатомийн байрлалыг буруу тэмдэглэх, дүрсэн дээр харагдах шинжийг огт өөр өвчинтэй холбох, ялган оношлох ёстой өвчнийг буруу санал болгох зэрэг нь үүнд хамаарна. Үнэндээ AI асуудалгүй гэж дүгнэсэн материал дотор бөөрөнд үүссэн бөөгнөрөлтэй хамт илэрсэн венийн тромбозыг зөв оношлон зааж чадаагүй тохиолдол ч байжээ.
AI-ийн автомат шалгалтад тэнцсэн 980 флашкартын талаар мэргэжилтнүүдийн өгсөн 1100 үнэлгээг шинжлэхэд 11 тохиолдолд ийм ноцтой алдаа илэрсэн байна. Үнэлгээний тоогоор тооцвол 100 үнэлгээ тутамд 1 тохиолдол гэсэн үг.
AI “том асуудалгүй” гэж үзсэн ч эмч дахин нягталж харахад боловсролд шууд ашиглахад хүндрэлтэй алдаа үлдсэн байжээ.
Судлаачид судалгааг эхлүүлэхээс өмнө AI-ийн анзаарахгүй өнгөрөөх ноцтой алдааг 0.3%-иас доош барина гэсэн шалгуур тогтоосон. Өөрөөр хэлбэл, 1000 үнэлгээ хийхэд AI асуудалгүй гэж нэвтрүүлсэн материал дээр хүн ноцтой алдаа илрүүлэх тохиолдол 3-аас бага байх ёстой гэсэн үг.
Статистикт бодит асуудал байхад шалгалтаар асуудалгүй гэж дүгнээд алгасахыг “хуурамч сөрөг(false negative)” гэж нэрлэдэг. Энэ судалгаанд AI нэвтрүүлсэн материал дээр мэргэжилтэн хожим ноцтой алдаа олсон тохиолдол үүнд хамаарна.
Гэхдээ 0.3% нь төр засаг эсвэл мэргэжлийн нийгэмлэгээс тогтоосон анагаахын боловсролын AI-ийн албан ёсны аюулгүй байдлын стандарт биш. Энэ салбарт одоогоор баталгаажсан алдаа зөвшөөрөх босго байхгүй тул судлаачид эмийн найруулгын алдаа, өвчин байсаар атал шинжилгээнд алгасах тохиолдол зэрэг өвчтөний аюулгүй байдалтай холбоотой бусад анагаахын салбарын материалыг лавлан судалгааны зориулалтын шалгуур болгон тогтоожээ.
Тиймээс энэ удаад гарсан 1%-ийг “генератив AI-ийн бүтээсэн эмнэлгийн материал 100-аас 1 нь буруу’” гэж хэт өргөжүүлэн тайлбарлаж болохгүй. Тодорхой нэг AI тогтолцоогоор бүтээсэн дүрс оношилгооны мэргэжлийн сургалтын материалыг энэ судалгааны аргаар үнэлсэн үр дүн юм.

Зөвхөн AI “хий үзэгдэл” биш…үнэмшилтэй буруу хариуг яагаад шүүж чадсангүй вэ
Тэгвэл AI өөрийн бүтээсэн материалыг дахин шалгасан атлаа яагаад алдааг алгасав.
Ер нь генератив AI бодит баримтаас зөрсөн агуулгыг үнэмшилтэйгээр зохиож гаргах үзэгдлийг “хий үзэгдэл(hallucination)” гэж нэрлэдэг. Гэвч энэ судалгаанд үлдсэн бүх алдааг AI-ийн хий үзэгдлийн буруу гэж үзэхэд бэрх.
Судлаачид автомат шалгалтын нарийвчлалыг нэмэхийн тулд AI-д өгөх зааварчилгааг олон удаа сайжруулсан. Баталгаажуулалтын шатанд гаднын сонгомол нотолгооны материалыг хайж, лавлан ашиглуулах байдлаар тохируулжээ. Гэсэн ч хүн илрүүлсэн ноцтой алдаа 39 тохиолдлоос AI барьж авсан нь 28 байсан. Үлдсэн 11 нь тэр чигээрээ нэвтэрсэн байна.
Гол шалтгааны нэгээр AI-ууд хоорондоо баталгаажуулах арга барилыг нэрлэж байна. Энэ тогтолцоонд нэг AI-ийн гаргасан үр дүнг дараагийн шатны AI хүлээн авч шалгах байдлаар ажил дарааллаар үргэлжилжээ. Олон AI харилцан эсэргүүцэл гаргах, өмнөх дүгнэлтийг дахин нягтлах бүтэц байгаагүй. Өмнөх шатанд үнэмшилтэй буруу хариу үүсвэл дараагийн шатны AI ч үүнийг сэжиглэлгүйгээр хүлээн зөвшөөрөх боломжтой гэсэн үг.
Илүү анзаарагдсан зүйл нь AI-ийн “итгэл үнэмшил” байв. Мэргэжилтнүүдийн олсон 11 алгассан алдааны талаар автомат шалгалтын AI нь үнэн зөв байдал, боловсролын чанар хоёуланд нь хамгийн дээд оноо өгсөн байна. Тэнцэх босгыг арай гэж давсан материал биш, харин AI асуудалгүй гэж өндөр үнэлсэн материал дээрээс алдаа гарсан гэсэн үг.
Дүрс оношилгоо гэх салбарын онцлог ч нөлөөлсөн бололтой. AI-ийн алгассан 11 тохиолдлын ойролцоогоор дөрөвний гурав нь зурагтай холбоотой алдаа байжээ.
Тайлбар бичвэр зөв байсан ч сум нь огт өөр анатомийн бүтцийг заах, эсвэл эрхтэн ба судасны байрлалын хамаарал буруу байвал дүрс оношилгооны сургалтын материалд асуудал болно. Одоогийн AI өнгөц харахад үнэмшилтэй эмнэлгийн зураг үүсгэж чаддаг ч нарийн анатомийн хамаарлыг үргэлж яг таг зөв дүрслэх түвшинд хараахан хүрээгүй байна.
Эцэст нь, энэ судалгаагаар батлагдсан алдааг ганц шалтгаанаар тайлбарлахад хүндрэлтэй. Буруу агуулга зохиож гаргах AI-ийн хий үзэгдэл төдийгүй үнэмшилтэй буруу хариуг өөр AI дахин үнэмших асуудал, өмнөх дүгнэлтийг эргэн нягтлахад хүндрэлтэй дараалсан баталгаажуулалтын арга, эмнэлгийн дүрсний нарийн бүтцийг яг таг илэрхийлэхэд тулгардаг хязгаарлалт зэрэг нь хавсран нөлөөлсөн байх магадлалтай.
Хүний нүдэнд ч, AI-ийн шалгалтад ч үнэмшилтэй харагдах буруу хариу нь харин ч эцсээ хүртэл үлдэхэд амархан байсан гэсэн үг.

AI бол “хоёр дахь нүд”…гэхдээ эцсийн баталгаажуулалт хүнийх
Сонирхолтой үр дүн ч гарчээ. Эмнэлгийн ажилтнууд эхлээд AI-ийн саналыг харалгүйгээр материалыг үнэлсэн. Дараа нь AI аль хэсгийг асуудалтай гэж заасныг шалгасны дараа ижил материалыг дахин нягталсан байна.
Ингэхэд ноцтой алдааг заасан үнэлгээний тоо 39-өөс 54 болж өсөв. Материалын үнэн зөв байдал болон боловсролын чанарт өгсөн оноо ч хоёр дахь үнэлгээнд илүү хатуу болох хандлага ажиглагдсан байна.
AI мэргэжилтнийг орлох бус, харин хүн анзаараагүй байж болох хэсгийг дахин шалгуулах “хоёр дахь нүд” болж ашиглагдах боломжийг харуулсан хэсэг юм.
Гэхдээ AI-ийн саналын ачаар алдаа илрүүлэх чадвар бодитоор сайжирсан гэж нэг мөр дүгнэж болохгүй. Ижил материалыг хоёр удаа харах явцдаа эхний удаад алгассан хэсгээ олсон байж ч мэднэ. Мөн AI асуудал заасан гэх баримт өөрөө үнэлэгчийг илүү хатуу болгосон байх боломжтой.
Мэргэжилтний эцсийн хяналт шаардлагатай гэдэг нь бүх материалыг хүн эхнээс нь дуустал шалгана гэсэн үг биш бөгөөд энэ ажил ч амаргүй.
Энэ судалгаанд эмч нэг флашкарт шалгахад зарцуулсан хугацааны медиан нь 53 секунд байв. Энэ хурдаар 6000-ыг бүгдийг нь шалгахын тулд ойролцоогоор 88 цаг шаардлагатай. Өдөрт 8 цагаар шалгасан ч 11 орчим өдөр болно.
AI-ийн автомат боловсруулалт ч төгс байгаагүй. Үүсгэсэн флашкартуудын заримд нь боловсруулалтын явцад асуудал гарч, автомат чанарын шалгалтын үр дүн өөрөө үлдээгүй байна.
AI богино хугацаанд асар их хэмжээний сургалтын материал бүтээх давуу талтай. Гэвч бүх үйл явцыг даатгавал алдаа үлдэж болзошгүй. Харин хүн материалыг нэг бүрчлэн бүтээж, шалгавал AI ашиглах үр ашиг буурна.
Эцэст нь гол асуудал нь AI-д даатгах хэсэг болон хүний заавал баталгаажуулах хэсгийг хаана зааглах вэ гэдэгт байна.
Судлаачдын санал болгосон чиглэл нь “Human-in-the-loop” юм. AI ажил гүйцэтгэх явцад мэргэжилтэн оролцож, чухал үе шат болон эцсийн үр дүнг баталгаажуулах арга барил. Өөрөөр хэлбэл, AI материал бүтээх ба 1-р шатны шалгалтыг хариуцаж, бодит сургалтад ашиглахаас өмнө тухайн салбарын мэргэжилтэн эцэст нь алдааг шүүн ялгах хэлбэр юм.
Профессор Ким Нам-гүг “генератив AI-ийг бодит сургалтын орчинд аюулгүй ашиглахын тулд мэргэжилтний баталгаажуулалт зайлшгүй шаардлагатайг том хэмжээний судалгаагаар нотоллоо” гэж хэлээд, “автомат шалгалтаар алгасагдах алдааг системтэйгээр удирдаж, аюулгүй байдлын шалгуур тогтоох судалгааг үргэлжлүүлэх шаардлагатай” гэж онцлов.
Судлаач Нам Ю-жин “генератив AI эмнэлгийн дүрсийн сургалтын материалыг олноор үйлдвэрлэж чадна гэсэн боломжийг баталсантай зэрэгцэн, бүтээсэн сургалтын материалыг тэр чигээр нь ашиглахаас илүүтэй аль шатанд ямар алдаа үүсэж байгааг шинжилж, шүүн ялгах үйл явц чухал гэдгийг харуулж байна” гэж тайлбарлав.
