
ЯАГААД ХИЙМЭЛ ОЮУН УХААНААР ЭМ ГАРГАН АВАХАД (AI DRUG DISCOVERY) БИОЛОГИЙН ӨГӨГДӨЛ ИЛҮҮ ЧУХАЛ БАЙДАГ ВЭ?

Г.Отгонцэцэг
Багш


Г.Отгонцэцэг
Багш
GSK компани Их Британийн биотехнологийн Relation Therapeutics компанитай 110 сая доллар хүртэлх үнийн дүнтэй судалгааны хамтын ажиллагаа эхлүүлж, компаниудын AI-assisted drug discovery (хиймэл оюун ухааны тусламжтайгаар эм гарган авах) чиглэлд хийж буй одоогийн ажлыг өргөжүүллээ.
Энэхүү гэрээний дагуу Relation компани хүний эсүүд генетикийн өөрчлөлт болон эмийн нөлөөлөлд хэрхэн хариу үйлдэл үзүүлэхийг хэмжих өргөн цар хүрээтэй datasets (өгөгдлийн багцууд) бий болгоно. Энэхүү өгөгдлийг Relation-ийн MORGAN платформ дахь загваруудыг оролцуулаад боломжит эмийн байг (potential drug targets) тодорхойлох зорилготой AI загваруудыг сургахад ашиглах юм.
Уг гэрээ нь биологийн өгөгдөл бүрдүүлэх ажлыг AI загвар хөгжүүлэлттэй зэрэгцүүлэн тавьж байна. Relation-ийн судалгааны арга барил нь computational analysis (тооцооллын шинжилгээ)-ийг хүний эсийн талаар шинэ мэдээлэл үүсгэдэг туршилтуудтай холбож өгдөг.
Энэхүү хамтын ажиллагаа нь GSK болон Relation хооронд өмнө нь байгуулсан фиброз өвчин болон остеоартритэд чиглэсэн гэрээнүүд дээр суурилсан болно. Тэдгээр төслүүдэд Relation-ийн Lab-in-the-Loop платформыг ашиглан дүн шинжилгээ хийхэд зориулагдсан үйл ажиллагааны хоёр төрлийн өвчний datasets үүсгэх зорилготой ажиглалтын судалгаанууд багтсан байдаг.
Өмнөх ажил нь өвчний боломжит байг (disease targets) тодорхойлж, баталгаажуулахын тулд хүний генетик, хүний эд эсээс гаргаж авсан single-cell multi-omics, functional assays (функциональ шинжилгээ) болон machine learning-ийг хослуулсан.

Илүү том биологийн өгөгдлийн багцууд нь илүү сайн загвар гарна гэсэн үг биш (Bigger biological datasets do not guarantee better models)
Энэ оны 6-р сард Nature Methods сэтгүүлд нийтлэгдсэн судалгаа нь 22.2 сая эс бүхий корпусыг ашиглан pretraining data (сургалтын өмнөх өгөгдөл)-ийн хэмжээ болон төрөлжилт нь single-cell foundation models-д хэрхэн нөлөөлдгийг судалсан байна. Судлаачид 400 загварыг сургаж, 6,400 туршилтын хүрээнд үнэлгээ хийжээ.
Одоогийн single-cell foundation models нь бэлэн байгаа корпусын зөвхөн багахан хэсэгт сургагдсаны дараа гүйцэтгэл нь зогсонги байдалд (performance plateaus) орох хандлагатай байдгийг уг судалгаагаар тогтоожээ. Large language models (том хэлний загварууд)-аас ялгаатай нь, үнэлэгдсэн системүүд сургалтын өгөгдлийг тасралтгүй нэмэгдүүлэхэд үр дүн нь тогтмол сайжирдаг гэх data-scaling (өгөгдөл өсгөх) тодорхой хуулиудыг харуулаагүй байна.
Судлаачид загварын багтаамж, dataset-ийн хэмжээ, болон тооцооллын нөөцүүдийг зүгээр л хамтад нь нэмэгдүүлэхийн оронд харин хооронд нь тэнцвэржүүлэх шаардлагатайг олж тогтоожээ. Уг судалгаа нь жижиг эсвэл proprietary datasets (хувийн өмчийн өгөгдлийн багцууд) угаасаа илүү сайн гэдгийг нотлоогүй боловч, илүү их биологийн сургалтын өгөгдөл нэмэх нь гүйцэтгэлийг цаашид тогтмол нэмэгдүүлэхэд хүргэдэггүйг илрүүлсэн байна.
2025 онд Genome Biology сэтгүүлд нийтлэгдсэн өөр нэг судалгаагаар Geneformer болон scGPT гэсэн хоёр single-cell foundation models-ийг хэд хэдэн zero-shot үнэлгээний даалгавруудын хүрээнд үнэлсэн байна. Эдгээр загварууд нь илүү энгийн арга барилуудаас тогтмол давамгайлж чадаагүй бөгөөд судлаачид мөн batch effects (багцын нөлөөлөл)-тэй холбоотой сорилтуудыг тодорхойлж, илүү том pre-trained загварууд нь автоматаар илүү сайн biological representations (биологийн төлөөлөл) гаргадаг гэж таамаглахаас сэрэмжлүүлжээ.

Эмийн компаниуд (Pharma companies) төрөлжсөн өгөгдлийн багцуудыг эрэлхийлж байна
Relation компани нь өөрсдийн proprietary functional single-cell bone atlas (ясны атлас) гэж тодорхойлдог Osteomics төсөлд өгөгдөл бүрдүүлэх арга барилаа аль хэдийн нэвтрүүлээд байна. Энэхүү төсөл нь өвчтөнүүдээс авсан дээжийг ашигладаг бөгөөд single-cell болон spatial omics-ийг дүрслэл, genomics, proteomics, мөн clinical phenotype (клиникийн фенотип) өгөгдөлтэй хослуулдаг.
Компанийн мэдээлснээр, Osteomics-ийг osteoporosis (ясны сийрэгжилт)-ийн үеийн өвчний биологи, therapeutic targets (эмчилгээний бай), biomarkers болон өвчтөнүүдийн дэд бүлгүүдийг судлахад ашиглаж байна. Энэхүү ажиглалтын судалгаанд Их Британи болон Австралийн эмнэлгүүд, судалгааны түншүүд оролцож байгаа аж.
Өнгөрсөн сард Nature Genetics сэтгүүлд нийтлэгдсэн судалгаагаар single-cell analysis, генетикийн өгөгдөл, болон functional validation ашиглан араг ясны өвчний эсийн болон генетикийн хүчин зүйлсийг мөн судалсан байна. Уг судалгааны зохиогчдын дунд Relation компанийн хэд хэдэн судлаач байжээ.
2025 онд Nature Biotechnology-д нийтлэгдсэн AI-д төвлөрсөн biopharma (биофарма) хэлцлүүдийн дүн шинжилгээ нь сүүлийн үеийн түншлэлүүдээс гарч ирж буй хэд хэдэн чиг хандлагын нэгээр төрөлжсөн dataset нийлүүлэгчдийг (specialised dataset providers) онцолжээ. Бусад чиг хандлагуудад илүү өндөр урьдчилгаа төлбөр, эмчилгээний шинэ аргууд (therapeutic modalities) болон томоохон биотехнологийн компаниудын оролцоо нэмэгдсэн зэрэг багтсан байна.
Өндөр чанартай, disease-specific datasets (өвөрмөц өвчинд чиглэсэн өгөгдлийн багцууд) нь causal (шалтгааны) болон generative machine-learning загваруудын хувьд чухал оролт болж байгааг уг дүн шинжилгээнд дурджээ. Үүнд хүний элэгний single-cell болон perfused-organ өгөгдлийн data licensing (лицензжүүлэлт)-ийг агуулсан 37.5 сая долларын үнэ бүхий GSK-ийн Ochre Bio-той байгуулсан тусдаа гэрээг жишээ татсан байна.
Өөр нэг жишээ бол AstraZeneca болон Pathos AI нар 2025 онд Tempus-тай 200 сая долларын гэрээ байгуулсан явдал юм. Энэхүү тохиролцооны дагуу Pathos нь 150,000 гаруй өвчтөнийг хамарсан, de-identified (хувийн мэдээллийг нууцласан) клиник, genomic, болон дүрслэлийн өгөгдлийг ашиглан oncology (хавдар судлалын) foundation models хөгжүүлэхээр болжээ.
Хангалттай өндөр чанартай өгөгдөлд нэвтрэх нь AI drug discovery салбарт хязгаарлагдмал хүчин зүйл хэвээр байна. Nature сэтгүүлд нийтлэгдсэн эмийн судалгаан дахь federated learning-ийн талаарх онцлох нийтлэлд, тохиромжтой сургалтын өгөгдлийн хүртээмж хязгаарлагдмал байгаа нь AI хэрэглээний гол bottleneck (саад) болохыг тодорхойлсон бөгөөд компаниуд хувийн өмчийн мэдээллээ (proprietary information) хуваалцах тал дээр мөн хязгаарлалттай тулгардаг болохыг тэмдэглэжээ.
Тиймээс AI-biopharma гэрээнүүд нь компаниуд өгөгдөл болон тооцооллын хүчин чадлыг хэрхэн олж авч байгаагаас хамааран харилцан адилгүй байна. Зарим нь AI платформуудад нэвтрэх эрхэд төвлөрдөг бол зарим нь хамтарсан хөгжүүлэлт, data licensing, эсвэл шинэ биологийн datasets үүсгэх зэргийг хамардаг.
GSK–Relation хоорондын гэрээнд data generation (өгөгдөл бүрдүүлэх) болон model development (загвар хөгжүүлэх) хоёулаа багтсан. Relation компани энэхүү хамтын ажиллагааны хүрээнд хүний эсийн өгөгдлийн багцуудыг (human cellular datasets) үйлдвэрлэх бөгөөд тэдгээрийг эмийн боломжит байг илрүүлэх AI загваруудыг сургахад ашиглах болно.
