Priežastinio atradimo algoritmų iššūkiai ir galimybės: taikymas Alzheimerio ligos patofiziologijai

Feb 19, 2022

Xinpeng Shen1*, Sisi Ma1ir kt


Priežastinių struktūrų atradimas (cSD) yra priežastinių ryšių nustatymo iš didelio duomenų kiekio skaičiavimo metodais problema. Dėl riboto tradicinių asociacijomis pagrįstų skaičiavimo metodų galimybių atrasti priežastinius ryšius, cSD metodikos populiarėja. Tyrimo tikslas buvo sistemingai ištirti, ar (i) cSD metodais galima atrasti žinomus priežastinius ryšius iš stebėjimo klinikinių duomenų ir (ii) pateikti gaires, kaip tiksliai nustatyti žinomus priežastinius ryšius. Mes naudojomAlzheimerio liga(AD), sudėtinga progresuojanti liga, kaip modelis, nes nusistovėję įrodymai pateikia „auksinio standarto“ priežastinio ryšio grafiką vertinimui. Įvertinome du cSD metodus, greitą priežastinį ryšį (FCI) ir greitą Greedy equivalence Search (fGeS), kad jie galėtų atrasti šią struktūrą iš duomenų, surinktųAlzheimerio liganeuroimaging iniciatyva (ADni). Kaip valdymą naudojome struktūrinių lygčių modelius (kurie nėra skirti cSD). Šiuos metodus taikėme pagal tris scenarijus, apibrėžtus didėjant metodams suteikiamų foninių žinių kiekiu. metodai buvo įvertinti lyginant gautus priežastinius ryšius su „aukso standarto“ grafiku, kuris buvo sudarytas iš literatūros. Specialiais cSD metodais pavyko atrasti grafikus, kurie beveik sutapo su aukso standartu. Siekiant geriausių rezultatų, cSD algoritmai turėtų būti naudojami su išilginiais duomenimis, suteikiančiais kiek įmanoma daugiau išankstinių žinių.

Kontaktas:joanna.jia@wecistanche.com/ WhatsApp: 008618081934791

the effect of cistanche extract phenethanol glycosides on Alzheimer's

Poveikiscistanche ekstraktasfenoksietanolio glikozidai įjungtiAlzheimerio liga

Didelių duomenų analizė, mašinų mokymasis ir gilus mokymasis sulaukė didelio susidomėjimo sveikatos mokslų srityse1,2. Dėl puikaus prognozavimo tikslumo jie vis dažniau naudojami ligų diagnostikai ir rizikos prognozavimui3. Tačiau daugelyje biomedicinos programų pagrindinis tikslas nėra pasiekti aukšto numatymo tikslumo. Rizikos veiksnio ar mechanizmo, kurį galima pakeisti, atradimas dažnai yra pagrindinis tyrimo klausimas.

Šiandienos mašininio mokymosi programos daugiausia pagrįstos asociacijomis. Nors rizikos veiksnys gali būti susijęs su liga, tai nebūtinai reiškia, kad jis gali pakeisti ligos eigą. 2018 m. pradžioje 3 fazės tyrime, pavadintame „TOMORROW“, buvo ištirtas vaistų nuo diabeto poveikis mažinant.Alzheimerio liga(AD) demencijos rizika4. Tyrimo metu buvo matuojamas amiloido nusėdimas, kuris yra ankstyvas Alzheimerio ligos požymis ir taip pat susijęs su diabetu. Tačiau, kadangi diabetas nėra amiloidozės priežastis, tyrimas nepavyko atliekant tarpinę analizę5,6. Kad intervencija būtų sėkminga, rizikos veiksnys, į kurį įsikišame, turėtų turėti priežastinį (o ne tik asociacinį) ryšį suligarezultatas.

Klinikiniai tyrimai daugiausia orientuoti į priežastinius ryšius. Pavyzdžiui, hipotezėmis pagrįsti klinikiniai tyrimai dažnai daro prielaidą, kad yra priežastinė struktūra, priežastinių ryšių tarp biologinių žymenų ir rezultatų rinkinys, o mokslininkai įvertina šių ryšių poveikio dydį (pvz., priežastinį ryšį). Tokiame tyrime priežastinės išvados darymas yra pagrįstas, nes išankstinės žinios patvirtina, kad santykiai iš tikrųjų yra priežastiniai. Tačiau kai nėra žinių apie priežastinį ryšį, pati priežastinė struktūra turi būti atrasta iš duomenų, naudojant procesą, vadinamą priežastinės struktūros atradimu. Dažniausiai naudojama, bet neteisinga praktika yra priimti dalinę priežastinę struktūrą ir ją koreguoti remiantis pritaikyto modelio išvesties statistika, naudojant tokius metodus kaip struktūrinių lygčių modeliai (SEM).


Šiame darbe, naudodami AD biomarkerius kaip prognozes ir pažinimą kaip rezultatą, siekėme nustatyti optimalų būdą priežastiniams ryšiams atrasti. Mes naudojome AD kaip šios problemos modelį, nes AD biomarkerio kaskada yra gerai suprantama7, o priežastiniai ryšiai tarp pirminių prognozių taip pat buvo gerai apibūdinti, kad būtų galima sudaryti „auksinio standarto“ grafiką. Be to, viešųjų duomenų rinkinysAlzheimerio liga← Neurovaizdavimo iniciatyva (ADNI) turi daug išilginių duomenų, kurie yra palankūs sistemingiems palyginimams, numatytiems šiame rankraštyje. Čia mes sutelkiame dėmesį į tam, kad palygintume specialių priežastinio ryšio aptikimo algoritmų ir paieškos algoritmo, pagrįsto SEM, rezultatus su mūsų „auksinio standarto“ diagrama. Taip pat ištyrėme dažniausiai pasitaikančių klaidų priežastis ir išnagrinėjome būdus, kaip jų išvengti. Šie eksperimentai leido mums pateikti gaires, kaip atrasti priežastines struktūras naudojant stebėjimo duomenis.

Cistanche Prevents Alzheimer's

Cistanche apsaugoAlzheimerio liga

Fonas

priežastinės struktūros atradimo algoritmai.Neoficialiai priežastinis ryšys apibrėžiamas kaip ryšys tarp dviejų kintamųjų X ir Y, kad X pokyčiai lemia Y8 pokyčius. Pagrindinis skirtumas tarp asociacijos ir priežastinio ryšio yra galimybė suklaidinti. Tarkime, kad tarp X ir Y nėra tiesioginio priežastinio ryšio, o trečiasis kintamasis Z sukelia ir X, ir Y. Šiuo atveju, nors X ir Y yra stipriai susiję, X pakeitimas nesukels Y pokyčių. Z vadinamas painiavos. Formaliau kalbant, priežastinis ryšys yra tiesioginis A ir B poveikis, kuris išlieka pritaikius klaidinimui. Painiojimas gali būti stebimas arba nepastebimas (latentinis).

Priežastinė struktūra yra priežastinių ryšių tarp kintamųjų rinkinio rinkinys, o priežastinės struktūros atradimas yra priežastinės struktūros išmokimo iš stebėjimo duomenų problema. Egzistuoja specialūs priežastinių struktūrų aptikimo algoritmai, kuriuos galima suskirstyti į du potipius – suvaržymais ir balais. Apribojimai pagrįsti algoritmai sukuria priežastinę struktūrą, pagrįstą sąlyginiais nepriklausomybės apribojimais, o balais pagrįsti algoritmai sukuria daugybę galimų priežastinių grafikų, kiekvienam priskiria balą ir pagal balus pasirenka galutinį grafiką. Šiame tyrime pasirinkome vieną ryškų kiekvieno tipo algoritmą: greito priežastinio išvados algoritmą (FCI), kuris yra suvaržymais pagrįstas algoritmas, ir greitą godaus atitikmens paiešką (FGES), kuris yra balais pagrįstas algoritmas. Trumpumo dėlei pateikiame aukšto lygio FGES ir FCI aprašymą. Išsamesnius aprašymus skaitykite 9–11 nuorodose. Abu du metodai gali prisitaikyti prie pastebėto painiavos, o vienas iš algoritmų, FCI, turi tam tikrą galimybę aptikti paslėptą painiavą.

greita priežastinė išvada (fci).Pagrindinė suvaržymais pagrįsto priežastinio ryšio aptikimo algoritmo koncepcija yra idėja, kad skirtingos priežastinės struktūros reiškia skirtingus nepriklausomybės ryšius. Pavyzdžiui, priežastinis ryšys A →- B → C reiškia, kad kintamasis A yra nepriklausomas nuo C, atsižvelgiant į B. Kita vertus, kai A → C←B, A ir B yra nepriklausomi (besąlygiškai), bet tampa priklausomi sąlyginiai ant C. Pastaroji struktūra vadinama "V" struktūra (taip pat žinoma kaip kolaideris), kuri turi unikalų nepriklausomybės ryšį, palyginti su kitais priežastiniais ryšiais. Tiesą sakant, tai yra vienas iš „primityvų“, kurio ieško apribojimais pagrįstas algoritmas, kaip ir FCI.

FCI būdinga ypatybė net tarp apribojimais pagrįstų metodų yra jos gebėjimas aptikti latentinius (nepastebimus) trikdžius. Tai įgalina kitas primityvus – „Y“ struktūra. Keturi kintamieji apibrėžia "Y" struktūrą, kai jie turi tokius priežastinius ryšius: W1 → X ← W2 ir X → Y. „Y“ struktūroje ir W1, ir W2 yra nepriklausomi nuo Y, sąlygojančio X. Sąlyginis nepriklausomumas padeda atmesti galimybę, kad tarp X ir Y gali atsirasti neišmatuotas painiavos. Kitaip tariant, kai FCI randa „Y“ struktūrą grafike, priežastinis ryšys nuo X iki Y garantuotai bus nepainiojamas; kitu atveju FCI daro prielaidą, kad egzistuoja galbūt nepastebėti painiavos12.

Greitos priežastinės išvados (FCI) algoritmas. FCI sukuria priežastinį grafiką, pradedant nuo visiškai sujungto neorientuoto grafo, ir pašalina briaunas, jungiančias sąlygiškai nepriklausomus kintamuosius. Antrajame etape jis orientuoja briaunas, nustatydamas "V" ir "Y" struktūras, ir bando orientuoti likusius kraštus pagal taisyklių rinkinį, kuris buvo išsamiai paaiškintas kitur9, 13.

Greitas gobšios atitikmenų paieškos (FGES) algoritmas.Greedy Equivalence Search (GES) algoritmas taip pat turi dvi fazes. Pirmoji fazė prasideda nuo grafiko, kuriame nėra briaunų (atitinkančių, kad visi kintamieji yra nepriklausomi vienas nuo kito), ir po vieną godžiai prideda briaunų (priklausomybių) taip, kad būtų sumažintas Bayes informacijos balas14 (BIC), už kurį gali būti baudžiama. sudėtingumas, siekiant sumažinti permontavimą. Tada GES pašalina kraštus po vieną, kol sumažina BIC. Šiame darbe naudojamas FGES10 algoritmas yra tiesiog „greita“ (lygiagreti) GES11,15 versija. Panašiai kaip FCI, FGES taip pat remiasi „V“ struktūromis, kad orientuotų kraštus. Numanoma „V“ struktūros tikimybė yra unikali, o A → B → C, C → B → A ir A ←BC tikimybė yra tokia pati. Taigi, FGES pasirinks "V" struktūras, kai tai reiškia didesnę tikimybę nei kitos struktūros.


Struktūrinių lygčių modeliavimas (SEM).Struktūrinis lygčių modeliavimas (SEM) yra statistinių modelių šeima, kuri, atsižvelgiant į pagrindinę priežastinę struktūrą, gali įvertinti kiekvieno ryšio poveikio dydį (ir kitą statistiką)16. SEM taip pat gali pasiūlyti tam tikros priežastinės struktūros pakeitimus, kad pagerintų modelio tinkamumo statistiką.

Nors SEM nebuvo sukurta priežastinei struktūrai atrasti, nėra neįprasta naudoti SEM siūlomus pakeitimus, kad „patobulintų“ grafiko struktūrą. Šią funkciją galima panaudoti kartotiškai sudaryti priežastinį grafiką kiekvienoje iteracijoje, pridedant vieną kraštą pagal SEM pasiūlymą. Šį (neteisingą) paieškos metodą įgyvendinome pagal du scenarijus: (1) pradedant nuo tuščio grafiko (priežastinis atradimas); ir (2) pradedant nuo grafiko, gauto išbraukus 1 arba 2 „auksinio standarto“ grafiko briaunas. Atkreipkite dėmesį, kad šiame darbe terminą „SEM“ naudojame algoritmui, kuris naudoja SEM kraštų paieškai atlikti, o ne poveikio dydžiui įvertinti.

Pagrindiniai algoritmų skirtumai. Tiek SEM, tiek FGES yra laipsniški algoritmai, modifikuojantys struktūrą pridėdami arba ištrindami kraštus. Didžiausias FGES privalumas yra tas, kad jis išplečia paieškos erdvę, transformuodamas dabartinę struktūrą į kitas „lygiavertes“ struktūras. Pavyzdžiui, atsižvelgiant į briauną, A → B yra A, B ir C grafikuose. SEM bandys pridėti vieną nukreiptą kraštą tarp C ir A arba C ir B, todėl bus keturios galimybės. Tačiau FGES apsvarsto daugiau galimybių, nes ji taip pat gali pakeisti esamą kraštą A → B į A ← B, todėl gaunamos keturios papildomos galimos struktūros.

Išskyrus paieškos strategijas (pagrįstas apribojimais ir balais), FCI taip pat skiriasi nuo kitų dviejų algoritmų prielaida apie priežastinį ryšį: tiek SEM, tiek FGES veikia darant prielaidą, kad nėra neišmatuotų painiavos. Kitaip tariant, visi klaidinantys kintamieji matuojami duomenų rinkinyje. Tačiau FCI sušvelnina šią prielaidą ir praneša apie nesupainiotą ryšį tik tada, kai susiduria su „Y“ struktūra17.

FCI ir FGES algoritmai yra įdiegti Tetrad programiniame pakete (6.5.4 versija). 1 paveiksle parodytos skirtingų briaunų tipų interpretacijos išvesties grafike. PVR naudojome R paketą „lavaan“18.



Metodas

Duomenys.Duomenys, naudojami rengiant šį straipsnį, buvo gauti išAlzheimerio ligaNeuroimaging Initiative (ADNI) duomenų bazė (adni.loni.usc.edu). ADNI buvo įkurta 2003 m. kaip viešojo ir privačiojo sektorių partnerystė, kuriai vadovavo vyriausiasis tyrėjas Michael W. Weiner, MD. Pagrindinis ADNI tikslas buvo patikrinti, ar serijinis magnetinio rezonanso tomografija (MRT), pozitronų emisijos tomografija (PET), kiti biologiniai žymenys ir klinikinis bei neuropsichologinis įvertinimas gali būti derinami siekiant įvertinti lengvo pažinimo sutrikimo (MCI) progresavimą ir ankstyvą.Alzheimerio ligaliga(AD)19. Yra trys ADNI tyrimo etapai, kurių paskutinis, ADNI3, vis dar vyksta. Visi tyrimo dalyviai pateikė raštišką informuotą sutikimą, o tyrimo protokolus patvirtino kiekvienos vietos institucinė peržiūros taryba. Visi metodai buvo atlikti pagal atitinkamas gaires ir reglamentus. Norėdami gauti naujausios informacijos, žr. www.adni-info.org. IRB peržiūros nereikėjo, nes ADNI duomenys yra neidentifikuoti ir viešai pasiekiami atsisiųsti. Mes sutelkėme savo tyrimą į pirmuosius du: ADNI 1 ir ADNI 2/GO. Iš duomenų išgauti kintamieji yra fludeoksigliukozės PET (FDG), amiloidas-beta (ABETA), fosforilintas tau (PTAU), apolipoproteino E (APOE) ε4 alelis; demografinė informacija: amžius, lytis, išsilavinimas (EDU); ir diagnozė dėl AD (DX). 1 lentelėje pateikta suvestinė duomenų rinkinio statistika. Pašalinus įrašus su trūkstamomis reikšmėmis, liko 1008 dalyviai, turintys bent vieną pilną įrašą, ir 266 dalyviai, kurie reguliariai lankosi dvejus metus.

Figure 1. Te interpretation of edges

„Aukso standarto“ grafikas.AD biomarkerio kaskada buvo plačiai įvertinta. ABETA nusėdimas smegenyse yra ankstyvas ligos proceso įvykis ir fiksuojamas sumažėjus CSF ABETA kiekiui. Nustatyti ABETA rizikos veiksniai yra amžius ir APOE4 alelių skaičius6,20,21. ABETA sukelia pasroviui neurofibrilinių raizginių formavimąsi ir vėliau neurodegeneraciją, kurią abu užfiksuoja metabolinė disfunkcija per FDG-PET22 ir PTAU padidėjimas, išmatuotas CSF23. Du žymenys FDG-PET ir CSF PTAU yra stipriausi kognityvinės funkcijos sutrikimo ar diagnozės prognozuotojai24, 25 (palyginti su ABETA). Išsilavinimas, kognityvinio atsparumo pakaitalas, daro įtaką individo pažinimo būsenai26. Visa tai yra literatūroje nusistovėję santykiai. Yra silpnesnių priežastinių asociacijų, tokių kaip lytis, turinčios įtakos kai kurioms iš šių asociacijų, į kurias mes neatsižvelgėme vertindami algoritmus, nes šių asociacijų poveikis yra daug mažesnis, palyginti su pagrindiniais „auksinio standarto“ grafike aptartais poveikiais. Aukščiau aprašyti ryšiai parodyti 2 pav.

Pagrindinės žinios ir skerspjūvio bei išilginiai duomenys.Norint apriboti ryšius, kuriuos gali aptikti algoritmai, gali būti pateiktos pagrindinės žinios kaip privalomos arba neturi būti (draudžiamos) briaunos. Šiame darbe mes apibrėžėme tris foninių žinių laipsnius: (1 lygis) Nėra žinių: atrasta struktūra grynai atspindi duomenis; jokie kraštai nedraudžiami. (2 lygis) Nereikšmingos pagrindinės žinios: (a) demografinių kintamųjų ribos yra draudžiamos (nors ryšys tarp jų gali išlikti); b) ribos nuo biožymenų ar diagnozės iki demografinių kintamųjų yra draudžiamos. (3 lygis)

Figure 2. Te

Studiju dizainas.Priežastinio ryšio atradimo tyrimas. Šiai tyrimo daliai iš ANDI ištraukėme du duomenų rinkinius: vienas buvo vienas skerspjūvis, o duomenys buvo renkami kiekvieno dalyvio pradinio vizito metu. Antrasis yra išilginis, į kurį įtraukėme duomenis iš dviejų skerspjūvių: pradinio vizito ir apsilankymo per 24 mėnesius. Įrašai su trūkstamais duomenimis buvo pašalinti iš tolesnio tyrimo.

Norint gauti patikimus rezultatus, tiek skerspjūvio, tiek išilginiai duomenys buvo įkelti 100 kartų dalyvio lygiu. Dešimt, trys algoritmai SEM, FCI ir FGES buvo išbandyti su visais įkrovos pavyzdžiais, kad būtų galima įvertinti, įtraukiant tris skirtingus žinių lygius, kurie buvo aprašyti ankstesniame skyriuje.

Table 1. Characteristics for Continuous and Categorical Variables. N=1008.

SEM atkūrimo tyrimas. Kadangi dauguma tyrinėtojų pradėtų nuo hipotetinio grafiko ir naudotų tik SEM briaunoms pridėti, mes taip pat išbandėme SEM šiuo numanomu naudojimo atveju: inicijavome (hipotezavome) grafikus ištrindami kiekvieną briauną ir kiekvieną briaunų porą iš „auksinio standarto“ grafiko. , tada patikrino, ar SEM gali atkurti ištrintus kraštus po ne daugiau kaip penkių kraštų pridėjimo iteracijų. Šiame tyrime pasirinkome penkis, nes daugiau nei penkis kartus pridėjus briaunas, grafikas bus mažai atpažįstamas.

vertinimo metrikai. Norėdami įvertinti metodų efektyvumą, apibrėžėme šias vertinimo metrikas. Kraštas yra teisingas tada ir tik tada, kai ta pati briauna egzistuoja "aukso standarto" grafe ir briaunos orientacija sutampa su orientacija "aukso standarto" grafe; briauna yra pusiau teisinga tada ir tik tada, kai ta pati briauna egzistuoja "aukso standarto" grafe ir jos orientacija neprieštarauja tikrajai briaunos orientacijai "aukso standarto" grafe; Ir galiausiai, briauna yra neteisinga, jei briauna neegzistuoja "aukso standarto" grafe arba jei ji egzistuoja, bet jos orientacija yra priešinga tikrajai orientacijai.

Pateiksime šiuos rodiklius:

1. Teisingų, pusiau teisingų, neteisingų briaunų skaičius

2. Tikslumas: teisingų arba pusiau teisingų kraštų santykis tarp visų kraštų, nurodytų algoritmo

3. Prisiminkite: „auksinio standarto“ grafiko kraštinių dalis, kuri yra teisinga arba pusiau teisingai pateikta

4. Pasikartojimo dažnis: gretimumo procentas rodomas 100 įkrovos paleidimo rezultate




Rezultatai

priežastinio atradimo tyrimas. Šiame skyriuje parodytos aptiktos priežastinės struktūros, sukurtos SEM, FCI ir FGES algoritmais per tris ankstesnių „žinių“ laipsnius. Tipiškų klaidų užkulisinis mechanizmas bus toliau nagrinėjamas diskusijų skyriuje.

1 eksperimentas: be išankstinių žinių. 3 pav. pateikiame kraštus, kurių 100 įkrovos pavyzdžiuose yra bent 80 procentų (Te skaičius yra šalia kiekvieno krašto). Kraštai, kurių nebuvo aukso standarto grafike, yra nudažyti raudonai. Kiekvienos schemos dešinėje esantys skaičiai yra tikslumas, prisiminimas ir teisingų, pusiau teisingų ir neteisingų briaunų skaičius, apskaičiuotas per 1 00 įkrovos pavyzdžius. Siekiant palengvinti tiesioginį palyginimą, kintamieji išdėstyti beveik identiškai: tas pats kintamasis užima tą pačią santykinę vietą visuose trijuose grafikuose. SEM sugebėjo gauti tik dvi teisingas briaunas iš „auksinio standarto“ grafiko (vidutinis tikslumas 0,24 ir atšaukimas 0,30), o FCI ir FGES nustatė 4 iš 8 briaunų teisingai arba pusiau teisingai (tikslis 0,24). ir 0,44, prisiminti atitinkamai 0,46 ir 0,6). Tiek FCI, tiek FGES sėkmingai atkūrė priežastinį ryšį tarp genetinio kintamojo APOE41 su ABETA, ABETA su FDG ir FDG, PTAU su DX. Tačiau algoritmai nesugebėjo nustatyti kai kurių santykių krypties. Taip pat pastebėjome, kad visi trys algoritmai pranešė apie kraštines nuo biomarkerių iki demografinių kintamųjų, kurie tikrai yra klaidos (pvz., ABETA sukelia APOE42 FCI grafike). Svarbu pažymėti, kad kai kurie nusistovėję ryšiai, tokie kaip amžius ir amiloidas, taip pat išsilavinimas ir diagnozė, nebuvo aptikti nė viename iš grafikų, kuriuose nebuvo žinių.

2 eksperimentas: nereikšmingų žinių papildymas. 4 paveiksle pateiktos priežastinės struktūros, kurias aptiko trys algoritmai, apimantys nereikšmingas pagrindines žinias: demografinių kintamųjų negali sukelti kiti demografiniai kintamieji ar biomarkeriai (pvz., dalyvio amžiui įtakos neturi išsilavinimas ar ABETA lygis). 4 pav. struktūra analogiška 3 pav.

Nors visi metodai padarė keletą klaidų, pridėjus nereikšmingą pagrindinę informaciją buvo padaryta reikšmingų patobulinimų. Kai kurie neteisingi priežastiniai ryšiai, kuriuos nustatė SEM, iš tikrųjų yra netiesioginiai priežastiniai ryšiai „auksiniame standarte“. Pavyzdžiui, APOE42 į DX efektas yra netiesioginis efektas, kuris teka per ABETA „auksinio standarto“ diagramoje. Visi trys algoritmai atrado kraštą ABETA → DX. Nors tai nėra tiesioginis priežastinis poveikis mūsų „auksinio standarto“ diagramoje, ABETA yra dažna FDG sumažėjimo ir PTAU padidėjimo priežastis, o FDG ir PTAU sukelia DX. Todėl galima numatyti ABETA ir DX poveikį. Tiek FCI, tiek FGES pranešė apie klaidingai nukreiptą ribą tarp PTAU ir DX. Pamatysime, kad ši klaida ištaisyta naudojant išilginius duomenis. FCI algoritmas taip pat pranešė apie neišmatuotas painiavas tarp PTAU ir DX su FDG, kurios yra įdomios hipotezės, kurias reikia toliau tirti. Iš trijų algoritmų SEM pasiekė mažiausią našumą (tikslumas 0.31, prisiminimas 0.39), o FCI ir FGES pasiekė didesnį ir žymiai didesnį našumą (FCI: 0.42 tikslumas). ir 0.55 atšaukimas; FGES {{10}}.71 tikslumas ir 0,68 atšaukimas).

3 eksperimentas. Išilginių duomenų ir nereikšmingų žinių pridėjimas. 5 paveiksle pateikiamos dažniausiai trijų algoritmų aptiktos briaunos ir jų veikimo metrika. Grafikų išdėstymas skiriasi nuo ankstesnių paveikslų, nes jie sukurti remiantis išilginiu duomenų rinkiniu. Taigi visi mazgai, susieti su biologiniais žymenimis arba diagnoze, rodomi du kartus: vieną kartą su pradine verte (žymima „0.0“ priesaga) ir vieną kartą po 24 mėnesių (žymima „0“. 24' priesaga). Dauguma statistinių duomenų dar labiau pagerėjo, palyginti su ankstesniais rezultatais, ir FGES atkūrė grafiką su tik vienu neteisingu kraštu.

SEM algoritmo našumas atsiliko nuo kitų dviejų tam skirtų priežastinio ryšio aptikimo algoritmų. Kai kuriuose įkrovos paleidimuose SEM praleido tiesioginius efektus tarp to paties biologinio žymeklio išilginių matavimų (pvz., apskaičiuota tikimybė, kad SEM aptiks kraštą ABETA.{{0}} →ABETA.24 yra 0,47, kur FCI ir FGES visada apima šį kraštą).

FCI algoritmas taip pat nustatė, kad PTAU pirminio vizito metu turi įtakos diagnozei (AD) po 24 mėnesių. Kitaip tariant, PTAU gali turėti atidėtą poveikį AD diagnozei, o tai yra labai tikėtina hipotezė. Mes taip pat pastebėjome, kad AMŽIAUS ir IŠSIlavinimas lemia skirtingą FDG ir diagnozę pirmojo apsilankymo metu, bet ne tiesiogiai vertinant po 24 mėnesių (pakoregavus vertinimą pradinio vizito metu).

FGES algoritmas įtraukė išilginius duomenis ir sėkmingai atrado FDG į DX kraštą. Jis taip pat pašalino neteisingus DX ir PTAU kraštus. Be to, naudojant išilginius duomenis, anksčiau FGES identifikuoti nenukreipti kraštai buvo nukreipti nepažeidžiant bendro tikslumo ir atkūrimo.

S eM atkūrimo tyrimas.2 lentelėje parodyta statistika, kai išbandėme SEM gebėjimą atkurti ištrintus kraštus iš „auksinio standarto“ grafiko. Kiekviename paleidime ištrynėme vieną kraštą arba kraštų porą. „Visiško atkūrimo rodiklis“ reiškia paleidimų, per kuriuos SEM pavyko visiškai atkurti ištrintą (-us) kraštą (-ius), procentą. „Precizumo“ ir „atsišaukimo“ stulpeliai apibrėžiami taip pat, kaip ir ankstesniuose eksperimentuose. Kaip matome iš 2 lentelės, pašalinus tik vieną kraštą, atkūrimo rodiklis yra labai mažas (12,5 proc.). Kai pašalinome du „auksinio standarto“ grafiko kraštus, SEM negalėjo atkurti tikrojo grafiko.


Diskusija

Šiame tyrime palyginome tris skirtingas metodikas, kad atkurtume žinomą pagrindinę tiesą priežastinę struktūrą, pagrįstą stebėjimo duomenų rinkiniu, naudojant tris skirtingus „žinių“ laipsnius. Mes naudojomAlzheimerio ligaduomenys iš ADNI, kuris yra gerai apibūdintas atvirai prieinamas duomenų rinkinys. Kadangi ryšiai tarp biomarkerių ir diagnozėsAlzheimerio ligayra gerai suprantami, pradėjome nuo „aukso standarto“ priežastinės struktūros, paremtos esama literatūra. Dešimt, mes pritaikėme tris algoritmus, kad atskleistume šią priežastinę struktūrą iš duomenų. Šiame darbe išryškinamos dažniausios skirtingų algoritmų daromos klaidos ir pateikiamos idėjos bei pasiūlymai, kaip išvengti šių klaidų. Pabaigoje buvo pateiktos išsamios gairės, kaip priežastinio ryšio aptikimo algoritmas gali būti taikomas norint nustatyti aukštos kokybės priežastinius ryšius.

Kiekvienas iš trijų šiame darbe naudojamų algoritmų yra algoritmų klasė su specifinėmis savybėmis. Du iš algoritmų – FCI ir FGES – yra skirti priežastinio ryšio aptikimo algoritmai, o trečiasis – SEM – visų pirma sukurtas kaip patvirtinimo įrankis. Specialūs priežastinio ryšio aptikimo algoritmai pranoko SEM visuose trijuose pagrindinių žinių lygiuose. Tai nenuostabu, nes SEM nėra specialiai sukurtas priežastinei struktūrai atrasti; SEM pateikti statistiniai duomenys rodo tik galimus a priori vartotojo nustatytos priežastinės struktūros koregavimus. Stebina tai, kiek FGES pranoko SEM, nes ir FGES, ir SEM optimizuoja tą patį kriterijų, ty BIC. Pagrindinis skirtumas tarp FGES ir SEM yra pagrindinės paieškos erdvės skalė: FGES atsižvelgia į platesnį grafikų masyvą, visus grafikus, kurių priklausomybės struktūra yra tokia pati (tas pats kintamųjų sąlyginių nepriklausomumo ryšių rinkinys). Atlikdami SEM atkūrimo eksperimentą taip pat pastebėjome, kad SEM pasiūlymai dėl kraštų pridėjimo paprastai nėra patikimi. Šios briaunos gali maksimaliai padidinti BIC ribotoje SEM paieškos erdvėje, tačiau tai nėra apskritai optimalūs kraštai: FGES, turėdamas didesnę paieškos erdvę, sugebėjo (beveik puikiai) atkurti „auksinio standarto“ grafiką.

FCI ir FGES turi panašias paieškos erdves, todėl pagrindiniai skirtumai tarp jų slypi paieškos algoritme. Balais pagrįsto algoritmo FGES našumas buvo didesnis ir stabilesnis nei mūsų tyrimo suvaržymais pagrįstas algoritmas FCI. FCI sprendimų priėmimui įtakos turėjo neteisingi nepriklausomumo testai, kuriuos įvedė atrankos šališkumas arba duomenų artefaktai. Šios klaidos išplito į kitas grafiko dalis generuojant neteisingas "V" arba "Y" struktūras ir galiausiai padarė žalą didelėms grafiko dalims. Priešingai, balais pagrįsti algoritmai, priimdami vietinius sprendimus, atsižvelgia į globalios struktūros tikimybę; taigi, šios klaidos lieka lokalizuotos. Tai paaiškina, kodėl atrasta FGES struktūra prieš pridedant smulkmenų žinias arba po jos yra nuoseklesnė. FCI pranašumas yra tas, kad ji gali sušvelninti įprastą prielaidą, kad nėra neišmatuotų painiavos. Šis atsipalaidavimas gali būti naudingas, kai svarbu nustatyti neišmatuojamus trikdžius arba finansuoti nepainiotus priežastinius ryšius. Mūsų tyrime FCI nustatė, kad ryšys tarp ABETA ir FDG yra nepainiojamas ir kad tarp FDG, DX gali būti neišmatuotų painiavos (4-FCI pav.)

Toliau tyrėme klaidas, kurias padarė FCI ir FGES. Šias klaidas suskirstėme į tris kategorijas ir 3 lentelėje apibūdinome jų priežastis ir sprendimus.



1. Pirmoji klaida įvyksta, kai duomenų artefaktai sukelia neteisingus kraštus. Pavyzdžiui, FCI pranešė apie skirtumą tarp EDU ir SEX (3-FCI pav.), nes mūsų imtyje vidutinis dalyvių vyrų išsilavinimo lygis yra aukštesnis. Svarbu vengti tokių neteisingų kraštų, nes jie gali sukurti neteisingas "V" arba "Y" struktūras, kurios kelia pavojų likusiems priežastinio ryšio nustatymo etapams. Pridėjus nereikšmingų žinių, ši problema gali būti išspręsta, nes neleis algoritmams traktuoti asociacijos kaip priežastinio ryšio.

2. Kai nėra visuotinai priimtų pagrindinių žinių, kompensuoti duomenų artefaktus yra sunkiau ir gali turėti tolimų paskesnių padarinių. Pavyzdžiui, APOE42-PTAU-FDG struktūra buvo numanoma kaip "V" struktūra (APOE42 →PTAU ←FDG) kai kuriuose įkrovos paleidimuose. Ši klaida atsirado dėl vienos neteisingai išvestos APOE42 ir FDG nepriklausomybės nuo imties duomenų. Ši klaida išplito per tris ryšius tarp (1) APOE42 ir PTAU, (2) PTAU ir FDG ir (3) APOE42 ir FDG, su sąlyga, kad PTAU, todėl tarp trijų atsirado „V“ struktūra. Negalime užkirsti kelio šiam kraštui naudodamiesi pagrindinėmis žiniomis, nebent iš anksto žinome sąlyginius nepriklausomybės ryšius tarp APOE42 ir FDG. Išilginių duomenų naudojimas padėjo ištaisyti šias klaidas; kaip matome 5-FCI pav., struktūra buvo pataisyta, kai buvo naudojami išilginiai duomenys.

3. Nors išilginiai duomenys išsprendžia daugybę problemų, pakartotinių stebėjimų reikalavimas gali apriboti imties dydį ir sukelti tam tikrų klaidų. Pavyzdžiui, FCI aptiko galimą uždelstą ryšį tarp PTAU laiko 0 ir DX 24 mėnesį (5-FCI pav.), tačiau toks pats ryšys nepastebėtas FGES rezultatuose (1 pav.). 5-FGES) – galbūt dėl ​​mažo imties dydžio.

Išilginio tyrimo metu negarantuojama, kad vietinės struktūros skirtinguose laiko taškuose bus vienodos. Pavyzdžiui, FGES aptiktoje diagramoje ABETA.{{0}} sukelia PTAU.0, bet ABETA.24 nesukelia PTAU.24. Priežastis ta, kad ABETA.0 yra įprastas ABETA.24 ir PTAU.0 pirminis. PTAU.24 sąlyginai nepriklauso nuo ABETA.24, atsižvelgiant į ABETA.{{10}} arba PTAU.0. Šis sąlyginis nepriklausomybės ryšys reiškia, kad esant ABETA.0 arba PTAU.0, ABETA.24 nereikia paaiškinti PTAU.24 pokyčiams.

Nors galutinis grafikas, gautas iš stebėjimo duomenų, labai atitiko „aukso standarto“ grafiką, mūsų išvados vis tiek priklauso nuo „aukso standarto“ teisingumo. Apskritai mes labai pasitikime „aukso standarto“ grafiku, nes biologinis AD biomarkerio kaskados mechanizmas yra gerai suprantamas ir FGES sugebėjo beveik tobulai atrasti „aukso standartą“. Tačiau labai tikėtina, kad FDG ir PTAU paaiškina tik dalį ABETA poveikio AD diagnozei; gali egzistuoti tiesioginis priežastinis ryšys iš ABETA DX. Nors rekomenduojame išilginius duomenis, duomenų rinkimas išilginiu būdu dažnai yra brangus, todėl paprastai imties dydis yra mažesnis. Mažas imties dydis sumažina priežastinio ryšio nustatymo algoritmo statistinę galią, o tai yra kompromisas. Bandėme sumažinti imties dydį 50 ir 75 procentais ir atlikome tą pačią analizę. Kai sumažinome imties dydį 50 procentų, bendras aptiktų kraštų skaičius per 100 įkrovos iteracijų sumažėjo. Tačiau kraštai, kurie buvo nuosekliai aptikti visame mėginyje, buvo nuosekliai aptikti ir sumažintame mėginyje. Pasiekėme panašų tikslumą ir prisiminimą. Kai dar labiau sumažinome imties dydį (iš viso 75 procentais), bendras kraštų skaičius buvo dar labiau sumažintas. Nors dažniausiai aptinkamos briaunos ir toliau buvo aptinkamos, „triukšmo briaunų“, kraštų, kurie buvo aptikti tik per kelias įkrovos iteracijas, skaičius išaugo.

Apibendrinant galima pasakyti, kad tam skirti priežastinio ryšio aptikimo algoritmai aplenkė SEM nustatydami priežastinę struktūrą. Realaus pasaulio duomenų analizėje duomenų kokybė turėjo įtakos aptiktos struktūros teisingumui. Įtraukus ankstesnes žinias ir naudojant išilginius duomenis, galima pagerinti aptiktą rezultatą, užkertant kelią algoritmams padaryti kai kurių galimų klaidų.

1. Pirmoji klaida įvyksta, kai duomenų artefaktai sukelia neteisingus kraštus. Pavyzdžiui, FCI pranešė apie skirtumą tarp EDU ir SEX (3-FCI pav.), nes mūsų imtyje vidutinis dalyvių vyrų išsilavinimo lygis yra aukštesnis. Svarbu vengti tokių neteisingų kraštų, nes jie gali sukurti neteisingas "V" arba "Y" struktūras, kurios kelia pavojų likusiems priežastinio ryšio nustatymo etapams. Pridėjus nereikšmingų žinių, ši problema gali būti išspręsta, nes neleis algoritmams traktuoti asociacijos kaip priežastinio ryšio.

2. Kai nėra visuotinai priimtų pagrindinių žinių, kompensuoti duomenų artefaktus yra sunkiau ir gali turėti tolimų paskesnių padarinių. Pavyzdžiui, APOE42-PTAU-FDG struktūra buvo numanoma kaip "V" struktūra (APOE42 →PTAU ←FDG) kai kuriuose įkrovos paleidimuose. Ši klaida atsirado dėl vienos neteisingai išvestos APOE42 ir FDG nepriklausomybės nuo imties duomenų. Ši klaida išplito per tris ryšius tarp (1) APOE42 ir PTAU, (2) PTAU ir FDG ir (3) APOE42 ir FDG, su sąlyga, kad PTAU, todėl tarp trijų atsirado „V“ struktūra. Negalime užkirsti kelio šiam kraštui naudodamiesi pagrindinėmis žiniomis, nebent iš anksto žinome sąlyginius nepriklausomybės ryšius tarp APOE42 ir FDG. Išilginių duomenų naudojimas padėjo ištaisyti šias klaidas; kaip matome 5-FCI pav., struktūra buvo pataisyta, kai buvo naudojami išilginiai duomenys.

3. Nors išilginiai duomenys išsprendžia daugybę problemų, pakartotinių stebėjimų reikalavimas gali apriboti imties dydį ir sukelti tam tikrų klaidų. Pavyzdžiui, FCI aptiko galimą uždelstą ryšį tarp PTAU laiko 0 ir DX 24 mėnesį (5-FCI pav.), tačiau toks pats ryšys nepastebėtas FGES rezultatuose (1 pav.). 5-FGES) – galbūt dėl ​​mažo imties dydžio.

Išilginiame tyrime negarantuojama, kad vietinės struktūros skirtinguose laiko taškuose bus vienodos. Pavyzdžiui, FGES aptiktoje diagramoje ABETA.{{0}} sukelia PTAU.0, bet ABETA.24 nesukelia PTAU.24. Priežastis ta, kad ABETA.0 yra įprastas ABETA.24 ir PTAU.0 pirminis. PTAU.24 sąlyginai nepriklauso nuo ABETA.24, atsižvelgiant į ABETA.{{10}} arba PTAU.0. Šis sąlyginis nepriklausomybės ryšys reiškia, kad esant ABETA.0 arba PTAU.0, ABETA.24 nereikia paaiškinti PTAU.24 pokyčiams.

Nors galutinis grafikas, gautas iš stebėjimo duomenų, labai atitiko „aukso standarto“ grafiką, mūsų išvados vis tiek priklauso nuo „aukso standarto“ teisingumo. Apskritai mes labai pasitikime „aukso standarto“ grafiku, nes biologinis AD biomarkerio kaskados mechanizmas yra gerai suprantamas ir FGES sugebėjo beveik tobulai atrasti „aukso standartą“. Tačiau labai tikėtina, kad FDG ir PTAU paaiškina tik dalį ABETA poveikio AD diagnozei; gali egzistuoti tiesioginis priežastinis ryšys iš ABETA DX. Nors rekomenduojame išilginius duomenis, duomenų rinkimas išilginiu būdu dažnai yra brangus, todėl paprastai imties dydis yra mažesnis. Mažas imties dydis sumažina priežastinio ryšio nustatymo algoritmo statistinę galią, o tai yra kompromisas. Bandėme sumažinti imties dydį 50 ir 75 procentais ir atlikome tą pačią analizę. Kai sumažinome imties dydį 50 procentų, bendras aptiktų kraštų skaičius per 100 įkrovos iteracijų sumažėjo. Tačiau kraštai, kurie buvo nuosekliai aptikti visame mėginyje, buvo nuosekliai aptikti ir sumažintame mėginyje. Pasiekėme panašų tikslumą ir prisiminimą. Kai dar labiau sumažinome imties dydį (iš viso 75 procentais), bendras kraštų skaičius buvo dar labiau sumažintas. Nors dažniausiai aptinkamos briaunos ir toliau buvo aptinkamos, „triukšmo briaunų“, kraštų, kurie buvo aptikti tik per kelias įkrovos iteracijas, skaičius išaugo.

Apibendrinant galima pasakyti, kad tam skirti priežastinio ryšio aptikimo algoritmai aplenkė SEM nustatydami priežastinę struktūrą. Realaus pasaulio duomenų analizėje duomenų kokybė turėjo įtakos aptiktos struktūros teisingumui. Įtraukus ankstesnes žinias ir naudojant išilginius duomenis, galima pagerinti aptiktą rezultatą, užkertant kelią algoritmams padaryti kai kurių galimų klaidų.

Cistanche can prevent Alzheimer's disease, choose Cistanche for brain health, click here to get samples

Cistanche gali užkirsti kelią Alzheimerio ligai, pasirinkite Cistanche smegenų sveikatai, spustelėkite čia, kad gautumėte mėginius




Nuorodos

1. Beam, AL & Kohane, yra dideli duomenys ir mašininis mokymasis sveikatos priežiūros srityje. JAMA 319, 1317–1318, https://doi.org/10.1001/jama.2017.18391 (2018).

2. Murdoch, TB & Detsky, AS Te Neišvengiamas didelių duomenų taikymas sveikatos priežiūrai Neišvengiamas didelių duomenų taikymas sveikatos priežiūrai. JAMA 309, 1351–1352.

3. Trister, AD, Buist, DSM ir Lee, CI Ar mašininis mokymasis pagerins krūties vėžio patikros pusiausvyrą? Ar mašininis mokymasis pagerins krūties vėžio patikros pusiausvyrą? Ar mašininis mokymasis pagerins krūties vėžio patikros pusiausvyrą? JAMA Oncology 3, 1463–1464.

4. Rogers, MB Tere's No Tomorrow for TOMORROW. ALZFORUM.

5. Arvanitakis, Z. ir kt. Cukrinis diabetas yra susijęs su smegenų infarktu, bet ne su AD patologija vyresnio amžiaus žmonėms. Neurology 67, 1960–1965.

6. Vemuri, P. ir kt. Amžius, kraujagyslių sveikata ir Alzheimerio ligos biomarkeriai vyresnio amžiaus mėginyje. Ann. Neurol. 82, 706–718.

7. Jack, CR Jr. ir kt. Alzheimerio ligos patofiziologinių procesų stebėjimas: atnaujintas hipotetinis dinaminių biomarkerių modelis. Lancet Neurol. 12, 207–216, https://doi.org/10.1016/s1474-4422(12)70291-0 (2013).

8. Pearl, J. Priežastinis ryšys: modeliai, samprotavimai ir išvados. t. 64 (Cambridge University Press, 2000).

9. Spirtes, P., Meek, C. & Richardson, TS Causal Inference in the Presence of latent Variables and Selection Bias. CORR abs/1302.4983(2013).

10. Ramsey, JD Greedy Equivalence Search for Continuous Variables didinimas. CORR abs/1507.07749 (2015).

11. Chickering, DM Optimalus struktūros identifikavimas naudojant godžią paiešką. Journal of Machine Learning Research 3, 507–554 (2002).

12. Mani, S., Spirtes, P. & Cooper, GF Teorinis Y struktūrų tyrimas, siekiant nustatyti priežastinį ryšį. CORR abs/1206.6853 (2012).

13. Spirtes, P., Clark, G. & Scheines, R. Causation, Prediction and Search. (Te MIT Press, 2000).

14. Schwarz, G. Modelio dimensijos įvertinimas. The Annals of Statistics 6, 461–464.

15. Meek, C. Graphical Models: Selecting Causal and Statistical Models, (1997).

16. Kline, RB Struktūrinių lygčių modeliavimo principai ir praktika, 3 leidimas. 265–295 (Guilford Press, 2011).

17. Heckerman, D., Meek, C. & Cooper, G. In Innovations in Machine Learning: Theory and Applications (red. Dawn E. Holmes & Lakhmi C. Jain) 1–28 (Springer Berlin Heidelberg, 2006).

18. Rosseel, Y. lavaan: R paketas struktūrinių lygčių modeliavimui. Statistikos programinės įrangos žurnalas 48, 36, https://doi.org/10.18637/jss.v048.i02 (2012).

19. Weiner, MW ir kt. Alzheimerio ligos neurovaizdavimo iniciatyvos poveikis, 2004–2014 m. Alzheimerio liga ir demencija: Alzheimerio asociacijos žurnalas 11, 865–884.

20. Mishra, S. ir kt. Išilginis smegenų vaizdavimas sergant ikiklinikine Alzheimerio liga: APOE epsilon4 genotipo įtaka. Smegenys 141, 1828–1839.


Tau taip pat gali patikti