Οι κλασικές βαθμολογίες κινδύνου, όπως η Framingham και η SCORE, ενίοτε αποδεικνύονται ανεπαρκείς λόγω του περιορισμένου συνόλου μεταβλητών τους. Σε αυτή τη μελέτη, χρησιμοποιήθηκε μηχανική μάθηση για την ανάπτυξη ενός ολοκληρωμένου μοντέλου καρδιαγγειακού κινδύνου από το UK Biobank (240.644 συμμετέχοντες), συνδυάζοντας γενετικές βαθμολογίες, κλινικές παραμέτρους και παράγοντες τρόπου ζωής, με ξεχωριστά μοντέλα για τον συνολικό καρδιαγγειακό κίνδυνο, την εγκεφαλοαγγειακή και τη θρομβωτική νόσο. Το ολοκληρωμένο μοντέλο (κλινικό + τρόπος ζωής + γενετικό) είχε την καλύτερη απόδοση, με AUC 0,85 — βελτίωση κατά 0,12 σε σύγκριση με τη βαθμολογία Framingham. Τα μοντέλα που βασίζονταν αποκλειστικά σε κλινικά, τρόπου ζωής ή γενετικά δεδομένα είχαν χειρότερη απόδοση. Βασικοί προγνωστικοί παράγοντες ήταν η ηλικία, η συστολική αρτηριακή πίεση, η κυστατίνη C και η περιφέρεια μέσης. Ο συνδυασμός κλινικών, τρόπου ζωής και γενετικών δεδομένων βελτιώνει έτσι σημαντικά την πρόβλεψη καρδιαγγειακού κινδύνου — αν και εξακολουθεί να απαιτείται επικύρωση σε διαφορετικούς πληθυσμούς.
Οι καρδιαγγειακές νόσοι (CVD) παραμένουν η κύρια αιτία θνησιμότητας παγκοσμίως, καθιστώντας απαραίτητη την έγκαιρη αναγνώριση κινδύνου για τη βελτίωση των στρατηγικών πρόληψης και διαχείρισης. Τα παραδοσιακά μοντέλα πρόβλεψης κινδύνου, όπως το Framingham Cardiovascular Risk Score και το Systematic Coronary Risk Evaluation, συχνά αποδεικνύονται ανεπαρκή λόγω της εξάρτησής τους από κλασικές στατιστικές μεθόδους και του περιορισμένου εύρους μεταβλητών τους.
Αυτή η μελέτη αξιοποίησε τεχνικές μηχανικής μάθησης (ML) για την ανάπτυξη και επικύρωση ενός ολοκληρωμένου μοντέλου πρόβλεψης κινδύνου CVD χρησιμοποιώντας δεδομένα από την κοόρτη του UK Biobank. Η προσέγγισή μας ενσωμάτωσε γενετικές βαθμολογίες, κλινικές παραμέτρους και παράγοντες τρόπου ζωής για τη δημιουργία ξεχωριστών μοντέλων για τη συνολική CVD, τις εγκεφαλοαγγειακές νόσους, τις θρομβωτικές νόσους και άλλες καρδιαγγειακές παθήσεις. Χρησιμοποιήσαμε ένα ποικίλο σύνολο αλγορίθμων ML, συμπεριλαμβανομένων των Ridge Regression, Logistic Regression, Support Vector Machines, Random Forest, XGBoost, Multilayer Perceptron και Stacking, με αυστηρές διαδικασίες διασταυρούμενης επικύρωσης για τη διασφάλιση της αξιοπιστίας.
Από μια αρχική κοόρτη 502.407 ατόμων, 240.644 συμμετέχοντες εντάχθηκαν στην τελική ανάλυση. Το ολοκληρωμένο μοντέλο, που συνδύαζε κλινικά, τρόπου ζωής και γενετικά δεδομένα, πέτυχε την υψηλότερη προγνωστική απόδοση με εμβαδόν κάτω από την καμπύλη (AUC) 0,85. Τα μοντέλα που βασίζονταν αποκλειστικά σε κλινικά δεδομένα, δεδομένα τρόπου ζωής και πολυγονιδιακές βαθμολογίες κινδύνου έδειξαν χαμηλότερη προγνωστική ισχύ. Η στρωματοποιημένη ανάλυση αποκάλυψε μεταβλητή απόδοση μεταξύ των υποτύπων CVD, με την υψηλότερη AUC 0,83 για άλλες καρδιαγγειακές νόσους. Οι βασικοί προγνωστικοί παράγοντες περιελάμβαναν την ηλικία, τη συστολική αρτηριακή πίεση, τα επίπεδα κυστατίνης C και την περιφέρεια μέσης.
Η ενσωμάτωση κλινικών, τρόπου ζωής και γενετικών δεδομένων ενισχύει σημαντικά την προγνωστική ακρίβεια των μοντέλων ML για τον κίνδυνο CVD. Το μοντέλο μας επιδεικνύει ισχυρή απόδοση, με βελτίωση 0,12 στην AUC σε σύγκριση με το Framingham Cardiovascular Risk Score, αναδεικνύοντας τη δυνητική του χρησιμότητα σε κλινικά περιβάλλοντα για την έγκαιρη αναγνώριση κινδύνου και εξατομικευμένες στρατηγικές παρέμβασης. Η μελλοντική έρευνα θα πρέπει να επικεντρωθεί στη βελτίωση του μοντέλου με την ενσωμάτωση επιπρόσθετων προγνωστικών παραγόντων και την επικύρωση της εφαρμοσιμότητάς του σε διαφορετικούς πληθυσμούς.