EN Menu

20 Feb. 2026

Verbesserte Vorhersage des kardiovaskulären Erkrankungsrisikos mittels integrierter Machine-Learning-Modelle

eine Studie aus der UK-Biobank-Kohorte

Yang, Q., Lu et al. - Open Heart

Klassische Risikoscores wie Framingham und SCORE greifen manchmal aufgrund ihres begrenzten Variablensatzes zu kurz. In dieser Studie wurde maschinelles Lernen eingesetzt, um ein umfassendes kardiovaskuläres Risikomodell aus der UK Biobank (240.644 Teilnehmer) zu entwickeln, das genetische Scores, klinische Parameter und Lebensstilfaktoren kombiniert, mit separaten Modellen für das kardiovaskuläre Gesamtrisiko sowie zerebrovaskuläre und thrombotische Erkrankungen. Das integrierte Modell (klinisch + Lebensstil + genetisch) schnitt am besten ab, mit einer AUC von 0,85 — eine Verbesserung um 0,12 gegenüber dem Framingham-Score. Modelle, die ausschließlich auf klinischen, Lebensstil- oder genetischen Daten basierten, schnitten schlechter ab. Wichtige Prädiktoren waren Alter, systolischer Blutdruck, Cystatin C und Taillenumfang. Die Kombination von klinischen, Lebensstil- und genetischen Daten verbessert somit die kardiovaskuläre Risikovorhersage erheblich — eine Validierung in diversen Populationen ist jedoch noch erforderlich.

Zusammenfassung

Zielsetzung

Kardiovaskuläre Erkrankungen (CVD) bleiben weltweit die häufigste Todesursache, was eine frühzeitige Risikoidentifikation zur Verbesserung von Präventions- und Managementstrategien erforderlich macht. Traditionelle Risikovorhersagemodelle wie der Framingham Cardiovascular Risk Score und die Systematic Coronary Risk Evaluation greifen aufgrund ihrer Abhängigkeit von klassischen statistischen Methoden und ihres begrenzten Variablenumfangs häufig zu kurz.

Material und Methoden

Diese Studie nutzte Methoden des maschinellen Lernens (ML), um ein umfassendes CVD-Risikovorhersagemodell anhand von Daten der UK-Biobank-Kohorte zu entwickeln und zu validieren. Unser Ansatz integrierte genetische Scores, klinische Parameter und Lebensstilfaktoren, um separate Modelle für das CVD-Gesamtrisiko, zerebrovaskuläre Erkrankungen, thrombotische Erkrankungen und andere kardiovaskuläre Erkrankungen zu erstellen. Wir verwendeten eine vielfältige Auswahl an ML-Algorithmen, darunter Ridge Regression, Logistic Regression, Support Vector Machines, Random Forest, XGBoost, Multilayer Perceptron und Stacking, mit strengen Kreuzvalidierungsverfahren zur Gewährleistung der Robustheit.

Ergebnisse

Aus einer anfänglichen Kohorte von 502.407 Personen wurden 240.644 Teilnehmer in die endgültige Analyse einbezogen. Das integrierte Modell, das klinische, Lebensstil- und genetische Daten kombinierte, erzielte die höchste Vorhersageleistung mit einer Fläche unter der Kurve (AUC) von 0,85. Modelle, die ausschließlich auf klinischen Daten, Lebensstildaten und polygenen Risikoscores basierten, zeigten eine geringere Vorhersagekraft. Die stratifizierte Analyse ergab eine variable Leistung über die CVD-Subtypen hinweg, mit der höchsten AUC von 0,83 für andere kardiovaskuläre Erkrankungen. Zu den wichtigsten Prädiktoren zählten Alter, systolischer Blutdruck, Cystatin-C-Spiegel und Taillenumfang.

Schlussfolgerung

Die Integration klinischer, Lebensstil- und genetischer Daten verbessert die Vorhersagegenauigkeit von ML-Modellen für das CVD-Risiko erheblich. Unser Modell zeigt eine robuste Leistung mit einer Verbesserung der AUC um 0,12 gegenüber dem Framingham Cardiovascular Risk Score und unterstreicht damit seinen potenziellen Nutzen im klinischen Umfeld für die frühzeitige Risikoidentifikation und personalisierte Interventionsstrategien. Zukünftige Forschung sollte sich auf die Verfeinerung des Modells durch Einbeziehung zusätzlicher Prädiktoren und die Validierung seiner Anwendbarkeit über diverse Populationen hinweg konzentrieren.