Les scores de risque classiques, tels que Framingham et SCORE, sont parfois insuffisants en raison de leur ensemble limité de variables. Dans cette étude, l'apprentissage automatique a été utilisé pour développer un modèle complet de risque cardiovasculaire à partir de l'UK Biobank (240 644 participants), combinant des scores génétiques, des paramètres cliniques et des facteurs de mode de vie, avec des modèles distincts pour le risque cardiovasculaire global, les maladies cérébrovasculaires et thrombotiques. Le modèle intégré (clinique + mode de vie + génétique) a obtenu les meilleurs résultats, avec une AUC de 0,85 — une amélioration de 0,12 par rapport au score de Framingham. Les modèles basés uniquement sur des données cliniques, de mode de vie ou génétiques ont obtenu de moins bons résultats. Les principaux prédicteurs étaient l'âge, la pression artérielle systolique, la cystatine C et le tour de taille. La combinaison des données cliniques, de mode de vie et génétiques améliore ainsi considérablement la prédiction du risque cardiovasculaire — bien qu'une validation dans des populations diverses reste nécessaire.
Les maladies cardiovasculaires (CVD) demeurent la principale cause de mortalité dans le monde, nécessitant une identification précoce du risque pour améliorer les stratégies de prévention et de prise en charge. Les modèles traditionnels de prédiction du risque, tels que le Framingham Cardiovascular Risk Score et le Systematic Coronary Risk Evaluation, sont souvent insuffisants en raison de leur recours à des méthodes statistiques classiques et de leur portée limitée en termes de variables.
Cette étude a exploité des techniques d'apprentissage automatique (ML) pour développer et valider un modèle complet de prédiction du risque de CVD à l'aide de données de la cohorte UK Biobank. Notre approche a intégré des scores génétiques, des paramètres cliniques et des facteurs de mode de vie afin de créer des modèles distincts pour la CVD globale, les maladies cérébrovasculaires, les maladies thrombotiques et d'autres affections cardiovasculaires. Nous avons utilisé un ensemble diversifié d'algorithmes de ML, notamment Ridge Regression, Logistic Regression, Support Vector Machines, Random Forest, XGBoost, Multilayer Perceptron et Stacking, avec des procédures de validation croisée rigoureuses pour garantir la robustesse.
À partir d'une cohorte initiale de 502 407 personnes, 240 644 participants ont été inclus dans l'analyse finale. Le modèle intégré, combinant des données cliniques, de mode de vie et génétiques, a obtenu la meilleure performance prédictive avec une aire sous la courbe (AUC) de 0,85. Les modèles basés uniquement sur des données cliniques, des données de mode de vie et des scores de risque polygénique ont montré un pouvoir prédictif plus faible. L'analyse stratifiée a révélé une performance variable selon les sous-types de CVD, avec l'AUC la plus élevée de 0,83 pour les autres maladies cardiovasculaires. Les principaux prédicteurs comprenaient l'âge, la pression artérielle systolique, les taux de cystatine C et le tour de taille.
L'intégration de données cliniques, de mode de vie et génétiques améliore considérablement la précision prédictive des modèles de ML pour le risque de CVD. Notre modèle démontre une performance robuste, avec une amélioration de 0,12 de l'AUC par rapport au Framingham Cardiovascular Risk Score, soulignant son utilité potentielle en contexte clinique pour l'identification précoce du risque et les stratégies d'intervention personnalisées. Les recherches futures devraient se concentrer sur l'affinement du modèle en intégrant des prédicteurs supplémentaires et en validant son applicabilité dans des populations diverses.