Las puntuaciones de riesgo clásicas, como Framingham y SCORE, a veces resultan insuficientes debido a su conjunto limitado de variables. En este estudio, se utilizó el aprendizaje automático para desarrollar un modelo integral de riesgo cardiovascular a partir del UK Biobank (240.644 participantes), combinando puntuaciones genéticas, parámetros clínicos y factores de estilo de vida, con modelos separados para el riesgo cardiovascular general, la enfermedad cerebrovascular y la enfermedad trombótica. El modelo integrado (clínico + estilo de vida + genético) obtuvo el mejor rendimiento, con un AUC de 0,85, una mejora de 0,12 respecto a la puntuación de Framingham. Los modelos basados únicamente en datos clínicos, de estilo de vida o genéticos obtuvieron peores resultados. Los predictores clave fueron la edad, la presión arterial sistólica, la cistatina C y la circunferencia de la cintura. Combinar datos clínicos, de estilo de vida y genéticos mejora así sustancialmente la predicción del riesgo cardiovascular, aunque aún se necesita validación en poblaciones diversas.
Las enfermedades cardiovasculares (CVD) siguen siendo la principal causa de mortalidad a nivel mundial, lo que hace necesaria una identificación temprana del riesgo para mejorar las estrategias de prevención y manejo. Los modelos tradicionales de predicción del riesgo, como la Framingham Cardiovascular Risk Score y la Systematic Coronary Risk Evaluation, a menudo resultan insuficientes debido a su dependencia de métodos estadísticos clásicos y a su alcance limitado de variables.
Este estudio aprovechó técnicas de aprendizaje automático (ML) para desarrollar y validar un modelo integral de predicción del riesgo de CVD utilizando datos de la cohorte del UK Biobank. Nuestro enfoque incorporó puntuaciones genéticas, parámetros clínicos y factores de estilo de vida para crear modelos separados para la CVD general, las enfermedades cerebrovasculares, las enfermedades trombóticas y otras afecciones cardiovasculares. Utilizamos un conjunto diverso de algoritmos de ML, incluidos Ridge Regression, Logistic Regression, Support Vector Machines, Random Forest, XGBoost, Multilayer Perceptron y Stacking, con procedimientos rigurosos de validación cruzada para garantizar la robustez.
De una cohorte inicial de 502.407 personas, 240.644 participantes se incluyeron en el análisis final. El modelo integrado, que combinaba datos clínicos, de estilo de vida y genéticos, logró el mayor rendimiento predictivo con un área bajo la curva (AUC) de 0,85. Los modelos basados únicamente en datos clínicos, datos de estilo de vida y puntuaciones de riesgo poligénico mostraron un menor poder predictivo. El análisis estratificado reveló un rendimiento variable entre los subtipos de CVD, con la AUC más alta de 0,83 para otras enfermedades cardiovasculares. Los predictores clave incluyeron la edad, la presión arterial sistólica, los niveles de cistatina C y la circunferencia de la cintura.
La integración de datos clínicos, de estilo de vida y genéticos mejora sustancialmente la precisión predictiva de los modelos de ML para el riesgo de CVD. Nuestro modelo demuestra un rendimiento robusto, con una mejora de 0,12 en el AUC respecto a la Framingham Cardiovascular Risk Score, lo que destaca su utilidad potencial en entornos clínicos para la identificación temprana del riesgo y las estrategias de intervención personalizadas. La investigación futura debería centrarse en refinar el modelo incorporando predictores adicionales y validando su aplicabilidad en poblaciones diversas.