Modelo de machine learning para la predicción de diabetes mellitus tipo 2 basado en datos de exámenes de laboratorio rutinarios

Abstract
La diabetes mellitus tipo 2 (DM2) es una enfermedad crónica de alta prevalencia en Colombia, donde la tasa de subdiagnóstico supera el 30% debido a su naturaleza asintomática en etapas tempranas y a las limitaciones en el acceso a herramientas de tamizaje en el primer nivel de atención. Este proyecto desarrolla dos modelos de machine learning para el tamizaje automatizado de DM2 a partir de datos de laboratorio clínico rutinario disponibles en sistemas LIS, sin requerir variables antropométricas ni costos adicionales. El Modelo A (XGBoost + Platt Scaling), orientado al tamizaje primario universal con edad, sexo y creatinina, alcanzó AUC-ROC de 0.754 y sensibilidad de 0.845; el Modelo B (Random Forest + Platt Scaling), complementario con perfil lipídico completo, alcanzó AUC-ROC de 0.701 y VPP de 0.809. Ambos modelos fueron evaluados con rigor estadístico mediante bootstrap e interpretados mediante valores SHAP, confirmando coherencia fisiopatológica con la literatura clínica. Los resultados se integraron en DiaPredict MD, herramienta web con selección automática de modelo y recomendaciones clínicas generadas mediante un modelo de lenguaje. Las aplicaciones incluyen tamizaje automatizado en el momento de emisión de resultados de laboratorio y reducción de la brecha diagnóstica de DM2 en Colombia.
item.page.abstract.eng
item.page.descriptioneng
Citation
DOI