Our purpose is to manage, preserve, and disseminate all the intellectual, scientific, and historical production of our university community.

Recent Submissions

Item
Modelación predictiva del carbono orgánico del suelo con datos multifuente y aprendizaje automático
(Pontificia Universidad Javeriana Cali, 2026) Montoya Infante, Ricardo; Ángel Corredor, Ludwig Esteban; Pencue-Fierro, Edgar Leonairo
Esta investigación desarrolla la modelación predictiva del carbono orgánico del suelo (COS) en la Granja San José (Caldas, Colombia), mediante la integración de datos multifuente y aprendizaje automático. Dada la relevancia del COS como principal sumidero de carbono terrestre y su rol crítico en la salud edáfica, su cuantificación espacial es imperativa para la gestión agroecológica y la mitigación del cambio climático. El estudio aborda la deficiencia de cartografía de alta resolución en entornos tropicales y la dependencia metodológica de predictores redundantes como la materia orgánica (MO) y el nitrógeno (N). Se propuso como objetivo general construir un modelo robusto con n = 145 observaciones, integrando covariables topográficas, espectrales (PlanetScope/UAV) y edafoclimáticas. El proceso incluyó la caracterización estadística de cuarenta y ocho variables , la comparación de siete familias algorítmicas bajo validación cruzada espacial (GroupKFold) y la cuantificación de la incertidumbre predictiva. Los resultados determinaron que la variabilidad del COS está supeditada a factores edáficos, con aportes secundarios del relieve y la vegetación. Tras auditar cuarenta y ocho configuraciones , se seleccionó el modelo Support Vector Regression polinómica en el escenario de exclusión de MO y N , logrando un R² espacial de 0.73, un RMSE de 0.63 y un MAE de 0.44. Se generó cartografía digital a tres metros de resolución sobre 28 981 píxeles , con bandas de incertidumbre estimadas mediante intervalos bootstrap al 95%. Las aplicaciones se centran en la zonificación de precisión, la restauración ecológica, los inventarios de carbono y la transferencia de protocolos de ciencia de datos hacia el mapeo digital de suelos en sistemas de montaña.
Item
Gestión del riesgo y cobranza mediante modelos predictivos en ciencia de datos en educación superior
(Pontificia Universidad Javeriana Cali, 2026) Tovar Ríos, Paula Andrea; Grajales Castaño, Edgar Esteban; García Arboleda, Isabel Cristina
Este proyecto tiene como objetivo aplicar técnicas de Ciencia de Datos para optimizar la gestión del riesgo y la cobranza de créditos en la educación superior, abordando una problemática crítica en la Universidad Autónoma de Occidente (UAO), la necesidad de garantizar la sostenibilidad financiera y la permanencia estudiantil mediante créditos educativos más eficientes. Actualmente, los modelos tradicionales no permiten identificar con precisión los perfiles de estudiantes con mayor riesgo de incumplimiento, lo que afecta la toma de decisiones estratégicas y limita la capacidad de respuesta ante situaciones de morosidad. A través del desarrollo de modelos predictivos y análisis de datos históricos, se espera mejorar la identificación de perfiles de riesgo, reducir la morosidad y fortalecer la eficiencia en la gestión de cobranza. Además, se busca implementar herramientas de visualización que permitan a la Dirección Financiera interpretar los resultados de manera clara y tomar decisiones informadas, con potencial de replicabilidad en otras instituciones de educación superior. El proyecto se basa en datos reales y en un enfoque contextualizado, lo que garantiza su relevancia práctica y la posibilidad de generar soluciones sostenibles y ajustadas a las necesidades.
Item
Análisis de clustering y modelado de deserción de clientes bancarios
(Pontificia Universidad Javeriana Cali, 2026) Ramírez Rodríguez, Omar Javier; Silva Rodríguez, Hans; Ramírez Ramírez, Lilian Marcela; Torres Valencia, Cristian Alejandro
El proyecto aplicado “Análisis de Clustering y Modelado de Deserción de Clientes Bancarios” desarrolla un enfoque integral para el análisis del churn bancario, articulando técnicas de ingeniería de variables, segmentación de clientes y aprendizaje supervisado con el propósito de comprender, priorizar y predecir el riesgo de abandono bajo criterios de validez metodológica y aplicabilidad analítica. Inicialmente, se planteó la construcción de un Índice de Riesgo Financiero-Comportamental (IRFC) como herramienta para sintetizar múltiples dimensiones financieras y comportamentales del cliente. No obstante, durante el proceso de evaluación se identificaron métricas anormalmente altas, lo que condujo a una revisión crítica del modelo y a la detección de fuga de información asociada a la variable complain. La exclusión de esta variable permitió construir escenarios más realistas y metodológicamente más sólidos, evidenciando la importancia de cuestionar resultados aparentemente ideales en proyectos de ciencia de datos aplicada. De manera complementaria, se implementó un proceso de segmentación mediante clustering, orientado a identificar perfiles diferenciados de clientes según patrones financieros y comportamentales. Esta segmentación permitió estructurar grupos con distintas exposiciones relativas al riesgo, fortaleciendo procesos de perfilamiento, priorización y comprensión estratégica del churn. En la etapa de modelado supervisado se evaluaron múltiples escenarios comparativos, concluyendo que el IRFC no resulta adecuado como predictor directo debido a colinealidad con variables base, aunque conserva valor como herramienta de interpretación y ranking. Asimismo, la segmentación mostró capacidad para aportar valor analítico adicional en escenarios comparativos; sin embargo, su principal contribución se orienta al fortalecimiento de procesos de segmentación estratégica más que a su adopción automática como predictor final. En conjunto, los resultados demuestran que el principal valor del proyecto no radica únicamente en la obtención de métricas predictivas elevadas, sino en la construcción de un enfoque analítico metodológicamente sólido, capaz de diferenciar entre desempeño aparente, validez metodológica e interpretación estratégica. En conclusión, esta investigación evidencia que la integración de analítica avanzada permite no solo mejorar la comprensión del churn, sino también fortalecer la toma de decisiones mediante herramientas complementarias de predicción, segmentación y priorización, facilitando estrategias de retención más focalizadas y metodológicamente defendibles en contextos financieros reales.
Item
Modelo de machine learning para la predicción de diabetes mellitus tipo 2 basado en datos de exámenes de laboratorio rutinarios
(Pontificia Universidad Javeriana Cali, 2026) Macana Díaz, Natalia Alejandra; Valderrama Corredor, Iván René; Tobar Tosse, Fabián; Palencia Tellez, José Sinibaldo
La diabetes mellitus tipo 2 (DM2) es una enfermedad crónica de alta prevalencia en Colombia, donde la tasa de subdiagnóstico supera el 30% debido a su naturaleza asintomática en etapas tempranas y a las limitaciones en el acceso a herramientas de tamizaje en el primer nivel de atención. Este proyecto desarrolla dos modelos de machine learning para el tamizaje automatizado de DM2 a partir de datos de laboratorio clínico rutinario disponibles en sistemas LIS, sin requerir variables antropométricas ni costos adicionales. El Modelo A (XGBoost + Platt Scaling), orientado al tamizaje primario universal con edad, sexo y creatinina, alcanzó AUC-ROC de 0.754 y sensibilidad de 0.845; el Modelo B (Random Forest + Platt Scaling), complementario con perfil lipídico completo, alcanzó AUC-ROC de 0.701 y VPP de 0.809. Ambos modelos fueron evaluados con rigor estadístico mediante bootstrap e interpretados mediante valores SHAP, confirmando coherencia fisiopatológica con la literatura clínica. Los resultados se integraron en DiaPredict MD, herramienta web con selección automática de modelo y recomendaciones clínicas generadas mediante un modelo de lenguaje. Las aplicaciones incluyen tamizaje automatizado en el momento de emisión de resultados de laboratorio y reducción de la brecha diagnóstica de DM2 en Colombia.
Item
Modelo predictivo del riesgo de abastecimiento en la cadena de suministro basado en técnicas de machine learning
(Pontificia Universidad Javeriana Cali, 2026) García Largo, Mauro Steban; García Arboleda, Isabel Cristina
Este trabajo de grado se enfocó en la implementación de un modelo predictivo del riesgo de abastecimiento para una empresa multinacional productora de alimentos. La investigación surgió debido a la alta variabilidad de la cadena de suministro global y los riesgos asociados a la adquisición de ingredientes, especialmente bajo los enfoques de planeación como DDMRP y justo a tiempo. La relevancia del proyecto radicó en transformar la gestión del abastecimiento hacia una estrategia proactiva para aumentar la disponibilidad de materiales y garantizar la continuidad operativa. La problemática central fue la falta de herramientas analíticas que permitieran anticipar los riesgos de desabastecimiento en un contexto de incertidumbre logística y fluctuación en la demanda. Para abordar esta situación, se plantearon como objetivos: identificar las variables clave que determinan el riesgo asociado a los proveedores, desarrollar varios modelos de predicción utilizando técnicas de análisis de datos, seleccionar el modelo con el mejor desempeño y consolidar sus resultados en un tablero de control con alertas tempranas. El desarrollo se basó en datos históricos disponibles en los sistemas internos de la empresa, tales como ERP y bases de gestión de compras, que contenían información sobre entregas, cumplimiento de proveedores, tiempos de respuesta y consumo de materiales. Como resultado se desarrolló un sistema de análisis que permitió anticipar interrupciones en el suministro mediante algoritmos validados con métricas de precisión y facilidad de interpretación. Además, los resultados del modelo fueron integrados en una herramienta visual accesible para los equipos de compras y planeación, lo cual contribuyó a fortalecer la resiliencia de la cadena de suministro, minimizar impactos operacionales y tomar decisiones informadas con mayor anticipación.