Maestría en Ciencia de Datos
Permanent URI for this collection
Browse
Recent Submissions
Item Modelación predictiva del carbono orgánico del suelo con datos multifuente y aprendizaje automático(Pontificia Universidad Javeriana Cali, 2026) Montoya Infante, Ricardo; Ángel Corredor, Ludwig Esteban; Pencue-Fierro, Edgar LeonairoEsta investigación desarrolla la modelación predictiva del carbono orgánico del suelo (COS) en la Granja San José (Caldas, Colombia), mediante la integración de datos multifuente y aprendizaje automático. Dada la relevancia del COS como principal sumidero de carbono terrestre y su rol crítico en la salud edáfica, su cuantificación espacial es imperativa para la gestión agroecológica y la mitigación del cambio climático. El estudio aborda la deficiencia de cartografía de alta resolución en entornos tropicales y la dependencia metodológica de predictores redundantes como la materia orgánica (MO) y el nitrógeno (N). Se propuso como objetivo general construir un modelo robusto con n = 145 observaciones, integrando covariables topográficas, espectrales (PlanetScope/UAV) y edafoclimáticas. El proceso incluyó la caracterización estadística de cuarenta y ocho variables , la comparación de siete familias algorítmicas bajo validación cruzada espacial (GroupKFold) y la cuantificación de la incertidumbre predictiva. Los resultados determinaron que la variabilidad del COS está supeditada a factores edáficos, con aportes secundarios del relieve y la vegetación. Tras auditar cuarenta y ocho configuraciones , se seleccionó el modelo Support Vector Regression polinómica en el escenario de exclusión de MO y N , logrando un R² espacial de 0.73, un RMSE de 0.63 y un MAE de 0.44. Se generó cartografía digital a tres metros de resolución sobre 28 981 píxeles , con bandas de incertidumbre estimadas mediante intervalos bootstrap al 95%. Las aplicaciones se centran en la zonificación de precisión, la restauración ecológica, los inventarios de carbono y la transferencia de protocolos de ciencia de datos hacia el mapeo digital de suelos en sistemas de montaña.Item Gestión del riesgo y cobranza mediante modelos predictivos en ciencia de datos en educación superior(Pontificia Universidad Javeriana Cali, 2026) Tovar Ríos, Paula Andrea; Grajales Castaño, Edgar Esteban; García Arboleda, Isabel CristinaEste proyecto tiene como objetivo aplicar técnicas de Ciencia de Datos para optimizar la gestión del riesgo y la cobranza de créditos en la educación superior, abordando una problemática crítica en la Universidad Autónoma de Occidente (UAO), la necesidad de garantizar la sostenibilidad financiera y la permanencia estudiantil mediante créditos educativos más eficientes. Actualmente, los modelos tradicionales no permiten identificar con precisión los perfiles de estudiantes con mayor riesgo de incumplimiento, lo que afecta la toma de decisiones estratégicas y limita la capacidad de respuesta ante situaciones de morosidad. A través del desarrollo de modelos predictivos y análisis de datos históricos, se espera mejorar la identificación de perfiles de riesgo, reducir la morosidad y fortalecer la eficiencia en la gestión de cobranza. Además, se busca implementar herramientas de visualización que permitan a la Dirección Financiera interpretar los resultados de manera clara y tomar decisiones informadas, con potencial de replicabilidad en otras instituciones de educación superior. El proyecto se basa en datos reales y en un enfoque contextualizado, lo que garantiza su relevancia práctica y la posibilidad de generar soluciones sostenibles y ajustadas a las necesidades.Item Análisis de clustering y modelado de deserción de clientes bancarios(Pontificia Universidad Javeriana Cali, 2026) Ramírez Rodríguez, Omar Javier; Silva Rodríguez, Hans; Ramírez Ramírez, Lilian Marcela; Torres Valencia, Cristian AlejandroEl proyecto aplicado “Análisis de Clustering y Modelado de Deserción de Clientes Bancarios” desarrolla un enfoque integral para el análisis del churn bancario, articulando técnicas de ingeniería de variables, segmentación de clientes y aprendizaje supervisado con el propósito de comprender, priorizar y predecir el riesgo de abandono bajo criterios de validez metodológica y aplicabilidad analítica. Inicialmente, se planteó la construcción de un Índice de Riesgo Financiero-Comportamental (IRFC) como herramienta para sintetizar múltiples dimensiones financieras y comportamentales del cliente. No obstante, durante el proceso de evaluación se identificaron métricas anormalmente altas, lo que condujo a una revisión crítica del modelo y a la detección de fuga de información asociada a la variable complain. La exclusión de esta variable permitió construir escenarios más realistas y metodológicamente más sólidos, evidenciando la importancia de cuestionar resultados aparentemente ideales en proyectos de ciencia de datos aplicada. De manera complementaria, se implementó un proceso de segmentación mediante clustering, orientado a identificar perfiles diferenciados de clientes según patrones financieros y comportamentales. Esta segmentación permitió estructurar grupos con distintas exposiciones relativas al riesgo, fortaleciendo procesos de perfilamiento, priorización y comprensión estratégica del churn. En la etapa de modelado supervisado se evaluaron múltiples escenarios comparativos, concluyendo que el IRFC no resulta adecuado como predictor directo debido a colinealidad con variables base, aunque conserva valor como herramienta de interpretación y ranking. Asimismo, la segmentación mostró capacidad para aportar valor analítico adicional en escenarios comparativos; sin embargo, su principal contribución se orienta al fortalecimiento de procesos de segmentación estratégica más que a su adopción automática como predictor final. En conjunto, los resultados demuestran que el principal valor del proyecto no radica únicamente en la obtención de métricas predictivas elevadas, sino en la construcción de un enfoque analítico metodológicamente sólido, capaz de diferenciar entre desempeño aparente, validez metodológica e interpretación estratégica. En conclusión, esta investigación evidencia que la integración de analítica avanzada permite no solo mejorar la comprensión del churn, sino también fortalecer la toma de decisiones mediante herramientas complementarias de predicción, segmentación y priorización, facilitando estrategias de retención más focalizadas y metodológicamente defendibles en contextos financieros reales.Item Modelo de machine learning para la predicción de diabetes mellitus tipo 2 basado en datos de exámenes de laboratorio rutinarios(Pontificia Universidad Javeriana Cali, 2026) Macana Díaz, Natalia Alejandra; Valderrama Corredor, Iván René; Tobar Tosse, Fabián; Palencia Tellez, José SinibaldoLa diabetes mellitus tipo 2 (DM2) es una enfermedad crónica de alta prevalencia en Colombia, donde la tasa de subdiagnóstico supera el 30% debido a su naturaleza asintomática en etapas tempranas y a las limitaciones en el acceso a herramientas de tamizaje en el primer nivel de atención. Este proyecto desarrolla dos modelos de machine learning para el tamizaje automatizado de DM2 a partir de datos de laboratorio clínico rutinario disponibles en sistemas LIS, sin requerir variables antropométricas ni costos adicionales. El Modelo A (XGBoost + Platt Scaling), orientado al tamizaje primario universal con edad, sexo y creatinina, alcanzó AUC-ROC de 0.754 y sensibilidad de 0.845; el Modelo B (Random Forest + Platt Scaling), complementario con perfil lipídico completo, alcanzó AUC-ROC de 0.701 y VPP de 0.809. Ambos modelos fueron evaluados con rigor estadístico mediante bootstrap e interpretados mediante valores SHAP, confirmando coherencia fisiopatológica con la literatura clínica. Los resultados se integraron en DiaPredict MD, herramienta web con selección automática de modelo y recomendaciones clínicas generadas mediante un modelo de lenguaje. Las aplicaciones incluyen tamizaje automatizado en el momento de emisión de resultados de laboratorio y reducción de la brecha diagnóstica de DM2 en Colombia.Item Modelo predictivo del riesgo de abastecimiento en la cadena de suministro basado en técnicas de machine learning(Pontificia Universidad Javeriana Cali, 2026) García Largo, Mauro Steban; García Arboleda, Isabel CristinaEste trabajo de grado se enfocó en la implementación de un modelo predictivo del riesgo de abastecimiento para una empresa multinacional productora de alimentos. La investigación surgió debido a la alta variabilidad de la cadena de suministro global y los riesgos asociados a la adquisición de ingredientes, especialmente bajo los enfoques de planeación como DDMRP y justo a tiempo. La relevancia del proyecto radicó en transformar la gestión del abastecimiento hacia una estrategia proactiva para aumentar la disponibilidad de materiales y garantizar la continuidad operativa. La problemática central fue la falta de herramientas analíticas que permitieran anticipar los riesgos de desabastecimiento en un contexto de incertidumbre logística y fluctuación en la demanda. Para abordar esta situación, se plantearon como objetivos: identificar las variables clave que determinan el riesgo asociado a los proveedores, desarrollar varios modelos de predicción utilizando técnicas de análisis de datos, seleccionar el modelo con el mejor desempeño y consolidar sus resultados en un tablero de control con alertas tempranas. El desarrollo se basó en datos históricos disponibles en los sistemas internos de la empresa, tales como ERP y bases de gestión de compras, que contenían información sobre entregas, cumplimiento de proveedores, tiempos de respuesta y consumo de materiales. Como resultado se desarrolló un sistema de análisis que permitió anticipar interrupciones en el suministro mediante algoritmos validados con métricas de precisión y facilidad de interpretación. Además, los resultados del modelo fueron integrados en una herramienta visual accesible para los equipos de compras y planeación, lo cual contribuyó a fortalecer la resiliencia de la cadena de suministro, minimizar impactos operacionales y tomar decisiones informadas con mayor anticipación.Item Modelo predictivo basado en machine learning para predecir la cantidad de casos de violencia contra la mujer en la ciudad de Bogotá(Pontificia Universidad Javeriana Cali, 2026) Meneses Molina, Mallory Yulieth; Melo Balcázar, Samuel; Mosquera Valencia, Diego FernandoEl presente proyecto aplicado aborda la problemática de la violencia contra la mujer en Bogotá, enfocándose específicamente en los registros de violencia intrafamiliar y homicidios reportados por el Instituto Nacional de Medicina Legal y Ciencias Forenses (INMLCF). Este fenómeno constituye un problema social de carácter estructural y una violación sistemática de los derechos humanos, cuya persistencia vulnera la seguridad e integridad de las mujeres, lo que hace imperativo fortalecer la capacidad institucional de respuesta. La investigación tuvo como objetivo desarrollar un modelo basado en técnicas de aprendizaje automático que permitiera identificar patrones sociodemográficos, espaciales y de comportamiento, además de predecir la cantidad de casos en las diferentes localidades de la ciudad. Para su ejecución se implementó la metodología CRISP-DM, la cual permitió estructurar el proceso iniciando con la fase de comprensión del negocio, garantizando que el desarrollo técnico estuviera alineado con los objetivos estratégicos y las necesidades reales del entorno. Como principales resultados, se identificaron perfiles de victimización representativos y territorios con mayor incidencia, logrando modelos de segmentación y predicción capaces de anticipar tendencias futuras del fenómeno con alta consistencia técnica. Estos hallazgos demuestran la importancia de transitar de una gestión de datos puramente descriptiva hacia una capacidad de anticipación territorial fundamentada en la ciencia de datos. Las aplicaciones del proyecto se orientan al fortalecimiento de los sistemas de monitoreo, la priorización estratégica de recursos y la formulación de políticas públicas que mejoren la prevención activa de la violencia de género. Finalmente, se concluye que la integración de modelos analíticos avanzados y herramientas de visualización permite transformar los registros históricos en activos de información crítica para la toma de decisiones, facilitando intervenciones estatales más oportunas, precisas y eficaces para salvaguardar la vida e integridad de las mujeres en Bogotá.Item Identificación automática de imágenes de ecografías craneales con su respectivo plano anatómico(Pontificia Universidad Javeriana Cali, 2026) Villarreal Huertas, Luis Armando; Acevedo Virgues, Laura Daniela; Torres Valencia, Cristian AlejandroEste proyecto se basa en el análisis de ecografías craneales fetales que son una herramienta que apoya el diagnóstico de enfermedades y anomalías durante el embarazo, pero que se ve perjudicada por la subjetividad de la interpretación del especialista. Esta clara problemática se ve reflejada por los parámetros intrínsecos de los equipos médicos donde la medición va a variar, ya que, en la modalidad de ultrasonido, es primordial hacer mediciones en el equipo para así dar un buen diagnóstico; los parámetros del equipo pueden alterar el transductor, pieza clave para la toma del estudio, sobre todo en el seguimiento del feto que está en constante desarrollo. Con un modelo de aprendizaje profundo y un conjunto de datos correctamente etiquetados, se generó un prototipo que identifique el plano anatómico de imágenes de ecografías craneales fetales, el cual se implementó en cuatro fases. En la primera fase se hizo una revisión sistemática de la información para determinar el modelo a usar y el conjunto de datos. En la segunda fase se buscó mejorar la calidad de la imagen al usar técnicas de preprocesamiento; esto permitió que a la hora de usar el método de aprendizaje profundo mejore el modelo para la detección de los planos anatómicos. En la tercera fase se aplicó el modelo de aprendizaje profundo y, por último, en la cuarta se implementó un análisis que busca evaluar la precisión del prototipo. Estas fases van de la mano con el planteamiento de los cuatro objetivos, que buscan cumplir con una estructura en el proyecto. Finalmente, se obtuvo un prototipo de aprendizaje de conjunto capaz de clasificar las imágenes fetales craneales a través de tres modelos con exactitudes mayores al 90%. Las posibles aplicaciones van dirigidas a reducir la subjetividad y variabilidad de los diagnósticos, facilitando una interpretación más precisa.Item Detección automática de bioindicadores de deterioro en imágenes de arte rupestre de la Serranía de La Lindosa mediante técnicas de aprendizaje automático(Pontificia Universidad Javeriana Cali, 2026) Echeverry Henao, Luis Alberto; Rengifo Segura, Jhon Sebastián; Forero Vargas, Manuel GuillermoEl arte rupestre de la Serranía de La Lindosa constituye uno de los patrimonios arqueológicos más importantes de Colombia y América Latina, debido a la antigüedad y riqueza de sus representaciones pictográficas. Sin embargo, estos paneles se encuentran expuestos a diversos factores de deterioro biológico, ambiental y antrópico que afectan progresivamente su estado de conservación. Actualmente, los procesos de monitoreo dependen principalmente de inspecciones visuales realizadas por especialistas, lo que implica procedimientos manuales, subjetivos y de difícil escalabilidad. En este contexto, la presente investigación propone un modelo basado en técnicas de visión por computador y aprendizaje profundo para apoyar la detección automática de bioindicadores de deterioro en imágenes digitales de alta resolución suministradas por el Instituto Colombiano de Antropología e Historia (ICANH). La metodología desarrollada comprendió la selección de los tipos de deterioro a analizar, la construcción manual de máscaras binarias, la generación de un conjunto de datos basado en patches, la implementación de una estrategia de validación Leave-One-Image-Out (LOIO) y el entrenamiento de modelos de segmentación semántica utilizando las arquitecturas U-Net y ResUNet. Los experimentos fueron realizados sobre las categorías de deterioro plantas superiores, galerías, nidos y nidos de avispas, permitiendo evaluar el comportamiento de los modelos mediante métricas de segmentación como Dice, IoU, precisión, recall y HD95. Los resultados obtenidos evidenciaron un desempeño favorable para la detección de deterioros con patrones visuales bien definidos, así como la influencia significativa de factores como el desbalance entre clases y el tamaño de los patches sobre la capacidad de segmentación de los modelos. Estos hallazgos permitieron establecer estrategias de balanceo del conjunto de datos y ajustar los parámetros de entrenamiento para mejorar el desempeño experimental. La investigación demuestra el potencial de las técnicas de aprendizaje profundo como herramienta de apoyo para el monitoreo no invasivo del patrimonio arqueológico y establece una base metodológica que podrá ser utilizada y extendida en futuros estudios orientados a la conservación digital del arte rupestre y otros bienes culturales.Item Predicción de la finura del cemento utilizando parámetros operacionales: un enfoque basado en Machine Learning(Pontificia Universidad Javeriana Cali, 2026) Valencia Romero, Laura; Gil González, JuliánEste proyecto desarrolla un modelo de aprendizaje automático para predecir la finura del cemento, específicamente el porcentaje de retenido en malla 325, a partir de variables operacionales de un molino vertical. La motivación surge ante la necesidad crítica de superar las limitaciones de los métodos tradicionales de control de calidad que generan demoras y afectan tanto la eficiencia energética como la estabilidad del proceso. Para ello, se evaluaron cinco enfoques supervisados, encontrando que los modelos no lineales superaron de manera consistente al modelo lineal. Aunque el proceso gaussiano obtuvo el mejor desempeño predictivo, XGBoost fue seleccionado como modelo final por ofrecer el mejor equilibrio entre precisión, interpretabilidad y costo computacional, con un R2 cercano a 0.60 y un RMSE aproximado de 0.46% en el conjunto de prueba. Además, el análisis del modelo permitió identificar la relevancia de variables asociadas a la composición de la alimentación, la carga interna del molino y la velocidad del separador sobre la finura del producto final.Item Modelo predictivo del desempeño académico en el Distrito de Barranquilla mediante técnicas de ciencia de datos(Pontificia Universidad Javeriana Cali, 2026) Acosta Quintero, Laura Melisa; Ortega Lenis, DeliaEl presente proyecto aplicado desarrolló un modelo predictivo del desempeño académico de los estudiantes del Distrito de Barranquilla en el Examen Saber 11°, a partir de los microdatos públicos del repositorio DataICFES correspondientes al período 2014-2 a 2024-2. Tras un proceso de consolidación, diagnóstico, limpieza e ingeniería de variables sobre 183.984 registros, se seleccionaron 17 predictores socioeducativos mediante criterios estadísticos (ANOVA, η²) y algorítmicos (Información Mutua y Random Forest Feature Importance). El análisis no supervisado mediante FAMD y K-Means segmentó la población en dos perfiles a lo largo de un gradiente socioeducativo dominante: uno aventajado (≈31%) y otro vulnerable (≈69%), con una brecha de 48 puntos en el puntaje promedio. Para el modelado supervisado se entrenaron y compararon cinco algoritmos: regresión lineal, Ridge, Lasso, Random Forest y XGBoost sobre la variable continua Puntaje Global. XGBoost optimizado mediante RandomizedSearchCV con TimeSeriesSplit resultó el modelo de mejor desempeño, con un error medio de 35 puntos en una escala de 0 a 500 y una varianza explicada cercana al 38% (R²) sobre una cohorte futura no observada. El análisis de interpretabilidad mediante valores SHAP identificó el nivel socioeconómico del establecimiento, los hábitos de lectura diaria y la edad de presentación como las variables dominantes, seguidas por la educación de los padres, evidenciando que el contexto institucional y el capital cultural familiar presentan mayor contribución predictiva que la riqueza material directa. Estos hallazgos delimitan las condiciones de uso del modelo como herramienta de apoyo a la política pública educativa del Distrito y confirman la viabilidad de construir, con datos públicos y técnicas estándar, un instrumento predictivo interpretable y contextualizado.Item Desarrollo de un modelo predictivo para la estimación del costo de seguros médicos mediante análisis de historial de siniestralidad y segmentación de carteras de usuarios(Pontificia Universidad Javeriana Cali, 2026) Guzmán Sandoval, Laura Catalina; Victoria González, Xammy Alexander; Torres Valencia, Cristian AlejandroEl presente proyecto aplicado aborda la problemática de la estimación del costo de los seguros médicos en el sector asegurador colombiano, considerando las limitaciones actuales en los procesos de tarificación y evaluación del riesgo. El desarrollo del proyecto tuvo como objetivo desarrollar un modelo predictivo basado en técnicas de aprendizaje automático que permitiera apoyar de manera técnica y objetiva la estimación de costos asociados a los asegurados, integrando variables demográficas, clínicas, comportamentales y de uso de servicios médicos. Para ello, se realizó la estructuración y depuración de una base de datos amplia y heterogénea, la cual requirió procesos exhaustivos de limpieza, imputación, estandarización y transformación para garantizar su calidad y consistencia. A partir de este insumo, se realizó un análisis exploratorio detallado que permitió identificar relaciones relevantes, anomalías y variables clave para la construcción del modelo. Posteriormente, se implementaron algoritmos supervisados y no supervisados como Regresión Lineal, Random Forest, XGBoost y técnicas de segmentación de usuarios, con el fin de identificar patrones de siniestralidad y mejorar la precisión en la predicción de costos. Los modelos fueron evaluados mediante métricas cuantitativas como MAE, RMSE y R², permitiendo seleccionar la arquitectura con mejor desempeño predictivo. Como resultado, se obtuvo una herramienta analítica orientada a fortalecer los procesos de tarificación y gestión del riesgo, además de un prototipo interactivo de visualización que facilita la interpretación de resultados y la toma de decisiones estratégicas en el sector asegurador. El proyecto aporta una aplicación práctica de la ciencia de datos y el aprendizaje automático en seguros de salud, contribuyendo al fortalecimiento técnico y financiero de las aseguradoras dentro del contexto colombiano.Item Predicción del riesgo de depresión en estudiantes universitarios mediante métodos de aprendizaje automático(Pontificia Universidad Javeriana Cali, 2026) Mendoza Sarmiento, Kassandra; Sánchez Serna, Ángel David; Cuchumbé Mera, Juan Sebastián; Ávila Toscano, José HernandoEl presente proyecto aplicado estimó el riesgo de depresión en estudiantes universitarios a partir de variables sociodemográficas, emocionales y académicas, utilizando modelos de aprendizaje automático. La depresión afecta significativamente a la población universitaria e impacta en su rendimiento académico y en la deserción de las instituciones universitarias. Las universidades presentan programas de bienestar con un enfoque más reactivo que preventivo y no cuentan con herramientas que generen alertas tempranas que permitan anticiparse al riesgo. Con este proyecto se desarrolló un modelo predictivo entrenado y validado sobre datos provenientes de encuestas anónimas disponibles públicamente, con el fin de sentar una base metodológica que pueda ser adaptada por instituciones universitarias en contextos reales. El proyecto contempló tres objetivos específicos: analizar la capacidad de la regresión logística para modelar relaciones lineales entre variables relevantes; evaluar el desempeño del modelo Random Forest en la detección de patrones no lineales y la importancia de los predictores y comparar ambos modelos según métricas de rendimiento como la precisión, sensibilidad y especificidad. Para ello, se utilizó la base de datos pública “Student Depression Dataset”, disponible en la plataforma Kaggle. Como resultados, se construyeron y validaron dos modelos predictivos y se generaron visualizaciones comparativas de desempeño. El proyecto representa una contribución aplicada desde la ciencia de datos al campo de la salud mental en contextos educativos.Item Clasificación de espectrogramas de audio con técnicas de aprendizaje profundo para el reconocimiento de sonidos urbanos(Pontificia Universidad Javeriana Cali, 2026) Domínguez Benítez, Juan Camilo; Jaramillo Giraldo, María Paula; Arroyo Marín, Andrés; Arango Londoño, DavidEl presente proyecto aplicado abordó la clasificación automática de sonidos urbanos mediante técnicas de aprendizaje profundo, utilizando espectrogramas Mel como representación visual de señales acústicas en la ciudad de Popayán, Cauca. Esta iniciativa nace con el propósito de fortalecer el monitoreo inteligente del paisaje sonoro urbano, considerando que la contaminación acústica es una problemática creciente con efectos sobre la salud física y mental, la calidad de vida y sostenimiento ambiental. Hoy en día, la clasificación manual de sonidos representa un proceso muy operativo, subjetivo y poco escalable debido a la mezcla o superposición constante de sonidos urbanos y a la ausencia de herramientas automatizadas para el reconocimiento de los tipos de sonidos. En este contexto, el objetivo principal consistió en diseñar un modelo basado en redes neuronales convolucionales capaz de clasificar sonidos urbanos según su origen: biofofía (sonido animales), geofonía (sonidos lluvias o viento), antropofonía (transporte motorizado, voces/ música). Para esto se trabajó con un conjunto de datos de 7.138 fragmentos de audio obtenidos a partir de 250 grabaciones recolectadas en 50 puntos del centro histórico de Popayán. Luego, las señales de audio fueron transformadas en espectrogramas de Mel, convirtiendo el sonido en imágenes para el reconocimiento visual mediante arquitecturas convolucionales de aprendizaje profundo. Se evaluaron diferentes arquitecturas mediante la búsqueda aleatoria de hiperparámetros, se incluyeron estrategias de transferencia de aprendizaje, aumento de datos y manejo de desbalance de clases. Como resultado, la arquitectura EfficientNetB0 presentó mejores resultados y desempeño, alcanzando un F1 macro de 0,51, un accuracy del 60,9% y un Balanced Accuracy de 0,59 sobre el conjunto de prueba. Con estos resultados, se evidencia la capacidad de un modelo para identificar patrones acústicos complejos en entornos urbanos y demuestran elo potencial de la inteligencia artificial al análisis de sonidos, con aplicaciones en monitoreo ambiental, control de contaminación acústica y apoyo a políticas públicas en las zonas.Item Modelo de predicción de deserción en estudiantes de una institución de educación superior(Pontificia Universidad Javeriana Cali, 2026) Figueroa Arias, José Julián; Porras Ríos, Yudy Alexandra; Torres Valencia, Cristian AlejandroLa deserción estudiantil constituye una de las principales problemáticas que enfrentan las instituciones de educación superior. En Colombia, aproximadamente el 36% de los estudiantes abandona sus estudios durante el primer año, lo que resalta la importancia de abordar este fenómeno mediante herramientas analíticas. En este contexto, el presente trabajo tuvo como objetivo desarrollar un modelo de predicción de deserción estudiantil utilizando técnicas de aprendizaje automático supervisado, a partir del conjunto de datos público "Predict Students' Dropout and Academic Success" del UCI Machine Learning Repository, correspondiente a una institución de educación superior portuguesa con 4.424 registros. La metodología se estructuró bajo el estándar CRISP DM, abarcando las fases de comprensión y preparación de los datos, modelado y evaluación. Se entrenaron y compararon cinco algoritmos: regresión logística, árbol de decisión, Random Forest, XGBoost y redes neuronales artificiales, bajo un esquema de validación cruzada estratificada repetida. Los resultados evidenciaron que XGBoost presentó el mejor desempeño global en la identificación del riesgo, alcanzando un Recall de 0.9085, un ROC-AUC de 0.9728 y un F1-score de 0.8990 en el conjunto de prueba. Adicionalmente, el modelo seleccionado fue integrado en un prototipo funcional desarrollado con Streamlit y desplegado en la nube, que permite a los equipos institucionales visualizar las predicciones de riesgo de forma interactiva y tomar decisiones de intervención basadas en datos.Item Extracción inteligente de metadatos del Anexo No. 2 en reclamación de garantías: automatización con ciencia de datos aplicada al FNG(Pontificia Universidad Javeriana Cali, 2026) Duque Carreño, Johan Camilo; Peñuela Cárdenas, Sergio; Mora Cardona, Mario JuliánEl presente trabajo desarrolla un prototipo de extracción inteligente de metadatos del Anexo No. 2 del Fondo Nacional de Garantías (FNG), formulario estandarizado utilizado en procesos de reclamación de garantías en Colombia. La solución implementa un pipeline híbrido compuesto por un componente basado en reglas para PDFs digitales y un modelo TrOCR con fine-tuning para formularios manuscritos. Dado que la Ley 1581 de 2012 (Habeas Data) prohíbe el envío de datos personales sensibles a servidores externos, se construyó un corpus sintético de 551 documentos para entrenamiento y evaluación, garantizando cero exposición de datos reales. El pipeline digital alcanzó una cobertura global del 80.3%, con precisión del 100% en campos críticos como NIT, cédulas y teléfono. El modelo TrOCR con fine-tuning obtuvo un CER de 0.1176 (equivalente al 88.2% de precisión), representando una mejora relativa del 61% sobre la línea base de Tesseract OCR. Ambos componentes se integran en un flujo unificado con salida estructurada en CSV para los 13 campos de identificación y contacto del formulario.Item Minería de datos educativos para identificar factores que afectan el rendimiento académico en Colombia(Pontificia Universidad Javeriana Cali, 2026) García Fernández, Joan Sebastián; Beltrán García, Diana Milena; Torres Valencia, Cristian AlejandroEste proyecto aplicado identificó y analizó los factores que incidieron significativamente en el rendimiento académico de los estudiantes en Colombia, utilizando técnicas de minería de datos educativos (EDM) y modelos de aprendizaje automático. La investigación partió del reconocimiento de que, a pesar de la disponibilidad de datos generados en instituciones educativas, estos no se aprovechaban adecuadamente para fundamentar decisiones pedagógicas y políticas educativas. La problemática abordada se centró en la alta heterogeneidad del rendimiento académico de los estudiantes, evidenciada en brechas de aprendizaje y oportunidades entre sectores rurales y urbanos, así como entre instituciones oficiales y no oficiales. Para dar respuesta a esta problemática, se recopilaron y depuraron datos académicos provenientes de fuentes abiertas del ICFES. Posteriormente, se identificaron variables significativas mediante técnicas de minería de datos y se construyeron modelos predictivos orientados a estimar el rendimiento académico. El proyecto también realizó un análisis comparativo entre contextos geográficos, evidenciando brechas educativas y permitiendo formular recomendaciones basadas en evidencia. Entre los resultados más relevantes se destacaron la identificación de factores socioeconómicos e institucionales asociados al rendimiento académico, la validación del modelo XGBoost como el algoritmo con mejor desempeño predictivo y estabilidad, así como la identificación de diferencias significativas entre contextos rurales y urbanos. Estos resultados pueden servir como insumo para la toma de decisiones pedagógicas y administrativas en instituciones educativas, así como para la formulación de políticas orientadas a la equidad educativa en Colombia.Item Clasificación de reportes de daños realizados por los canales digitales de Celsia mediante agentes virtuales(Pontificia Universidad Javeriana Cali, 2026) Sandoval Posso, Jesús David; Hernández Porras, María Fernanda; González Vélez, Juan CarlosEn Celsia Colombia S.A. E.S.P., la clasificación manual e inadecuada de reportes de incidentes recibidos por canales digitales, como el sistema LuzIA, genera un alto número de visitas técnicas fallidas, lo que incrementa los tiempos de respuesta, reduce la eficiencia operativa y afecta la experiencia del cliente. Sobre una muestra de 88.959 registros de incidentes cancelados históricos del período comprendido entre 2023–2025, el análisis exploratorio identificó 5.111 visitas fallidas, equivalentes al 5,75% de los casos cancelados, concentradas en reportes mal clasificados o canalizados incorrectamente. La deficiencia en los filtros y criterios de priorización homogeniza la atención de incidentes, causando demoras en casos críticos, aumentando los indicadores SAIDI y SAIFI, y exponiendo a la empresa a sanciones regulatorias. Este proyecto, desarrollado en el marco de la Maestría en Ciencia de Datos de la Pontificia Universidad Javeriana Cali, propone un sistema de agentes virtuales basado en frameworks como LangChain, LangGraph y CrewAI para detectar, validar y clasificar automáticamente reportes, diferenciando entre daños en infraestructura y pérdida de servicio. La solución busca optimizar la asignación de recursos, reducir visitas fallidas y mejorar la experiencia del cliente en Valle del Cauca y Tolima, demostrando su viabilidad mediante un prototipo funcional que promueve la agilidad, confiabilidad e innovación en la gestión de incidentes eléctricos.Item Análisis predictivo del impacto del cambio climático y el conflicto armado en el comportamiento de la cartera de créditos agropecuarios para la Regional Occidente(Pontificia Universidad Javeriana Cali, 2026) Castillo Perea, Flavio Alejandro; Valencia Cárdenas, Johan Sebastián; García Arboleda, Isabel CristinaEl presente proyecto desarrolló un modelo de análisis predictivo para evaluar el impacto del cambio climático y el conflicto armado en el comportamiento de la cartera agropecuaria de la banca pública colombiana, con énfasis en la región occidental del país (Valle del Cauca, Cauca y Nariño). Esta zona se caracteriza por una alta dependencia de las actividades agropecuarias, las cuales se han visto severamente afectadas tanto por fenómenos climáticos extremos como sequías, lluvias intensas y alteraciones en los ciclos productivos como por la persistencia del conflicto armado y las economías ilegales, que generan desplazamiento forzado, inseguridad y limitaciones en el acceso a mercados. A partir del análisis de 55.454 obligaciones de crédito, se integraron variables crediticias internas con factores externos climáticos (ola invernal, sequía, factores naturales) y de conflicto armado (hechos victimizantes, desplazamiento forzado), aplicando la metodología CRISP-DM. Se estimaron ocho modelos predictivos (Regresión Logística Binomial, Árbol de Decisión y XGBoost, con y sin ponderación de clases, más un Logit Ordinal para severidad de mora). El XGBoost ponderado se posicionó como el modelo de mayor capacidad discriminatoria (AUC ROC = 0.7921, Kappa = 0.3253), superando en aproximadamente 14 puntos porcentuales al mejor modelo lineal. Los principales hallazgos evidenciaron que la Ola Invernal eleva el riesgo de mora un 61% respecto a factores económicos, el desplazamiento forzado lo incrementa un 42%, y las obligaciones en Valle del Cauca presentan una probabilidad de mora un 34% superior a las del Cauca. El modelo se traduce en una arquitectura de alertas tempranas y segmentación territorial del riesgo, materializada en un dashboard interactivo en Power BI y un reporte analítico, como herramientas de apoyo a la gestión proactiva de la cartera agropecuaria en la Regional Occidente.Item Modelo analítico para la predicción de garantías posventa en proyectos residenciales: aplicación en una empresa constructora colombiana(Pontificia Universidad Javeriana Cali, 2026) Castillo Narváez, Diana Camila; Contreras Macías, Maicol Stiven; Arango Londoño, DavidEste proyecto aplicado tuvo como objetivo desarrollar un modelo predictivo basado en técnicas de aprendizaje automático para estimar el comportamiento de las reclamaciones por garantías posventa en proyectos de vivienda entregados por una constructora en la ciudad de Cali. A partir del análisis de bases de datos históricas del sistema CRM, información de entregas de inmuebles, características técnicas de los proyectos, tipo de acabado y variables contextuales exploratorias, se buscó estimar la cantidad esperada, la categoría técnica y el momento de ocurrencia de las reclamaciones. El trabajo incluyó tareas de limpieza, integración y transformación de datos, homologación de proyectos y categorías de daño, construcción de la exposición mensual de inmuebles, ingeniería de características, selección de variables relevantes y evaluación de modelos supervisados de regresión. El modelo seleccionado fue XGBoost con variables de historial reciente, debido a que presentó el mejor equilibrio general entre las métricas evaluadas, incluyendo MAE, RMSE, R², MAPE sobre observaciones positivas y comparación entre totales reales y predichos. Como resultado, el modelo permitió generar predicciones futuras para apoyar la planeación operativa del área de posventa; para 2026 se estimó una carga aproximada de 4.247 locativas, con análisis por mes, proyecto y padre/capítulo técnico. En un sector como el de la construcción, con una gestión posventa tradicionalmente reactiva y con oportunidades de fortalecimiento en el uso analítico de los datos, esta propuesta representa una aplicación práctica de ciencia de datos para anticipar cargas de atención, priorizar recursos, identificar categorías críticas y apoyar la toma de decisiones basada en evidencia. El proyecto contribuye al fortalecimiento de la gestión proactiva de garantías y a la transformación digital del proceso posventa, dejando como producto un modelo predictivo reproducible y resultados estructurados para su consulta mediante una herramienta de visualización.Item Desarrollo de modelo predictivo basado en aprendizaje automático para estimar factores de emisión en las iniciativas de mitigación de cambio climático en Colombia(Pontificia Universidad Javeriana Cali, 2026) Acosta Méndez, Daniel Felipe; Gil González, JuliánEste proyecto creó un modelo predictivo que usa el aprendizaje automático para determinar el factor de emisión de gases de efecto invernadero (FACTOR_EMISION, tCO₂e) registrado en el sistema RENARE del Ministerio colombiano de Ambiente y Desarrollo Sostenible por las acciones de mitigación. Se creó un pipeline modular que une la justificación IPCC (42 variables) con la ingeniería de características, la división por sectores (FORESTAL, ENERGÍA, OTROS), el análisis de interpretabilidad SHAP y la optimización bayesiana mediante Optuna (150 pruebas). Los modelos seleccionados por segmento (CatBoost, LightGBM, RandomForest y XGBoost) alcanzaron un R² de entre 0,843 y 0,873 en el conjunto de prueba; para ello, se empleó la validación cruzada 5-fold y el bootstrap con un total de 500 muestras. El análisis SHAP mostró que existe concordancia entre las variables más influyentes y la información climática del IPCC. Se encontraron 37 registros anómalos (0,74 % del conjunto de datos), lo que evidencia que el modelo puede ser una herramienta para la auditoría del sistema MRV en Colombia.