Maestría en Ciencia de Datos

Browse

Recent Submissions

Now showing 1 - 20 of 211
  • Item
    Desarrollo de un modelo de análisis de carga no intrusiva para eficiencia energética basado en técnicas de machine learning
    (Pontificia Universidad Javeriana Cali, 2026) Jaimes Otero, Julián Javier; Munévar Díaz, José Luis; Moreno Guzmán, Meidy Lizeth; Arango Londoño, David
    Esta investigación desarrolló un sistema de monitoreo de carga no intrusivo (Non-Intrusive Load Monitoring, NILM) basado en técnicas de inteligencia artificial (IA), orientado a mejorar la eficiencia energética en entornos comerciales. La creciente demanda energética, sumada al aumento de dispositivos eléctricos conectados a la red, ha generado un consumo poco eficiente debido, en gran parte, a la falta de información detallada sobre el comportamiento energético de los equipos eléctricos. Los sistemas tradicionales de medición únicamente reportan el consumo total, sin permitir identificar qué equipos consumen más energía, en qué momentos y bajo qué condiciones, lo que dificulta la implementación de estrategias de ahorro y sostenibilidad. Como alternativa a los sistemas de monitoreo intrusivo, que requieren la instalación de sensores en cada dispositivo y presentan altos costos de implementación y mantenimiento, se desarrolló un modelo NILM capaz de desagregar el consumo energético a partir de una única medición realizada en el punto de entrada de la instalación eléctrica. Para ello, se realizó el procesamiento y análisis exploratorio de un conjunto de datos de consumo energético, se evaluaron cinco modelos de aprendizaje automático (Regresión Lineal, SVM, Random Forest, XGBoost y RNN LSTM), optimizados mediante técnicas de búsqueda de hiperparámetros, y se implementó un mecanismo de reconciliación proporcional para garantizar la coherencia entre las predicciones desagregadas y el consumo total observado. Los resultados evidenciaron que los modelos basados en métodos de ensamble, especialmente Random Forest, alcanzaron los mejores niveles de desempeño, obteniendo coeficientes de determinación (R²) superiores al 90 % en cuatro de las seis categorías de carga evaluadas (Lighting, Heating, Sockets Plug y Cooling). Asimismo, el mecanismo de reconciliación permitió corregir inconsistencias entre las predicciones individuales y el consumo agregado, garantizando la conservación de la energía durante el proceso de desagregación. En conjunto, los resultados demuestran la viabilidad del uso de técnicas de Machine Learning para la desagregación no intrusiva del consumo energético en edificios comerciales y proporcionan una metodología reproducible que puede apoyar la implementación de sistemas inteligentes de gestión energética, facilitar la toma de decisiones orientadas al ahorro de energía y contribuir al desarrollo de estrategias de sostenibilidad en organizaciones. Palabras clave: Monitoreo de carga no intrusivo (NILM), Desagregación energética, Aprendizaje automático, Bosques aleatorios (Random Forest), Series temporales, Redes neuronales recurrentes (RNN), Reconciliación de pronósticos.
  • Item
    Modelo predictivo del potencial de rendimiento del cultivo de maíz a través de técnicas de aprendizaje estadístico y automático
    (Pontificia Universidad Javeriana Cali, 2026) Rojas Prado, Laura; Gutiérrez Orjuela, Juan Sebastián; Ortiz Flórez, Sebastián Alejandro; Arango Londoño, David
    La producción de maíz en Colombia es un componente estratégico para la seguridad alimentaria y la economía agropecuaria nacional; sin embargo, su desempeño presenta elevada variabilidad espacio - temporal asociada a factores agroclimáticos, tecnológicos y estructurales que dificultan la planificación territorial y la gestión del riesgo agrícola. En este contexto, el proyecto propone un marco predictivo para estimar el rendimiento potencial del cultivo de maíz a escala municipal, integrando información agroproductiva y climática histórica de fuentes oficiales de acceso abierto: de la Unidad de Planificación Rural Agropecuaria (UPRA) y el Instituto de Hidrología, Meteorología y Estudios Ambientales (IDEAM). El rendimiento potencial se operacionaliza mediante el cuantil τ = 0,95 del rendimiento observado, criterio sustentado en la teoría de fronteras de producción y eficiencia técnica, pues representa un umbral productivo empíricamente alcanzable bajo condiciones eficientes y con menor sensibilidad a valores atípicos. A partir del marco predictivo propuesto, el estudio estimará la frontera productiva municipal y cuantificará las brechas de rendimiento como la diferencia entre el rendimiento observado y dicha frontera, lo que permitirá aproximar escenarios de pérdidas de productividad e ingresos asociados a limitaciones técnicas, climáticas o de manejo agronómico. Se espera que los resultados constituyan una herramienta analítica reproducible y escalable, útil para productores, entidades gubernamentales, programas de extensión rural, aseguradoras y actores financieros del sector, en la focalización de asistencia técnica, la priorización de inversiones y la formulación de estrategias de adaptación agroclimática y planificación agrícola basada en evidencia cuantitativa en Colombia.
  • Item
    Modelo de aprendizaje automático para segmentación de clientes actuales y prospección de nuevos clientes potenciales en una empresa de servicios de tecnología
    (Pontificia Universidad Javeriana Cali, 2026) Mendoza Valero, Karen Sofía; Torres Valencia, Cristian Alejandro
    Este proyecto aplicado desarrolló un sistema analítico de segmentación y prospección comercial para la filial en Colombia de una empresa multinacional del sector tecnológico, con el propósito de transformar la información disponible en su CRM Salesforce en conocimiento accionable para el equipo comercial. La problemática que motivó la iniciativa fue la ausencia de mecanismos sistemáticos para clasificar y priorizar a los clientes actuales y potenciales, lo que limitaba la personalización de las estrategias comerciales y reducía la efectividad del pipeline de ventas, dado que la generación de prospectos se realizaba de forma reactiva y sin criterios predictivos basados en datos históricos. El objetivo general consistió en aplicar técnicas de aprendizaje automático para caracterizar los 167 clientes activos del CRM correspondientes al período 2018–2025, identificar patrones de comportamiento y construir perfiles estratégicos mediante algoritmos de agrupamiento (K-Means), así como en entrenar modelos supervisados (Random Forest, XGBoost y Regresión Logística) y de similitud coseno para evaluar 572 registros de prospectos externos generados mediante Gemini Deep Research, priorizando aquellos con mayor afinidad a los clientes de alto valor. Los resultados obtenidos confirmaron que cada Unidad de Negocio posee una estructura de segmentación propia, con calidad geométrica heterogénea: Cloud Pública y Cyber Security presentaron grupos compactos y bien diferenciados (Silhouette escalado > 0.94), mientras que SAP y Digital Business requirieron mayor tolerancia a la heterogeneidad interna. El modelo de cross selling alcanzó AUCs sólidos en Digital Workplace (0.970), Cyber Security (0.926) y Digital Business (0.893), con desempeños más modestos en SAP (0.625) y Private Cloud (0.750), patrón que reflejó tanto el tamaño muestral como la naturaleza del consumo de cada línea. El score híbrido —que combinó similitud coseno con el mejor clasificador supervisado en proporción 50/50— produjo rankings priorizados de los 572 prospectos externos por cada BU y un ranking agregado global. Como aplicaciones, los rankings se incorporaron como herramienta operativa para los equipos de preventa y cuentas, permitieron identificar oportunidades de cross-selling sobre la base instalada y sentaron las bases para una cultura de gestión basada en datos. La solución resultó replicable y escalable a otros mercados de otras filiales en Latinoamérica, con extensiones potenciales en campañas de marketing dirigido, análisis de mercado y diseño de portafolios de servicios personalizados.
  • Item
    Modelos predictivos para el pronóstico de primas emitidas y siniestros incurridos en el ramo de responsabilidad civil profesional de Seguros del Estado S.A.
    (Pontificia Universidad Javeriana Cali, 2026) Coronado Gil, Julián Esteban; Salas Valencia, Cindy Lorena; Girón Cruz, Luis Eduardo
    Este proyecto se enfoca en el desarrollo de modelos predictivos basados en modelos econométricos de series de tiempo y técnicas de machine learning para estimar el importe de las primas y el valor de los siniestros incurridos en el ramo de Responsabilidad Civil profesional de Seguros del Estado S.A., incorporando variables espaciales y temporales. La dinámica del sector asegurador colombiano entre 2016 y 2024, junto con eventos inesperados como la pandemia de COVID-19, evidencia la necesidad de herramientas analíticas más precisas para la toma de decisiones. Inicialmente, se realiza la extracción y transformación de la base de datos transaccional, seguida de un análisis exploratorio que garantiza la calidad, consistencia e integridad de la información, así como la identificación de patrones y anomalías relevantes. Posteriormente, se ajustan los modelos SARIMAX, XGBoost y LightGBM para el importe de las primas, evaluando su desempeño mediante las métricas SMAPE, RMSE y MAE bajo validación Walk-Forward, donde SARIMAX presenta el mejor desempeño con error moderado. Para los siniestros incurridos se implementa el modelo ARIMA debido a la no presencia de estacionalidad en la serie, complementado con XGBoost y LightGBM bajo la misma estrategia de validación, destacándose LightGBM por su capacidad para capturar relaciones no lineales. Finalmente, se desarrolla una aplicación en Streamlit que integra proyecciones históricas, forecast, presupuesto ajustado por IPC y escenarios de sensibilidad, facilitando el análisis estratégico y la toma de decisiones. En conjunto, el sistema propuesto optimiza la gestión del riesgo, la asignación de recursos y la planificación, mejorando el desempeño financiero y comercial, incrementando la suficiencia actuarial y aportando al fortalecimiento del sector asegurador colombiano mediante el uso de inteligencia artificial.
  • Item
    Modelación predictiva del carbono orgánico del suelo con datos multifuente y aprendizaje automático
    (Pontificia Universidad Javeriana Cali, 2026) Montoya Infante, Ricardo; Ángel Corredor, Ludwig Esteban; Pencue-Fierro, Edgar Leonairo
    Esta investigación desarrolla la modelación predictiva del carbono orgánico del suelo (COS) en la Granja San José (Caldas, Colombia), mediante la integración de datos multifuente y aprendizaje automático. Dada la relevancia del COS como principal sumidero de carbono terrestre y su rol crítico en la salud edáfica, su cuantificación espacial es imperativa para la gestión agroecológica y la mitigación del cambio climático. El estudio aborda la deficiencia de cartografía de alta resolución en entornos tropicales y la dependencia metodológica de predictores redundantes como la materia orgánica (MO) y el nitrógeno (N). Se propuso como objetivo general construir un modelo robusto con n = 145 observaciones, integrando covariables topográficas, espectrales (PlanetScope/UAV) y edafoclimáticas. El proceso incluyó la caracterización estadística de cuarenta y ocho variables , la comparación de siete familias algorítmicas bajo validación cruzada espacial (GroupKFold) y la cuantificación de la incertidumbre predictiva. Los resultados determinaron que la variabilidad del COS está supeditada a factores edáficos, con aportes secundarios del relieve y la vegetación. Tras auditar cuarenta y ocho configuraciones , se seleccionó el modelo Support Vector Regression polinómica en el escenario de exclusión de MO y N , logrando un R² espacial de 0.73, un RMSE de 0.63 y un MAE de 0.44. Se generó cartografía digital a tres metros de resolución sobre 28 981 píxeles , con bandas de incertidumbre estimadas mediante intervalos bootstrap al 95%. Las aplicaciones se centran en la zonificación de precisión, la restauración ecológica, los inventarios de carbono y la transferencia de protocolos de ciencia de datos hacia el mapeo digital de suelos en sistemas de montaña.
  • Item
    Gestión del riesgo y cobranza mediante modelos predictivos en ciencia de datos en educación superior
    (Pontificia Universidad Javeriana Cali, 2026) Tovar Ríos, Paula Andrea; Grajales Castaño, Edgar Esteban; García Arboleda, Isabel Cristina
    Este proyecto tiene como objetivo aplicar técnicas de Ciencia de Datos para optimizar la gestión del riesgo y la cobranza de créditos en la educación superior, abordando una problemática crítica en la Universidad Autónoma de Occidente (UAO), la necesidad de garantizar la sostenibilidad financiera y la permanencia estudiantil mediante créditos educativos más eficientes. Actualmente, los modelos tradicionales no permiten identificar con precisión los perfiles de estudiantes con mayor riesgo de incumplimiento, lo que afecta la toma de decisiones estratégicas y limita la capacidad de respuesta ante situaciones de morosidad. A través del desarrollo de modelos predictivos y análisis de datos históricos, se espera mejorar la identificación de perfiles de riesgo, reducir la morosidad y fortalecer la eficiencia en la gestión de cobranza. Además, se busca implementar herramientas de visualización que permitan a la Dirección Financiera interpretar los resultados de manera clara y tomar decisiones informadas, con potencial de replicabilidad en otras instituciones de educación superior. El proyecto se basa en datos reales y en un enfoque contextualizado, lo que garantiza su relevancia práctica y la posibilidad de generar soluciones sostenibles y ajustadas a las necesidades.
  • Item
    Análisis de clustering y modelado de deserción de clientes bancarios
    (Pontificia Universidad Javeriana Cali, 2026) Ramírez Rodríguez, Omar Javier; Silva Rodríguez, Hans; Ramírez Ramírez, Lilian Marcela; Torres Valencia, Cristian Alejandro
    El proyecto aplicado “Análisis de Clustering y Modelado de Deserción de Clientes Bancarios” desarrolla un enfoque integral para el análisis del churn bancario, articulando técnicas de ingeniería de variables, segmentación de clientes y aprendizaje supervisado con el propósito de comprender, priorizar y predecir el riesgo de abandono bajo criterios de validez metodológica y aplicabilidad analítica. Inicialmente, se planteó la construcción de un Índice de Riesgo Financiero-Comportamental (IRFC) como herramienta para sintetizar múltiples dimensiones financieras y comportamentales del cliente. No obstante, durante el proceso de evaluación se identificaron métricas anormalmente altas, lo que condujo a una revisión crítica del modelo y a la detección de fuga de información asociada a la variable complain. La exclusión de esta variable permitió construir escenarios más realistas y metodológicamente más sólidos, evidenciando la importancia de cuestionar resultados aparentemente ideales en proyectos de ciencia de datos aplicada. De manera complementaria, se implementó un proceso de segmentación mediante clustering, orientado a identificar perfiles diferenciados de clientes según patrones financieros y comportamentales. Esta segmentación permitió estructurar grupos con distintas exposiciones relativas al riesgo, fortaleciendo procesos de perfilamiento, priorización y comprensión estratégica del churn. En la etapa de modelado supervisado se evaluaron múltiples escenarios comparativos, concluyendo que el IRFC no resulta adecuado como predictor directo debido a colinealidad con variables base, aunque conserva valor como herramienta de interpretación y ranking. Asimismo, la segmentación mostró capacidad para aportar valor analítico adicional en escenarios comparativos; sin embargo, su principal contribución se orienta al fortalecimiento de procesos de segmentación estratégica más que a su adopción automática como predictor final. En conjunto, los resultados demuestran que el principal valor del proyecto no radica únicamente en la obtención de métricas predictivas elevadas, sino en la construcción de un enfoque analítico metodológicamente sólido, capaz de diferenciar entre desempeño aparente, validez metodológica e interpretación estratégica. En conclusión, esta investigación evidencia que la integración de analítica avanzada permite no solo mejorar la comprensión del churn, sino también fortalecer la toma de decisiones mediante herramientas complementarias de predicción, segmentación y priorización, facilitando estrategias de retención más focalizadas y metodológicamente defendibles en contextos financieros reales.
  • Item
    Modelo de machine learning para la predicción de diabetes mellitus tipo 2 basado en datos de exámenes de laboratorio rutinarios
    (Pontificia Universidad Javeriana Cali, 2026) Macana Díaz, Natalia Alejandra; Valderrama Corredor, Iván René; Tobar Tosse, Fabián; Palencia Tellez, José Sinibaldo
    La diabetes mellitus tipo 2 (DM2) es una enfermedad crónica de alta prevalencia en Colombia, donde la tasa de subdiagnóstico supera el 30% debido a su naturaleza asintomática en etapas tempranas y a las limitaciones en el acceso a herramientas de tamizaje en el primer nivel de atención. Este proyecto desarrolla dos modelos de machine learning para el tamizaje automatizado de DM2 a partir de datos de laboratorio clínico rutinario disponibles en sistemas LIS, sin requerir variables antropométricas ni costos adicionales. El Modelo A (XGBoost + Platt Scaling), orientado al tamizaje primario universal con edad, sexo y creatinina, alcanzó AUC-ROC de 0.754 y sensibilidad de 0.845; el Modelo B (Random Forest + Platt Scaling), complementario con perfil lipídico completo, alcanzó AUC-ROC de 0.701 y VPP de 0.809. Ambos modelos fueron evaluados con rigor estadístico mediante bootstrap e interpretados mediante valores SHAP, confirmando coherencia fisiopatológica con la literatura clínica. Los resultados se integraron en DiaPredict MD, herramienta web con selección automática de modelo y recomendaciones clínicas generadas mediante un modelo de lenguaje. Las aplicaciones incluyen tamizaje automatizado en el momento de emisión de resultados de laboratorio y reducción de la brecha diagnóstica de DM2 en Colombia.
  • Item
    Modelo predictivo del riesgo de abastecimiento en la cadena de suministro basado en técnicas de machine learning
    (Pontificia Universidad Javeriana Cali, 2026) García Largo, Mauro Steban; García Arboleda, Isabel Cristina
    Este trabajo de grado se enfocó en la implementación de un modelo predictivo del riesgo de abastecimiento para una empresa multinacional productora de alimentos. La investigación surgió debido a la alta variabilidad de la cadena de suministro global y los riesgos asociados a la adquisición de ingredientes, especialmente bajo los enfoques de planeación como DDMRP y justo a tiempo. La relevancia del proyecto radicó en transformar la gestión del abastecimiento hacia una estrategia proactiva para aumentar la disponibilidad de materiales y garantizar la continuidad operativa. La problemática central fue la falta de herramientas analíticas que permitieran anticipar los riesgos de desabastecimiento en un contexto de incertidumbre logística y fluctuación en la demanda. Para abordar esta situación, se plantearon como objetivos: identificar las variables clave que determinan el riesgo asociado a los proveedores, desarrollar varios modelos de predicción utilizando técnicas de análisis de datos, seleccionar el modelo con el mejor desempeño y consolidar sus resultados en un tablero de control con alertas tempranas. El desarrollo se basó en datos históricos disponibles en los sistemas internos de la empresa, tales como ERP y bases de gestión de compras, que contenían información sobre entregas, cumplimiento de proveedores, tiempos de respuesta y consumo de materiales. Como resultado se desarrolló un sistema de análisis que permitió anticipar interrupciones en el suministro mediante algoritmos validados con métricas de precisión y facilidad de interpretación. Además, los resultados del modelo fueron integrados en una herramienta visual accesible para los equipos de compras y planeación, lo cual contribuyó a fortalecer la resiliencia de la cadena de suministro, minimizar impactos operacionales y tomar decisiones informadas con mayor anticipación.
  • Item
    Modelo predictivo basado en machine learning para predecir la cantidad de casos de violencia contra la mujer en la ciudad de Bogotá
    (Pontificia Universidad Javeriana Cali, 2026) Meneses Molina, Mallory Yulieth; Melo Balcázar, Samuel; Mosquera Valencia, Diego Fernando
    El presente proyecto aplicado aborda la problemática de la violencia contra la mujer en Bogotá, enfocándose específicamente en los registros de violencia intrafamiliar y homicidios reportados por el Instituto Nacional de Medicina Legal y Ciencias Forenses (INMLCF). Este fenómeno constituye un problema social de carácter estructural y una violación sistemática de los derechos humanos, cuya persistencia vulnera la seguridad e integridad de las mujeres, lo que hace imperativo fortalecer la capacidad institucional de respuesta. La investigación tuvo como objetivo desarrollar un modelo basado en técnicas de aprendizaje automático que permitiera identificar patrones sociodemográficos, espaciales y de comportamiento, además de predecir la cantidad de casos en las diferentes localidades de la ciudad. Para su ejecución se implementó la metodología CRISP-DM, la cual permitió estructurar el proceso iniciando con la fase de comprensión del negocio, garantizando que el desarrollo técnico estuviera alineado con los objetivos estratégicos y las necesidades reales del entorno. Como principales resultados, se identificaron perfiles de victimización representativos y territorios con mayor incidencia, logrando modelos de segmentación y predicción capaces de anticipar tendencias futuras del fenómeno con alta consistencia técnica. Estos hallazgos demuestran la importancia de transitar de una gestión de datos puramente descriptiva hacia una capacidad de anticipación territorial fundamentada en la ciencia de datos. Las aplicaciones del proyecto se orientan al fortalecimiento de los sistemas de monitoreo, la priorización estratégica de recursos y la formulación de políticas públicas que mejoren la prevención activa de la violencia de género. Finalmente, se concluye que la integración de modelos analíticos avanzados y herramientas de visualización permite transformar los registros históricos en activos de información crítica para la toma de decisiones, facilitando intervenciones estatales más oportunas, precisas y eficaces para salvaguardar la vida e integridad de las mujeres en Bogotá.
  • Item
    Identificación automática de imágenes de ecografías craneales con su respectivo plano anatómico
    (Pontificia Universidad Javeriana Cali, 2026) Villarreal Huertas, Luis Armando; Acevedo Virgues, Laura Daniela; Torres Valencia, Cristian Alejandro
    Este proyecto se basa en el análisis de ecografías craneales fetales que son una herramienta que apoya el diagnóstico de enfermedades y anomalías durante el embarazo, pero que se ve perjudicada por la subjetividad de la interpretación del especialista. Esta clara problemática se ve reflejada por los parámetros intrínsecos de los equipos médicos donde la medición va a variar, ya que, en la modalidad de ultrasonido, es primordial hacer mediciones en el equipo para así dar un buen diagnóstico; los parámetros del equipo pueden alterar el transductor, pieza clave para la toma del estudio, sobre todo en el seguimiento del feto que está en constante desarrollo. Con un modelo de aprendizaje profundo y un conjunto de datos correctamente etiquetados, se generó un prototipo que identifique el plano anatómico de imágenes de ecografías craneales fetales, el cual se implementó en cuatro fases. En la primera fase se hizo una revisión sistemática de la información para determinar el modelo a usar y el conjunto de datos. En la segunda fase se buscó mejorar la calidad de la imagen al usar técnicas de preprocesamiento; esto permitió que a la hora de usar el método de aprendizaje profundo mejore el modelo para la detección de los planos anatómicos. En la tercera fase se aplicó el modelo de aprendizaje profundo y, por último, en la cuarta se implementó un análisis que busca evaluar la precisión del prototipo. Estas fases van de la mano con el planteamiento de los cuatro objetivos, que buscan cumplir con una estructura en el proyecto. Finalmente, se obtuvo un prototipo de aprendizaje de conjunto capaz de clasificar las imágenes fetales craneales a través de tres modelos con exactitudes mayores al 90%. Las posibles aplicaciones van dirigidas a reducir la subjetividad y variabilidad de los diagnósticos, facilitando una interpretación más precisa.
  • Item
    Detección automática de bioindicadores de deterioro en imágenes de arte rupestre de la Serranía de La Lindosa mediante técnicas de aprendizaje automático
    (Pontificia Universidad Javeriana Cali, 2026) Echeverry Henao, Luis Alberto; Rengifo Segura, Jhon Sebastián; Forero Vargas, Manuel Guillermo
    El arte rupestre de la Serranía de La Lindosa constituye uno de los patrimonios arqueológicos más importantes de Colombia y América Latina, debido a la antigüedad y riqueza de sus representaciones pictográficas. Sin embargo, estos paneles se encuentran expuestos a diversos factores de deterioro biológico, ambiental y antrópico que afectan progresivamente su estado de conservación. Actualmente, los procesos de monitoreo dependen principalmente de inspecciones visuales realizadas por especialistas, lo que implica procedimientos manuales, subjetivos y de difícil escalabilidad. En este contexto, la presente investigación propone un modelo basado en técnicas de visión por computador y aprendizaje profundo para apoyar la detección automática de bioindicadores de deterioro en imágenes digitales de alta resolución suministradas por el Instituto Colombiano de Antropología e Historia (ICANH). La metodología desarrollada comprendió la selección de los tipos de deterioro a analizar, la construcción manual de máscaras binarias, la generación de un conjunto de datos basado en patches, la implementación de una estrategia de validación Leave-One-Image-Out (LOIO) y el entrenamiento de modelos de segmentación semántica utilizando las arquitecturas U-Net y ResUNet. Los experimentos fueron realizados sobre las categorías de deterioro plantas superiores, galerías, nidos y nidos de avispas, permitiendo evaluar el comportamiento de los modelos mediante métricas de segmentación como Dice, IoU, precisión, recall y HD95. Los resultados obtenidos evidenciaron un desempeño favorable para la detección de deterioros con patrones visuales bien definidos, así como la influencia significativa de factores como el desbalance entre clases y el tamaño de los patches sobre la capacidad de segmentación de los modelos. Estos hallazgos permitieron establecer estrategias de balanceo del conjunto de datos y ajustar los parámetros de entrenamiento para mejorar el desempeño experimental. La investigación demuestra el potencial de las técnicas de aprendizaje profundo como herramienta de apoyo para el monitoreo no invasivo del patrimonio arqueológico y establece una base metodológica que podrá ser utilizada y extendida en futuros estudios orientados a la conservación digital del arte rupestre y otros bienes culturales.
  • Item
    Predicción de la finura del cemento utilizando parámetros operacionales: un enfoque basado en Machine Learning
    (Pontificia Universidad Javeriana Cali, 2026) Valencia Romero, Laura; Gil González, Julián
    Este proyecto desarrolla un modelo de aprendizaje automático para predecir la finura del cemento, específicamente el porcentaje de retenido en malla 325, a partir de variables operacionales de un molino vertical. La motivación surge ante la necesidad crítica de superar las limitaciones de los métodos tradicionales de control de calidad que generan demoras y afectan tanto la eficiencia energética como la estabilidad del proceso. Para ello, se evaluaron cinco enfoques supervisados, encontrando que los modelos no lineales superaron de manera consistente al modelo lineal. Aunque el proceso gaussiano obtuvo el mejor desempeño predictivo, XGBoost fue seleccionado como modelo final por ofrecer el mejor equilibrio entre precisión, interpretabilidad y costo computacional, con un R2 cercano a 0.60 y un RMSE aproximado de 0.46% en el conjunto de prueba. Además, el análisis del modelo permitió identificar la relevancia de variables asociadas a la composición de la alimentación, la carga interna del molino y la velocidad del separador sobre la finura del producto final.
  • Item
    Modelo predictivo del desempeño académico en el Distrito de Barranquilla mediante técnicas de ciencia de datos
    (Pontificia Universidad Javeriana Cali, 2026) Acosta Quintero, Laura Melisa; Ortega Lenis, Delia
    El presente proyecto aplicado desarrolló un modelo predictivo del desempeño académico de los estudiantes del Distrito de Barranquilla en el Examen Saber 11°, a partir de los microdatos públicos del repositorio DataICFES correspondientes al período 2014-2 a 2024-2. Tras un proceso de consolidación, diagnóstico, limpieza e ingeniería de variables sobre 183.984 registros, se seleccionaron 17 predictores socioeducativos mediante criterios estadísticos (ANOVA, η²) y algorítmicos (Información Mutua y Random Forest Feature Importance). El análisis no supervisado mediante FAMD y K-Means segmentó la población en dos perfiles a lo largo de un gradiente socioeducativo dominante: uno aventajado (≈31%) y otro vulnerable (≈69%), con una brecha de 48 puntos en el puntaje promedio. Para el modelado supervisado se entrenaron y compararon cinco algoritmos: regresión lineal, Ridge, Lasso, Random Forest y XGBoost sobre la variable continua Puntaje Global. XGBoost optimizado mediante RandomizedSearchCV con TimeSeriesSplit resultó el modelo de mejor desempeño, con un error medio de 35 puntos en una escala de 0 a 500 y una varianza explicada cercana al 38% (R²) sobre una cohorte futura no observada. El análisis de interpretabilidad mediante valores SHAP identificó el nivel socioeconómico del establecimiento, los hábitos de lectura diaria y la edad de presentación como las variables dominantes, seguidas por la educación de los padres, evidenciando que el contexto institucional y el capital cultural familiar presentan mayor contribución predictiva que la riqueza material directa. Estos hallazgos delimitan las condiciones de uso del modelo como herramienta de apoyo a la política pública educativa del Distrito y confirman la viabilidad de construir, con datos públicos y técnicas estándar, un instrumento predictivo interpretable y contextualizado.
  • Item
    Desarrollo de un modelo predictivo para la estimación del costo de seguros médicos mediante análisis de historial de siniestralidad y segmentación de carteras de usuarios
    (Pontificia Universidad Javeriana Cali, 2026) Guzmán Sandoval, Laura Catalina; Victoria González, Xammy Alexander; Torres Valencia, Cristian Alejandro
    El presente proyecto aplicado aborda la problemática de la estimación del costo de los seguros médicos en el sector asegurador colombiano, considerando las limitaciones actuales en los procesos de tarificación y evaluación del riesgo. El desarrollo del proyecto tuvo como objetivo desarrollar un modelo predictivo basado en técnicas de aprendizaje automático que permitiera apoyar de manera técnica y objetiva la estimación de costos asociados a los asegurados, integrando variables demográficas, clínicas, comportamentales y de uso de servicios médicos. Para ello, se realizó la estructuración y depuración de una base de datos amplia y heterogénea, la cual requirió procesos exhaustivos de limpieza, imputación, estandarización y transformación para garantizar su calidad y consistencia. A partir de este insumo, se realizó un análisis exploratorio detallado que permitió identificar relaciones relevantes, anomalías y variables clave para la construcción del modelo. Posteriormente, se implementaron algoritmos supervisados y no supervisados como Regresión Lineal, Random Forest, XGBoost y técnicas de segmentación de usuarios, con el fin de identificar patrones de siniestralidad y mejorar la precisión en la predicción de costos. Los modelos fueron evaluados mediante métricas cuantitativas como MAE, RMSE y R², permitiendo seleccionar la arquitectura con mejor desempeño predictivo. Como resultado, se obtuvo una herramienta analítica orientada a fortalecer los procesos de tarificación y gestión del riesgo, además de un prototipo interactivo de visualización que facilita la interpretación de resultados y la toma de decisiones estratégicas en el sector asegurador. El proyecto aporta una aplicación práctica de la ciencia de datos y el aprendizaje automático en seguros de salud, contribuyendo al fortalecimiento técnico y financiero de las aseguradoras dentro del contexto colombiano.
  • Item
    Predicción del riesgo de depresión en estudiantes universitarios mediante métodos de aprendizaje automático
    (Pontificia Universidad Javeriana Cali, 2026) Mendoza Sarmiento, Kassandra; Sánchez Serna, Ángel David; Cuchumbé Mera, Juan Sebastián; Ávila Toscano, José Hernando
    El presente proyecto aplicado estimó el riesgo de depresión en estudiantes universitarios a partir de variables sociodemográficas, emocionales y académicas, utilizando modelos de aprendizaje automático. La depresión afecta significativamente a la población universitaria e impacta en su rendimiento académico y en la deserción de las instituciones universitarias. Las universidades presentan programas de bienestar con un enfoque más reactivo que preventivo y no cuentan con herramientas que generen alertas tempranas que permitan anticiparse al riesgo. Con este proyecto se desarrolló un modelo predictivo entrenado y validado sobre datos provenientes de encuestas anónimas disponibles públicamente, con el fin de sentar una base metodológica que pueda ser adaptada por instituciones universitarias en contextos reales. El proyecto contempló tres objetivos específicos: analizar la capacidad de la regresión logística para modelar relaciones lineales entre variables relevantes; evaluar el desempeño del modelo Random Forest en la detección de patrones no lineales y la importancia de los predictores y comparar ambos modelos según métricas de rendimiento como la precisión, sensibilidad y especificidad. Para ello, se utilizó la base de datos pública “Student Depression Dataset”, disponible en la plataforma Kaggle. Como resultados, se construyeron y validaron dos modelos predictivos y se generaron visualizaciones comparativas de desempeño. El proyecto representa una contribución aplicada desde la ciencia de datos al campo de la salud mental en contextos educativos.
  • Item
    Clasificación de espectrogramas de audio con técnicas de aprendizaje profundo para el reconocimiento de sonidos urbanos
    (Pontificia Universidad Javeriana Cali, 2026) Domínguez Benítez, Juan Camilo; Jaramillo Giraldo, María Paula; Arroyo Marín, Andrés; Arango Londoño, David
    El presente proyecto aplicado abordó la clasificación automática de sonidos urbanos mediante técnicas de aprendizaje profundo, utilizando espectrogramas Mel como representación visual de señales acústicas en la ciudad de Popayán, Cauca. Esta iniciativa nace con el propósito de fortalecer el monitoreo inteligente del paisaje sonoro urbano, considerando que la contaminación acústica es una problemática creciente con efectos sobre la salud física y mental, la calidad de vida y sostenimiento ambiental. Hoy en día, la clasificación manual de sonidos representa un proceso muy operativo, subjetivo y poco escalable debido a la mezcla o superposición constante de sonidos urbanos y a la ausencia de herramientas automatizadas para el reconocimiento de los tipos de sonidos. En este contexto, el objetivo principal consistió en diseñar un modelo basado en redes neuronales convolucionales capaz de clasificar sonidos urbanos según su origen: biofofía (sonido animales), geofonía (sonidos lluvias o viento), antropofonía (transporte motorizado, voces/ música). Para esto se trabajó con un conjunto de datos de 7.138 fragmentos de audio obtenidos a partir de 250 grabaciones recolectadas en 50 puntos del centro histórico de Popayán. Luego, las señales de audio fueron transformadas en espectrogramas de Mel, convirtiendo el sonido en imágenes para el reconocimiento visual mediante arquitecturas convolucionales de aprendizaje profundo. Se evaluaron diferentes arquitecturas mediante la búsqueda aleatoria de hiperparámetros, se incluyeron estrategias de transferencia de aprendizaje, aumento de datos y manejo de desbalance de clases. Como resultado, la arquitectura EfficientNetB0 presentó mejores resultados y desempeño, alcanzando un F1 macro de 0,51, un accuracy del 60,9% y un Balanced Accuracy de 0,59 sobre el conjunto de prueba. Con estos resultados, se evidencia la capacidad de un modelo para identificar patrones acústicos complejos en entornos urbanos y demuestran elo potencial de la inteligencia artificial al análisis de sonidos, con aplicaciones en monitoreo ambiental, control de contaminación acústica y apoyo a políticas públicas en las zonas.
  • Item
    Modelo de predicción de deserción en estudiantes de una institución de educación superior
    (Pontificia Universidad Javeriana Cali, 2026) Figueroa Arias, José Julián; Porras Ríos, Yudy Alexandra; Torres Valencia, Cristian Alejandro
    La deserción estudiantil constituye una de las principales problemáticas que enfrentan las instituciones de educación superior. En Colombia, aproximadamente el 36% de los estudiantes abandona sus estudios durante el primer año, lo que resalta la importancia de abordar este fenómeno mediante herramientas analíticas. En este contexto, el presente trabajo tuvo como objetivo desarrollar un modelo de predicción de deserción estudiantil utilizando técnicas de aprendizaje automático supervisado, a partir del conjunto de datos público "Predict Students' Dropout and Academic Success" del UCI Machine Learning Repository, correspondiente a una institución de educación superior portuguesa con 4.424 registros. La metodología se estructuró bajo el estándar CRISP DM, abarcando las fases de comprensión y preparación de los datos, modelado y evaluación. Se entrenaron y compararon cinco algoritmos: regresión logística, árbol de decisión, Random Forest, XGBoost y redes neuronales artificiales, bajo un esquema de validación cruzada estratificada repetida. Los resultados evidenciaron que XGBoost presentó el mejor desempeño global en la identificación del riesgo, alcanzando un Recall de 0.9085, un ROC-AUC de 0.9728 y un F1-score de 0.8990 en el conjunto de prueba. Adicionalmente, el modelo seleccionado fue integrado en un prototipo funcional desarrollado con Streamlit y desplegado en la nube, que permite a los equipos institucionales visualizar las predicciones de riesgo de forma interactiva y tomar decisiones de intervención basadas en datos.
  • Item
    Extracción inteligente de metadatos del Anexo No. 2 en reclamación de garantías: automatización con ciencia de datos aplicada al FNG
    (Pontificia Universidad Javeriana Cali, 2026) Duque Carreño, Johan Camilo; Peñuela Cárdenas, Sergio; Mora Cardona, Mario Julián
    El presente trabajo desarrolla un prototipo de extracción inteligente de metadatos del Anexo No. 2 del Fondo Nacional de Garantías (FNG), formulario estandarizado utilizado en procesos de reclamación de garantías en Colombia. La solución implementa un pipeline híbrido compuesto por un componente basado en reglas para PDFs digitales y un modelo TrOCR con fine-tuning para formularios manuscritos. Dado que la Ley 1581 de 2012 (Habeas Data) prohíbe el envío de datos personales sensibles a servidores externos, se construyó un corpus sintético de 551 documentos para entrenamiento y evaluación, garantizando cero exposición de datos reales. El pipeline digital alcanzó una cobertura global del 80.3%, con precisión del 100% en campos críticos como NIT, cédulas y teléfono. El modelo TrOCR con fine-tuning obtuvo un CER de 0.1176 (equivalente al 88.2% de precisión), representando una mejora relativa del 61% sobre la línea base de Tesseract OCR. Ambos componentes se integran en un flujo unificado con salida estructurada en CSV para los 13 campos de identificación y contacto del formulario.
  • Item
    Minería de datos educativos para identificar factores que afectan el rendimiento académico en Colombia
    (Pontificia Universidad Javeriana Cali, 2026) García Fernández, Joan Sebastián; Beltrán García, Diana Milena; Torres Valencia, Cristian Alejandro
    Este proyecto aplicado identificó y analizó los factores que incidieron significativamente en el rendimiento académico de los estudiantes en Colombia, utilizando técnicas de minería de datos educativos (EDM) y modelos de aprendizaje automático. La investigación partió del reconocimiento de que, a pesar de la disponibilidad de datos generados en instituciones educativas, estos no se aprovechaban adecuadamente para fundamentar decisiones pedagógicas y políticas educativas. La problemática abordada se centró en la alta heterogeneidad del rendimiento académico de los estudiantes, evidenciada en brechas de aprendizaje y oportunidades entre sectores rurales y urbanos, así como entre instituciones oficiales y no oficiales. Para dar respuesta a esta problemática, se recopilaron y depuraron datos académicos provenientes de fuentes abiertas del ICFES. Posteriormente, se identificaron variables significativas mediante técnicas de minería de datos y se construyeron modelos predictivos orientados a estimar el rendimiento académico. El proyecto también realizó un análisis comparativo entre contextos geográficos, evidenciando brechas educativas y permitiendo formular recomendaciones basadas en evidencia. Entre los resultados más relevantes se destacaron la identificación de factores socioeconómicos e institucionales asociados al rendimiento académico, la validación del modelo XGBoost como el algoritmo con mejor desempeño predictivo y estabilidad, así como la identificación de diferencias significativas entre contextos rurales y urbanos. Estos resultados pueden servir como insumo para la toma de decisiones pedagógicas y administrativas en instituciones educativas, así como para la formulación de políticas orientadas a la equidad educativa en Colombia.