Our purpose is to manage, preserve, and disseminate all the intellectual, scientific, and historical production of our university community.

Recent Submissions

Item
Predicción de la finura del cemento utilizando parámetros operacionales: un enfoque basado en Machine Learning
(Pontificia Universidad Javeriana Cali, 2026) Valencia Romero, Laura; Gil González, Julián
Este proyecto desarrolla un modelo de aprendizaje automático para predecir la finura del cemento, específicamente el porcentaje de retenido en malla 325, a partir de variables operacionales de un molino vertical. La motivación surge ante la necesidad crítica de superar las limitaciones de los métodos tradicionales de control de calidad que generan demoras y afectan tanto la eficiencia energética como la estabilidad del proceso. Para ello, se evaluaron cinco enfoques supervisados, encontrando que los modelos no lineales superaron de manera consistente al modelo lineal. Aunque el proceso gaussiano obtuvo el mejor desempeño predictivo, XGBoost fue seleccionado como modelo final por ofrecer el mejor equilibrio entre precisión, interpretabilidad y costo computacional, con un R2 cercano a 0.60 y un RMSE aproximado de 0.46% en el conjunto de prueba. Además, el análisis del modelo permitió identificar la relevancia de variables asociadas a la composición de la alimentación, la carga interna del molino y la velocidad del separador sobre la finura del producto final.
Item
Modelo predictivo del desempeño académico en el Distrito de Barranquilla mediante técnicas de ciencia de datos
(Pontificia Universidad Javeriana Cali, 2026) Acosta Quintero, Laura Melisa; Ortega Lenis, Delia
El presente proyecto aplicado desarrolló un modelo predictivo del desempeño académico de los estudiantes del Distrito de Barranquilla en el Examen Saber 11°, a partir de los microdatos públicos del repositorio DataICFES correspondientes al período 2014-2 a 2024-2. Tras un proceso de consolidación, diagnóstico, limpieza e ingeniería de variables sobre 183.984 registros, se seleccionaron 17 predictores socioeducativos mediante criterios estadísticos (ANOVA, η²) y algorítmicos (Información Mutua y Random Forest Feature Importance). El análisis no supervisado mediante FAMD y K-Means segmentó la población en dos perfiles a lo largo de un gradiente socioeducativo dominante: uno aventajado (≈31%) y otro vulnerable (≈69%), con una brecha de 48 puntos en el puntaje promedio. Para el modelado supervisado se entrenaron y compararon cinco algoritmos: regresión lineal, Ridge, Lasso, Random Forest y XGBoost sobre la variable continua Puntaje Global. XGBoost optimizado mediante RandomizedSearchCV con TimeSeriesSplit resultó el modelo de mejor desempeño, con un error medio de 35 puntos en una escala de 0 a 500 y una varianza explicada cercana al 38% (R²) sobre una cohorte futura no observada. El análisis de interpretabilidad mediante valores SHAP identificó el nivel socioeconómico del establecimiento, los hábitos de lectura diaria y la edad de presentación como las variables dominantes, seguidas por la educación de los padres, evidenciando que el contexto institucional y el capital cultural familiar presentan mayor contribución predictiva que la riqueza material directa. Estos hallazgos delimitan las condiciones de uso del modelo como herramienta de apoyo a la política pública educativa del Distrito y confirman la viabilidad de construir, con datos públicos y técnicas estándar, un instrumento predictivo interpretable y contextualizado.
Item
Desarrollo de un modelo predictivo para la estimación del costo de seguros médicos mediante análisis de historial de siniestralidad y segmentación de carteras de usuarios
(Pontificia Universidad Javeriana Cali, 2026) Guzmán Sandoval, Laura Catalina; Victoria González, Xammy Alexander; Torres Valencia, Cristian Alejandro
El presente proyecto aplicado aborda la problemática de la estimación del costo de los seguros médicos en el sector asegurador colombiano, considerando las limitaciones actuales en los procesos de tarificación y evaluación del riesgo. El desarrollo del proyecto tuvo como objetivo desarrollar un modelo predictivo basado en técnicas de aprendizaje automático que permitiera apoyar de manera técnica y objetiva la estimación de costos asociados a los asegurados, integrando variables demográficas, clínicas, comportamentales y de uso de servicios médicos. Para ello, se realizó la estructuración y depuración de una base de datos amplia y heterogénea, la cual requirió procesos exhaustivos de limpieza, imputación, estandarización y transformación para garantizar su calidad y consistencia. A partir de este insumo, se realizó un análisis exploratorio detallado que permitió identificar relaciones relevantes, anomalías y variables clave para la construcción del modelo. Posteriormente, se implementaron algoritmos supervisados y no supervisados como Regresión Lineal, Random Forest, XGBoost y técnicas de segmentación de usuarios, con el fin de identificar patrones de siniestralidad y mejorar la precisión en la predicción de costos. Los modelos fueron evaluados mediante métricas cuantitativas como MAE, RMSE y R², permitiendo seleccionar la arquitectura con mejor desempeño predictivo. Como resultado, se obtuvo una herramienta analítica orientada a fortalecer los procesos de tarificación y gestión del riesgo, además de un prototipo interactivo de visualización que facilita la interpretación de resultados y la toma de decisiones estratégicas en el sector asegurador. El proyecto aporta una aplicación práctica de la ciencia de datos y el aprendizaje automático en seguros de salud, contribuyendo al fortalecimiento técnico y financiero de las aseguradoras dentro del contexto colombiano.
Item
Predicción del riesgo de depresión en estudiantes universitarios mediante métodos de aprendizaje automático
(Pontificia Universidad Javeriana Cali, 2026) Mendoza Sarmiento, Kassandra; Sánchez Serna, Ángel David; Cuchumbé Mera, Juan Sebastián; Ávila Toscano, José Hernando
El presente proyecto aplicado estimó el riesgo de depresión en estudiantes universitarios a partir de variables sociodemográficas, emocionales y académicas, utilizando modelos de aprendizaje automático. La depresión afecta significativamente a la población universitaria e impacta en su rendimiento académico y en la deserción de las instituciones universitarias. Las universidades presentan programas de bienestar con un enfoque más reactivo que preventivo y no cuentan con herramientas que generen alertas tempranas que permitan anticiparse al riesgo. Con este proyecto se desarrolló un modelo predictivo entrenado y validado sobre datos provenientes de encuestas anónimas disponibles públicamente, con el fin de sentar una base metodológica que pueda ser adaptada por instituciones universitarias en contextos reales. El proyecto contempló tres objetivos específicos: analizar la capacidad de la regresión logística para modelar relaciones lineales entre variables relevantes; evaluar el desempeño del modelo Random Forest en la detección de patrones no lineales y la importancia de los predictores y comparar ambos modelos según métricas de rendimiento como la precisión, sensibilidad y especificidad. Para ello, se utilizó la base de datos pública “Student Depression Dataset”, disponible en la plataforma Kaggle. Como resultados, se construyeron y validaron dos modelos predictivos y se generaron visualizaciones comparativas de desempeño. El proyecto representa una contribución aplicada desde la ciencia de datos al campo de la salud mental en contextos educativos.
Item
Clasificación de espectrogramas de audio con técnicas de aprendizaje profundo para el reconocimiento de sonidos urbanos
(Pontificia Universidad Javeriana Cali, 2026) Domínguez Benítez, Juan Camilo; Jaramillo Giraldo, María Paula; Arroyo Marín, Andrés; Arango Londoño, David
El presente proyecto aplicado abordó la clasificación automática de sonidos urbanos mediante técnicas de aprendizaje profundo, utilizando espectrogramas Mel como representación visual de señales acústicas en la ciudad de Popayán, Cauca. Esta iniciativa nace con el propósito de fortalecer el monitoreo inteligente del paisaje sonoro urbano, considerando que la contaminación acústica es una problemática creciente con efectos sobre la salud física y mental, la calidad de vida y sostenimiento ambiental. Hoy en día, la clasificación manual de sonidos representa un proceso muy operativo, subjetivo y poco escalable debido a la mezcla o superposición constante de sonidos urbanos y a la ausencia de herramientas automatizadas para el reconocimiento de los tipos de sonidos. En este contexto, el objetivo principal consistió en diseñar un modelo basado en redes neuronales convolucionales capaz de clasificar sonidos urbanos según su origen: biofofía (sonido animales), geofonía (sonidos lluvias o viento), antropofonía (transporte motorizado, voces/ música). Para esto se trabajó con un conjunto de datos de 7.138 fragmentos de audio obtenidos a partir de 250 grabaciones recolectadas en 50 puntos del centro histórico de Popayán. Luego, las señales de audio fueron transformadas en espectrogramas de Mel, convirtiendo el sonido en imágenes para el reconocimiento visual mediante arquitecturas convolucionales de aprendizaje profundo. Se evaluaron diferentes arquitecturas mediante la búsqueda aleatoria de hiperparámetros, se incluyeron estrategias de transferencia de aprendizaje, aumento de datos y manejo de desbalance de clases. Como resultado, la arquitectura EfficientNetB0 presentó mejores resultados y desempeño, alcanzando un F1 macro de 0,51, un accuracy del 60,9% y un Balanced Accuracy de 0,59 sobre el conjunto de prueba. Con estos resultados, se evidencia la capacidad de un modelo para identificar patrones acústicos complejos en entornos urbanos y demuestran elo potencial de la inteligencia artificial al análisis de sonidos, con aplicaciones en monitoreo ambiental, control de contaminación acústica y apoyo a políticas públicas en las zonas.