
Our purpose is to manage, preserve, and disseminate all the intellectual, scientific, and historical production of our university community.
Communities in DSpace
Select a community to browse its collections.
Recent Submissions
Extracción inteligente de metadatos del Anexo No. 2 en reclamación de garantías: automatización con ciencia de datos aplicada al FNG
(Pontificia Universidad Javeriana Cali, 2026) Duque Carreño, Johan Camilo; Peñuela Cárdenas, Sergio; Mora Cardona, Mario Julián
El presente trabajo desarrolla un prototipo de extracción inteligente de metadatos del Anexo No. 2 del Fondo Nacional de Garantías (FNG), formulario estandarizado utilizado en procesos de reclamación de garantías en Colombia. La solución implementa un pipeline híbrido compuesto por un componente basado en reglas para PDFs digitales y un modelo TrOCR con fine-tuning para formularios manuscritos. Dado que la Ley 1581 de 2012 (Habeas Data) prohíbe el envío de datos personales sensibles a servidores externos, se construyó un corpus sintético de 551 documentos para entrenamiento y evaluación, garantizando cero exposición de datos reales. El pipeline digital alcanzó una cobertura global del 80.3%, con precisión del 100% en campos críticos como NIT, cédulas y teléfono. El modelo TrOCR con fine-tuning obtuvo un CER de 0.1176 (equivalente al 88.2% de precisión), representando una mejora relativa del 61% sobre la línea base de Tesseract OCR. Ambos componentes se integran en un flujo unificado con salida estructurada en CSV para los 13 campos de identificación y contacto del formulario.
Minería de datos educativos para identificar factores que afectan el rendimiento académico en Colombia
(Pontificia Universidad Javeriana Cali, 2026) García Fernández, Joan Sebastián; Beltrán García, Diana Milena; Torres Valencia, Cristian Alejandro
Este proyecto aplicado identificó y analizó los factores que incidieron significativamente en el rendimiento académico de los estudiantes en Colombia, utilizando técnicas de minería de datos educativos (EDM) y modelos de aprendizaje automático. La investigación partió del reconocimiento de que, a pesar de la disponibilidad de datos generados en instituciones educativas, estos no se aprovechaban adecuadamente para fundamentar decisiones pedagógicas y políticas educativas. La problemática abordada se centró en la alta heterogeneidad del rendimiento académico de los estudiantes, evidenciada en brechas de aprendizaje y oportunidades entre sectores rurales y urbanos, así como entre instituciones oficiales y no oficiales. Para dar respuesta a esta problemática, se recopilaron y depuraron datos académicos provenientes de fuentes abiertas del ICFES. Posteriormente, se identificaron variables significativas mediante técnicas de minería de datos y se construyeron modelos predictivos orientados a estimar el rendimiento académico. El proyecto también realizó un análisis comparativo entre contextos geográficos, evidenciando brechas educativas y permitiendo formular recomendaciones basadas en evidencia. Entre los resultados más relevantes se destacaron la identificación de factores socioeconómicos e institucionales asociados al rendimiento académico, la validación del modelo XGBoost como el algoritmo con mejor desempeño predictivo y estabilidad, así como la identificación de diferencias significativas entre contextos rurales y urbanos. Estos resultados pueden servir como insumo para la toma de decisiones pedagógicas y administrativas en instituciones educativas, así como para la formulación de políticas orientadas a la equidad educativa en Colombia.
Clasificación de reportes de daños realizados por los canales digitales de Celsia mediante agentes virtuales
(Pontificia Universidad Javeriana Cali, 2026) Sandoval Posso, Jesús David; Hernández Porras, María Fernanda; González Vélez, Juan Carlos
En Celsia Colombia S.A. E.S.P., la clasificación manual e inadecuada de reportes de incidentes recibidos por canales digitales, como el sistema LuzIA, genera un alto número de visitas técnicas fallidas, lo que incrementa los tiempos de respuesta, reduce la eficiencia operativa y afecta la experiencia del cliente. Sobre una muestra de 88.959 registros de incidentes cancelados históricos del período comprendido entre 2023–2025, el análisis exploratorio identificó 5.111 visitas fallidas, equivalentes al 5,75% de los casos cancelados, concentradas en reportes mal clasificados o canalizados incorrectamente. La deficiencia en los filtros y criterios de priorización homogeniza la atención de incidentes, causando demoras en casos críticos, aumentando los indicadores SAIDI y SAIFI, y exponiendo a la empresa a sanciones regulatorias. Este proyecto, desarrollado en el marco de la Maestría en Ciencia de Datos de la Pontificia Universidad Javeriana Cali, propone un sistema de agentes virtuales basado en frameworks como LangChain, LangGraph y CrewAI para detectar, validar y clasificar automáticamente reportes, diferenciando entre daños en infraestructura y pérdida de servicio. La solución busca optimizar la asignación de recursos, reducir visitas fallidas y mejorar la experiencia del cliente en Valle del Cauca y Tolima, demostrando su viabilidad mediante un prototipo funcional que promueve la agilidad, confiabilidad e innovación en la gestión de incidentes eléctricos.
Análisis predictivo del impacto del cambio climático y el conflicto armado en el comportamiento de la cartera de créditos agropecuarios para la Regional Occidente
(Pontificia Universidad Javeriana Cali, 2026) Castillo Perea, Flavio Alejandro; Valencia Cárdenas, Johan Sebastián; García Arboleda, Isabel Cristina
El presente proyecto desarrolló un modelo de análisis predictivo para evaluar el impacto del cambio climático y el conflicto armado en el comportamiento de la cartera agropecuaria de la banca pública colombiana, con énfasis en la región occidental del país (Valle del Cauca, Cauca y Nariño). Esta zona se caracteriza por una alta dependencia de las actividades agropecuarias, las cuales se han visto severamente afectadas tanto por fenómenos climáticos extremos como sequías, lluvias intensas y alteraciones en los ciclos productivos como por la persistencia del conflicto armado y las economías ilegales, que generan desplazamiento forzado, inseguridad y limitaciones en el acceso a mercados. A partir del análisis de 55.454 obligaciones de crédito, se integraron variables crediticias internas con factores externos climáticos (ola invernal, sequía, factores naturales) y de conflicto armado (hechos victimizantes, desplazamiento forzado), aplicando la metodología CRISP-DM. Se estimaron ocho modelos predictivos (Regresión Logística Binomial, Árbol de Decisión y XGBoost, con y sin ponderación de clases, más un Logit Ordinal para severidad de mora). El XGBoost ponderado se posicionó como el modelo de mayor capacidad discriminatoria (AUC ROC = 0.7921, Kappa = 0.3253), superando en aproximadamente 14 puntos porcentuales al mejor modelo lineal. Los principales hallazgos evidenciaron que la Ola Invernal eleva el riesgo de mora un 61% respecto a factores económicos, el desplazamiento forzado lo incrementa un 42%, y las obligaciones en Valle del Cauca presentan una probabilidad de mora un 34% superior a las del Cauca. El modelo se traduce en una arquitectura de alertas tempranas y segmentación territorial del riesgo, materializada en un dashboard interactivo en Power BI y un reporte analítico, como herramientas de apoyo a la gestión proactiva de la cartera agropecuaria en la Regional Occidente.
Modelo analítico para la predicción de garantías posventa en proyectos residenciales: aplicación en una empresa constructora colombiana
(Pontificia Universidad Javeriana Cali, 2026) Castillo Narváez, Diana Camila; Contreras Macías, Maicol Stiven; Arango Londoño, David
Este proyecto aplicado tuvo como objetivo desarrollar un modelo predictivo basado en técnicas de aprendizaje automático para estimar el comportamiento de las reclamaciones por garantías posventa en proyectos de vivienda entregados por una constructora en la ciudad de Cali. A partir del análisis de bases de datos históricas del sistema CRM, información de entregas de inmuebles, características técnicas de los proyectos, tipo de acabado y variables contextuales exploratorias, se buscó estimar la cantidad esperada, la categoría técnica y el momento de ocurrencia de las reclamaciones. El trabajo incluyó tareas de limpieza, integración y transformación de datos, homologación de proyectos y categorías de daño, construcción de la exposición mensual de inmuebles, ingeniería de características, selección de variables relevantes y evaluación de modelos supervisados de regresión. El modelo seleccionado fue XGBoost con variables de historial reciente, debido a que presentó el mejor equilibrio general entre las métricas evaluadas, incluyendo MAE, RMSE, R², MAPE sobre observaciones positivas y comparación entre totales reales y predichos. Como resultado, el modelo permitió generar predicciones futuras para apoyar la planeación operativa del área de posventa; para 2026 se estimó una carga aproximada de 4.247 locativas, con análisis por mes, proyecto y padre/capítulo técnico. En un sector como el de la construcción, con una gestión posventa tradicionalmente reactiva y con oportunidades de fortalecimiento en el uso analítico de los datos, esta propuesta representa una aplicación práctica de ciencia de datos para anticipar cargas de atención, priorizar recursos, identificar categorías críticas y apoyar la toma de decisiones basada en evidencia. El proyecto contribuye al fortalecimiento de la gestión proactiva de garantías y a la transformación digital del proceso posventa, dejando como producto un modelo predictivo reproducible y resultados estructurados para su consulta mediante una herramienta de visualización.