Maestría en Ciencia de Datos
Permanent URI for this collection
Browse
Browsing Maestría en Ciencia de Datos by Author "Arango Londoño, David"
Now showing 1 - 20 of 32
Results Per Page
Sort Options
Item Análisis de factores y alerta temprana del riesgo de violencia basada en género en Colombia(Pontificia Universidad Javeriana Cali, 2023) Barrera Barrera, David Samuel; Poveda Aguirre, Eliana Liney; Arango Londoño, DavidLa violencia física, psicológica, sexual y económica contra las mujeres hacen parte de las distintas formas de violencia basada en género (VBG). En consecuencia, con el presente proyecto se creó, tentativamente, un modelo de aprendizaje no supervisado que permitió identificar los determinantes que inciden en la VBG y, con ello, visibilizar el uso de herramientas de machine learning para la comprensión de este fenómeno a nivel nacional. Conocer dónde se concentra, por qué, y en qué casos se incrementa la violencia de pareja y sexual es relevante para la prevención y, en particular, para la planificación de los recursos y servicios institucionales implicados en la lucha contra la VBG, especialmente de intervención temprana.Item Análisis de oferta y demanda del aprovechamiento de residuos en Bogotá mediante aprendizaje no supervisado y ciencia de datos(Pontificia Universidad Javeriana Cali, 2026) Mendieta Sánchez, Diana Carolina; Hurtado Bolaños, Henry; Arango Londoño, DavidBogotá D.C. genera aproximadamente 191.334 toneladas mensuales de residuos con potencial de aprovechamiento (Soluciones Empresariales DCA SAS, 2026), pero su sistema formal de reciclaje opera al 77,4% de la demanda estimada, dejando un déficit estructural de 43.309 ton/mes. A la fecha del estudio, el Registro Único de Recicladores de Oficio (RURO) de la UAESP registraba 29.495 recicladores formalizados (UAESP, 2026), mientras el Sistema Único de Información de la Superintendencia de Servicios Públicos Domiciliarios (SUI-SSPD, 2026) reportaba 430 organizaciones prestadoras del servicio de aprovechamiento. A pesar de la existencia de estos registros oficiales, ningún estudio previo los había integrado con un modelo de demanda territorial para calcular coberturas reales por localidad. Esta brecha motivó el presente proyecto, desarrollado por Diana Carolina Mendieta Sánchez, investigadora principal y representante legal de Soluciones Empresariales DCA SAS, empresa prestadora de servicios a través de asociaciones de recicladores en las 20 localidades de Bogotá y Henry Hurtado Bolaños, en el marco de la Maestría en Ciencia de Datos de la Pontificia Universidad Javeriana Cali. Bajo el marco metodológico CRISP-DM (Chapman et al., 2000), se integraron seis fuentes de datos oficiales heterogéneas mediante un pipeline ETL implementado en Python 3.12. Se aplicaron tres algoritmos de aprendizaje no supervisado K-Means (MacQueen, 1967), clustering jerárquico Ward y DBSCAN (Ester et al., 1996) sobre las 430 organizaciones formalizadas. El número óptimo de clústeres (K=4) se seleccionó mediante la evaluación simultánea de cuatro métricas de validación interna: coeficiente de silueta (0,487; Rousseeuw, 1987), índice Davies-Bouldin (0,854; Davies & Bouldin, 1979), índice Calinski-Harabász (17,59) y suma de cuadrados intra-clúster. La convergencia de los tres algoritmos en la misma solución K=4 confirma la robustez del resultado (Jain, 2010). Se identificaron cuatro tipologías operativas: grandes redes (13,9%, ~860 ton/mes), microoperadores (75,0%, ~208 ton/mes), organizaciones de baja eficiencia (8,3%) y organizaciones en situación crítica (2,8%). Un marco de zonificación territorial clasificó las 20 localidades en cinco cuadrantes de intervención mediante un Índice de Prioridad de Intervención (IPI) normalizado 0-100. Un hallazgo inesperado emergió de la integración de datos: el 94,7% de los recicladores registrados en el RURO (UAESP, 2026) opera fuera de su localidad de residencia. Este desajuste geográfico invalida los indicadores de cobertura calculados exclusivamente desde el SUI-SSPD: los superávits aparentes reportados como el 247,9% (GPS IDECA) en Puente Aranda o el 310% en Teusaquillo son artefactos del registro administrativo, no capacidad operativa real (Ferronato & Torretta, 2019; Moreno Rodríguez, 2018). Un modelo de programación lineal (PuLP, solver CBC, cuatro variantes) mostró que, bajo condiciones ideales de reasignación, redistribuir la capacidad existente sin nueva inversión cubriría teóricamente el 148,9% del déficit total del sistema, con un costo de transporte equivalente al 2,6% del costo operativo (Savelsbergh & Van Woensel, 2016). Este resultado se presenta como escenario exploratorio para apoyar la toma de decisiones, 4 reconociendo que la implementación real depende de restricciones institucionales, contractuales y económicas del sistema. Los resultados se desplegaron en un dashboard interactivo HTML5/Leaflet con 430 organizaciones georreferenciadas, una matriz de cuadrantes e insumos analíticos para la toma de decisiones de la UAESP y los operadores de las cinco Áreas de Servicio Exclusivo (ASE). Este trabajo constituye la primera cuantificación empírica basada en datos del desajuste oferta-demanda en el sistema formal de aprovechamiento de residuos en Bogotá a escala de organización prestadora individual.Item Análisis descriptivo y predictivo para la vigilancia de los casos de dengue grave en la ciudad de Cali(Pontificia Universidad Javeriana de Cali, 2023) Mena Ríos, Andrés Mauricio; Hurtado Murillo, Faber Esteban; Sánchez Andrade, Jefferson; Arango Londoño, DavidEste proyecto de ciencia de datos desarrolla un modelo predictivo que permite estimar la cantidad de casos de dengue grave que ocurren en un determinado momento en la ciudad de Cali. Para eso, se realiza un análisis de la dinámica de la enfermedad, considerando aspectos como la temporalidad, la incidencia geográfica y algunas variables sociodemográficas; además, se construyen modelos predictivos basados en cuatro algoritmos de Machine Learning, el uso de fuentes de datos informales, y la incorporación de una variable novedosa como predictor. La primera parte del proyecto se enfoca en análisis descriptivos del dengue grave en Cali, a partir del procesamiento de los registros históricos oficiales, con el propósito de comprender patrones y tendencias de la enfermedad e identificar factores relacionados con su incidencia. La segunda sección del proyecto gira alrededor de la determinación del mejor modelo para predecir la cantidad de casos de dengue en Cali, haciendo uso de una variedad de recursos de la ciencia de datos para la construcción, evaluación y análisis de los candidatos.Item Análisis espaciotemporal de la relación entre las infracciones y los accidentes de tránsito en la ciudad de Cali, Colombia 2021–2022(Pontificia Universidad Javeriana Cali, 2025) Grisales Cárdenas , Christian Fernando; Castro Salazar, Fabián Andrés; Moreno Collazos, Gustavo Andrés; Arango Londoño, DavidEl presente documento es resultado del proyecto aplicado, requisito esencial para optar por el título de Maestría en Ciencia de Datos de la Pontificia Universidad Javeriana Cali. En él se propone la aplicación de modelos estadísticos para procesos puntuales espaciales con el fin de analizar la distribución geográfica de los siniestros viales con fatalidad, en relación con diversas covariables asociadas a infracciones de tránsito, en el área urbana de Santiago de Cali. La información utilizada fue proporcionada por la Secretaría de Movilidad e incluye datos georreferenciados de siniestros y reportes de infracciones correspondientes a los años 2021 y 2022. Con un enfoque teórico-práctico, guiado por la metodología CRISP DM, se integró el conocimiento académico en la solución de una problemática social crítica como lo es la mortalidad por accidentes de tránsito. Inicialmente, se establecieron los fundamentos conceptuales de los procesos puntuales espaciales. Luego, se llevó a cabo una exploración de los datos espaciales y se desarrollaron modelos de intensidad de puntos, utilizando tanto enfoques estadísticos clásicos como algoritmos de aprendizaje automático. Entre estos, el modelo de bosques aleatorios presentó el mejor desempeño según las métricas MAE, RMSE y R². Los resultados evidencian que los siniestros mortales están significativamente asociados con infracciones como conducir bajo los efectos del alcohol o sustancias psicoactivas, así como ignorar señales de pare o semáforos en cruces viales. Además, se identificaron zonas de alto y bajo riesgo de fatalidad en la ciudad, lo cual permitió generar recomendaciones de intervención en infraestructura y programas de educación vial.Item Aplicación de ciencia de datos para proyección de saldos de productos de captaciones en entidad bancaria(Pontificia Universidad Javeriana de Cali, 2023) León Gil, Carlos Alberto; Pinzón Cortés, Mauricio; Arango Londoño, DavidLos datos son el insumo principal de un proyecto de ciencia de datos y a su vez hoy día son el activo más importante que se tiene en cualquier sector. Los resultados de la aplicación de técnicas de ciencia de datos para obtener valor y conocimiento, permiten la mejora continua en el proceso de toma de decisiones generando valor a nivel del negocio. Actualmente en el entorno financiero, se hace necesario hacer uso de la información para la toma de decisiones de una manera más eficiente y oportuna, no solo por buenas prácticas o temas de moda sino por supervivencia. En este sentido tener la mayor cantidad de información para la toma de decisiones hace que los modelos predictivos tengan bastante relevancia. Actualmente no se tiene definido un modelo de predicción de saldos de productos de captaciones para cuentas de ahorros y cuentas corrientes, el cual se hace necesario para poder generar estrategias en pro del mantenimiento o aumento de los saldos, con el fin de garantizar que exista el capital para realizar colocaciones y aumentar la utilidad neta del negocio.Item Aplicaciones de machine learning para la predicción de rendimientos y gestión de un portafolio de activos financieros en la BVC(Pontificia Universidad Javeriana Cali, 2023) Gómez Bravo, Juan Pablo; Suárez Mensa, Lizeth Fernanda; Quiñones Losada, Katherin Juliana; Arango Londoño, DavidLa teoría de portafolio se desarrolla en un ambiente de incertidumbre, es decir los inversionistas no conocen con certeza el resultado que puede obtenerse al realizar una inversión diversificada, por ende, este trabajo busca gestionar el riesgo de pérdida, mitigando la posibilidad de obtener rendimientos inferiores a los esperados, por lo anterior se realizó la estimación de volatilidad de cada uno de los activos que componen COLCAP, cotizados en la Bolsa de Valores de Colombia (BVC), mediante varias metodologías tradicionales y de Machine Learning buscando el mejor desempeño de dicha estimación, una vez obtenidos los resultados más eficientes por cada activo, se realizan múltiples comparaciones para determinar las covarianzas de los portafolios factibles. Para dar solución a la problemática, se hizo uso de un área fundamental del Machine Learning (Aprendizaje Automático) como lo es la predicción de series temporales, ya que contiene componentes de volatilidad, tendencia, etc. intrínsecas a su comportamiento. Una serie de observaciones tomadas cronológicamente en el tiempo se conoce como Serie de Tiempo. Se trabajarán con series de tiempo financieras a partir de las acciones más importantes de la BVC, con el objetivo de optimizar portafolios de inversión, que puedan resultar como solución a grandes inconvenientes que involucran cuantificar, medir e inclusive controlar el riesgo ante la exposición de inversión. Una vez obtenidos los resultados de pronóstico, mediante el Modelo de Markowitz, (independientemente de los activos seleccionados), se obtiene la distribución ideal de la inversión o distribución eficiente bajo mínimo riesgo de pérdida. Adicionalmente el inversionista cuenta con la posibilidad de calcular una frontera eficiente, fruto de asignar rendimientos mayores que el rendimiento obtenido para el portafolio de mínimo riesgo, así como la información de su Rendimiento, Varianza y VaR del portafolio. Finalmente, mediante Power BI, el inversionista podrá contar con el comportamiento de las tendencias de volatilidad de los activos de renta variable analizados en este trabajo, la posibilidad de elegir hasta un máximo de 5 activos de su interés y obtener la distribución eficiente de su inversión, así como la información referente a su portafolio mencionada previamente.Item Asignación inteligente de precios a artículos de calzado en una compañía de retail(Pontificia Universidad Javeriana Cali, 2025) Orozco Castaño, Gabriel; Arango Londoño, DavidEl proyecto tuvo como objetivo analizar el impacto de las variaciones de precios sobre la demanda de una empresa del sector calzado, buscando fortalecer su competitividad y sostenibilidad. Inicialmente, se propuso diseñar un algoritmo de optimización de precios basado en la elasticidad precio-demanda, sin embargo, el análisis de los datos históricos reveló que los cambios de precios no se realizaron bajo condiciones estadísticamente controladas, lo que impidió calcular una elasticidad confiable. Ante esta limitación, se redirigió el enfoque metodológico hacia la proyección de la demanda utilizando variables clave como el stock disponible, el precio promedio, los descuentos aplicados, la semana estacionaria y el comportamiento semanal de las ventas. El estudio se centró en productos de la categoría escolar. Aunque durante el desarrollo del estudio se exploraron distintos modelos de machine learning y de series de tiempo, ARIMAX y Prophet ofrecieron resultados satisfactorios en términos de precisión y ajuste a los datos. Tras una comparación detallada entre ambos, se optó por el modelo Prophet, ya que presentó un mejor rendimiento y un comportamiento más estable, lo que lo hace más adecuado para el contexto analizado. Este modelo permitió simular escenarios futuros de ventas para el año 2025, proporcionando a la empresa una herramienta predictiva robusta que mejora la toma de decisiones. Además, se identificaron oportunidades para optimizar la política de precios mediante la implementación de un sistema de asignación de precios más estructurado, lo que podría mejorar la relación entre el precio y la demanda, optimizando la estrategia comercial de la empresa.Item Clasificación de espectrogramas de audio con técnicas de aprendizaje profundo para el reconocimiento de sonidos urbanos(Pontificia Universidad Javeriana Cali, 2026) Domínguez Benítez, Juan Camilo; Jaramillo Giraldo, María Paula; Arroyo Marín, Andrés; Arango Londoño, DavidEl presente proyecto aplicado abordó la clasificación automática de sonidos urbanos mediante técnicas de aprendizaje profundo, utilizando espectrogramas Mel como representación visual de señales acústicas en la ciudad de Popayán, Cauca. Esta iniciativa nace con el propósito de fortalecer el monitoreo inteligente del paisaje sonoro urbano, considerando que la contaminación acústica es una problemática creciente con efectos sobre la salud física y mental, la calidad de vida y sostenimiento ambiental. Hoy en día, la clasificación manual de sonidos representa un proceso muy operativo, subjetivo y poco escalable debido a la mezcla o superposición constante de sonidos urbanos y a la ausencia de herramientas automatizadas para el reconocimiento de los tipos de sonidos. En este contexto, el objetivo principal consistió en diseñar un modelo basado en redes neuronales convolucionales capaz de clasificar sonidos urbanos según su origen: biofofía (sonido animales), geofonía (sonidos lluvias o viento), antropofonía (transporte motorizado, voces/ música). Para esto se trabajó con un conjunto de datos de 7.138 fragmentos de audio obtenidos a partir de 250 grabaciones recolectadas en 50 puntos del centro histórico de Popayán. Luego, las señales de audio fueron transformadas en espectrogramas de Mel, convirtiendo el sonido en imágenes para el reconocimiento visual mediante arquitecturas convolucionales de aprendizaje profundo. Se evaluaron diferentes arquitecturas mediante la búsqueda aleatoria de hiperparámetros, se incluyeron estrategias de transferencia de aprendizaje, aumento de datos y manejo de desbalance de clases. Como resultado, la arquitectura EfficientNetB0 presentó mejores resultados y desempeño, alcanzando un F1 macro de 0,51, un accuracy del 60,9% y un Balanced Accuracy de 0,59 sobre el conjunto de prueba. Con estos resultados, se evidencia la capacidad de un modelo para identificar patrones acústicos complejos en entornos urbanos y demuestran elo potencial de la inteligencia artificial al análisis de sonidos, con aplicaciones en monitoreo ambiental, control de contaminación acústica y apoyo a políticas públicas en las zonas.Item Construcción de un modelo para predecir ventas de unidades nuevas de vivienda en Cali por medio de técnicas de aprendizaje estadístico(Pontificia Universidad Javeriana Cali, 2024) Mora García, Jorge Hernán; Conde Chavarro, Leidy Lorena; Arango Londoño, DavidEl proyecto tiene como objetivo mejorar la precisión en la predicción de las transacciones de vivienda nueva en el futuro. Actualmente, la determinación de estas transacciones se basa en encuestas y sondeos de percepción de mercado, lo que limita la captura de información completa y actualizada sobre la situación real del mercado y la conducta de los posibles compradores. El proyecto consiste en la construcción de un modelo que utilice información secundaria para predecir las ventas de unidades nuevas de vivienda en el área del Distrito de Cali. Esta información secundaria incluye análisis de tendencias en Google Trends y variables macroeconómicas relevantes, como la inflación, el desempleo, las tasas de interés e indicadores agregados de percepción del consumidor y de desempeño de la economía. El enfoque se basa en técnicas de modelación estadística y métodos de aprendizaje automático supervisados, considerando que todos los datos son series temporales. El modelo realizado proporcionó un método eficaz para obtener predicciones tanto en el volumen como en la tendencia de venta de nuevas unidades de vivienda, respaldando así la toma de decisiones de política. Al utilizar técnicas de aprendizaje estadístico, se logró una mejor comprensión de los factores que influyen en las ventas de viviendas nuevas y, por lo tanto, se mejoró la capacidad de predecir las transacciones futuras. La modelación elaborada permite una planificación más eficiente de los recursos y una mejor comprensión de las dinámicas del mercado de viviendas nuevas en Cali. El proyecto propuso un modelo predictivo con técnicas de aprendizaje estadístico y datos secundarios que predice las ventas de unidades de viviendas nuevas en Cali, proporcionando así información más actualizada y precisa para respaldar la toma de decisiones en el sector de la construcción y servicios públicos, mejorando así la planificación y la comprensión del mercado.Item Estimación del precio de renta en predios rurales mediante modelación espacial en Colombia.(Pontificia Universidad Javariana Cali, 2024) Salgado Ramírez, Carlos Andrés; Arango Londoño, David; Bohórquez, Martha PatriciaLa Sociedad de Activos Especiales (SAE), que administra predios en extinción de dominio, actualmente está en el proceso de otorgar sus predios a diversas instituciones y comunidades para contribuir tanto a la soberanía alimentaria, como a otros sectores sociales del país. Para lograr esto, se deben establecer precios de renta justos y transparentes. Los métodos existentes para estimar la renta en predios rurales no han sido implementados hasta ahora en el país. Este proyecto desarrolla un modelo basado en técnicas de aprendizaje supervisado usando machine learning para estimar la renta de predios rurales en Colombia. El modelo incorpora la dependencia espacial, lo que permite una comprensión más profunda de las variaciones en los precios de renta. Este proyecto representa una oportunidad de innovación para la estimación de la renta en predios rurales y contribuye significativamente a la seguridad y soberanía alimentaria del país.Item Evaluación del efecto de la pandemia sobre la deforestación en Colombia por medio de imágenes de satélite y usando los datos de Terra-i(Pontificia Universidad Javeriana Cali, 2024) Anduquia Ramos, Manuel Andrés; Garcés Sevillano, Jesús Alberto; Arango Londoño, DavidEl objetivo de este proyecto fue evaluar el impacto que la pandemia del COVID-19 tuvo en los niveles de deforestación en Colombia. Se emplearon técnicas de ciencia de datos, que incluyeron modelos estadísticos mixtos y aprendizaje supervisado de máquinas, para analizar grandes volúmenes de datos provenientes de imágenes satelitales de la plataforma Terra-i, la cual monitorea la deforestación. Además, se utilizaron modelos estadísticos para comprender las relaciones y los factores que contribuyeron a la deforestación en áreas específicas identificadas. Estos modelos permitieron identificar patrones y tendencias, incluyendo factores específicos que pudieron haber influido durante la pandemia, buscando contribuir a la toma de decisiones informadas y a la formulación de estrategias más efectivas para la conservación y el manejo forestal en Colombia.Item Evaluación del impacto de modelos multivariados de machine learning en la precisión del pronóstico de ventas y su efecto en la gestión de la cadena de suministro(Pontificia Universidad Javeriana Cali, 2026) Vanegas Valencia, Mario Leandro; Sánchez Osorio, Edisson Camilo; Arango Londoño, DavidLa planeación de la demanda constituye un eje fundamental en la gestión de la cadena de suministro agroindustrial, un sector complejo por la influencia de variables estocástica como el clima, los costos de insumos y la volatilidad macroeconómica. La problemática centra de esta investigación radica en las limitaciones estructurales de los modelos predictivos univariados tradicionales, los cuales presentan una precisión reducida al omití factores externos. La consecuencia, el objetivo principal de este estudio es evaluar y comparar el desempeño predictivo de enfoques estadísticos clásicos (OLS y SARIMAX) frente a algoritmos multivariados de Machine Learning (Random Forest, LightGBM y Prophet). La metodología integró datos transaccionales históricos (2022-2025) de dos familias de productos (Palas y Carretas) con variables exógenas como índices climáticos zonales, abastecimiento agrícola (SIPSA) y tasas de cambio (TRM). El desempeño se evaluó mediante métricas estandarizadas (MAE,RMSE y MAPE) a través de una validación temporal walk-forward. Los resultados empíricos demostraron que la granularidad mensual domina significativamente en la estabilización de la señal predictiva frente a agregaciones diarias o semanales. Asimismo, se evidencia que predecir el volumen (Cantidad) y el Margen Bruto constituyen problemas predictivos disímiles; mientras que Random Forest logró el mejor desempeño en tres de las cuatro series analizadas (reduciendo el MAPE hasta un 14.8% en volumen), SARIMAX demostró ser más robusto para modelar el Margen bruto en series específicas. Se concluir que la adopción de modelos multivariados de ensamble, combinados con un preprocesamiento adecuado de la temporalidad y variables exógenas casuales, optimiza sustancialmente la planeación comercial y operativa en la agroindustria.Item Generación de alertas tempranas para reducir la mortalidad en accidentes de tránsito en Cali con datos históricos, mediante un modelo de patrones puntuales(Pontificia Universidad Javeriana Cali, 2025) Gordillo Álvarez, Gabriel Alejandro; Cuchumbe Escandón, Carlos Camilo; Arango Londoño, DavidEste estudio desarrolló un modelo de alerta temprana para prevenir desenlaces fatales de accidentes de tránsito en la ciudad de Cali, un problema crítico de salud pública con altos costos asociados a la pérdida de vidas humanas. Se preveía que la mortalidad por este tipo de sucesos sería una de las principales causas de muerte en los países en vías de desarrollo, y Cali no era ajena a esta tendencia mundial, con cifras que superan la media nacional. El objetivo principal fue identificar la correlación entre infracciones de tránsito y accidentes mortales mediante técnicas de patrones puntuales y modelos de aprendizaje automático explicable, con el fin de desarrollar un sistema de alertas tempranas para informar a autoridades y ciudadanos sobre conductas y zonas de riesgo. Los resultados obtenidos incluyeron un modelo predictivo del riesgo de accidentes de tránsito mortales a partir de las infracciones registradas, buscando una mejora en la movilidad urbana y en la eficiencia de la gestión de recursos. Las aplicaciones derivadas de este proyecto abarcan desde la implementación de políticas públicas y estrategias de intervención hasta la integración con sistemas de gestión de tráfico y planificación urbana. La disponibilidad de datos de infracciones y el uso de tecnologías avanzadas aseguraron la viabilidad del proyecto y su potencial para ofrecer soluciones efectivas y sostenibles para la mejora de la seguridad vial en Cali.Item Laguna(Pontificia Universidad Javeriana Cali, 2024) García Cifuentes, Santiago; Arango Londoño, DavidLos chatbot son un modelo de interacción persona-computadora, es decir, es un programa informático diseñado para simular una conversación con usuarios humanos y esto es lo que TuChat ofrece a sus clientes. Sin embargo, sus clientes necesitan utilizar la información que es recolectada por medio de los chatbots para perfeccionar la estrategia comercial. De esta manera, este proyecto propuesto explora con uno de los clientes de TuChat que se llama Las Ricuras de Sebastian y aprovechando la información obtenida a través de los chatbots, logra organizar el flujo de los datos de la organización donde realizando un análisis exploratorio, limpieza y consolidación de las bases de datos, se logra obtener información más precisa y coherente. La identificación de horarios de alta y baja demanda a lo largo del día se realiza para optimizar la oferta de productos y promociones. Además, se implementan modelos avanzados, incluyendo geocodificación para ubicar geográficamente a los clientes, análisis de sentimiento para evaluar la satisfacción del cliente y un modelo ARIMA para pronosticar las ventas futuras. La visualización y acceso a los datos se facilita mediante Google Cloud y Looker Studio, culminando en la presentación de un tablero de control integral. Esta herramienta proporciona a Las Ricuras de Sebastian una representación visual clara de diversos indicadores clave, incluyendo resultados generales, análisis temporal y georeferenciación, permitiendo la toma de decisiones informadas y la mejora continua de las operaciones comerciales.Item Modelo analítico para la predicción de garantías posventa en proyectos residenciales: aplicación en una empresa constructora colombiana(Pontificia Universidad Javeriana Cali, 2026) Castillo Narváez, Diana Camila; Contreras Macías, Maicol Stiven; Arango Londoño, DavidEste proyecto aplicado tuvo como objetivo desarrollar un modelo predictivo basado en técnicas de aprendizaje automático para estimar el comportamiento de las reclamaciones por garantías posventa en proyectos de vivienda entregados por una constructora en la ciudad de Cali. A partir del análisis de bases de datos históricas del sistema CRM, información de entregas de inmuebles, características técnicas de los proyectos, tipo de acabado y variables contextuales exploratorias, se buscó estimar la cantidad esperada, la categoría técnica y el momento de ocurrencia de las reclamaciones. El trabajo incluyó tareas de limpieza, integración y transformación de datos, homologación de proyectos y categorías de daño, construcción de la exposición mensual de inmuebles, ingeniería de características, selección de variables relevantes y evaluación de modelos supervisados de regresión. El modelo seleccionado fue XGBoost con variables de historial reciente, debido a que presentó el mejor equilibrio general entre las métricas evaluadas, incluyendo MAE, RMSE, R², MAPE sobre observaciones positivas y comparación entre totales reales y predichos. Como resultado, el modelo permitió generar predicciones futuras para apoyar la planeación operativa del área de posventa; para 2026 se estimó una carga aproximada de 4.247 locativas, con análisis por mes, proyecto y padre/capítulo técnico. En un sector como el de la construcción, con una gestión posventa tradicionalmente reactiva y con oportunidades de fortalecimiento en el uso analítico de los datos, esta propuesta representa una aplicación práctica de ciencia de datos para anticipar cargas de atención, priorizar recursos, identificar categorías críticas y apoyar la toma de decisiones basada en evidencia. El proyecto contribuye al fortalecimiento de la gestión proactiva de garantías y a la transformación digital del proceso posventa, dejando como producto un modelo predictivo reproducible y resultados estructurados para su consulta mediante una herramienta de visualización.Item Modelo de analítica de datos para apoyar la cobertura del aseguramiento en salud en el departamento de Cundinamarca(Pontificia Universidad Javeriana Cali, 2023) Dorado Daza, Derian Jesús; Arango Londoño, DavidEste trabajo aborda una problemática que con frecuencia se presenta en el procedimiento de Seguimiento a la Base de Datos del Aseguramiento en salud en el Departamento de Cundinamarca, que trata con la identificación de relaciones que no son evidentes por métodos tradicionales de análisis, entre distintas variables que caracterizan a los afiliados a los regímenes Subsidiado y Contributivo con el propósito de mejorar la toma de decisiones frente a la cobertura del aseguramiento y acceso a los servicios de salud. Plantea el diseño e implementación de un modelo de analítica de datos para mejorar la comprensión de estas relaciones recurriendo a conceptos y técnicas propias de la Ciencia de Datos.Item Modelo de predicción de precipitación acumulada para un departamento de Colombia por medio de la implementación de redes neuronales recurrentes (LSTM) e integración de datos satelitales.(Pontificia Universidad Javariana Cali, 2024) Mendoza García, María Camila; Lafaurie Suárez, Jonathan Andrés; Gómez Sepúlveda, Jorge Iván; Arango Londoño, DavidEste proyecto se enfoca en la predicción de la precipitación acumulada en el departamento del Valle del Cauca en Colombia, catalogada como una región que está altamente influenciada por factores climáticos variables dada su geografía y la ocurrencia de fenómenos temporales como “La Niña” o “El Niño”, los cuales generan cambios en los niveles de precipitación y afectan significativamente diversos sectores como la agricultura, la ganadería, el transporte y la economía en general. Dado esto, se desarrolla un modelo predictivo que hace uso de redes neuronales recurrentes (LSTM), a partir de información de precipitación observada (medidas terrestres) y satelital. Este enfoque, permite superar los limitantes de otros métodos convencionales de series de tiempo y, de esta forma, mejorar la precisión y el rendimiento de los modelos actuales. Los objetivos específicos en este proyecto incluyen factores como la selección del departamento más idóneo para la investigación, el análisis temporal y espacial de la base de datos empleada para el estudio, la instauración y evaluación del modelo LSTM y la comparación con otros modelos tradicionales de series de tiempo. Todo esto, está encaminado para el desarrollo de un modelo de predicción que logre estimaciones de la precipitación semanal acumulada. El proyecto, tiene como valor agregado la integración de información satelital por medio del procesamiento de imágenes satelitales y su potencial, radica en su aplicación en futuras investigaciones que puedan convertirla en un recurso valioso para diferentes agentes y autoridades relacionadas con el clima y la meteorología. Además, se aspira a que pueda escalarse hacia otras regiones del país, contribuyendo al manejo adecuado de recursos y la planificación meteorológica.Item Modelo estadístico para posible punto de atención en una entidad financiera(Pontificia Universidad Javeriana Cali, 2023) Galindres Bernal, Mabel Carolina; Fernández Bolaños, María Camila; Osorio Sierra, Santiago; Arango Londoño, DavidPara el desarrollo del presente trabajo, se realizó un estudio basado en los datos recolectados de las transacciones efectuadas por clientes empresariales y corporativos durante el primer semestre de 2022 en una entidad financiera de la ciudad de Santiago de Cali. El objetivo de este estudio fue desarrollar un modelo estadístico mediante la generación de indicadores, con el fin de identificar posibles zonas óptimas para abrir un punto de servicio adicional al existente (Oficina de Atención Empresarial), utilizando algún punto de atención asignados para atender a personas naturales. En este sentido, se llevó a cabo un proceso inicial de comprensión y análisis de los datos, seguido de un estudio exploratorio espacial de los datos. Posteriormente, se definier on cinco variables de estudio, a partir de las cuales se generaron imágenes de densidad y raster. Estas imágenes permitieron obtener cuatro indicadores que delimitarían las zonas óptimas. Finalmente, con base al análisis y comparativo de los gráficos de los indicadores, se seleccionó la ubicación del punto de servicio para clientes empresariales mediante la metodología de Análisis de Componentes Principales, generada en el indicador 4. El análisis previo determinó que la Oficina de San Nicolás Cali, situad a en la Cl. 20 #5 49, COMUNA 3, Cali, Valle del Cauca, sería la zona elegida para establecer el posible punto de atención.Item Modelo predictivo de puntualidad aérea (OTP) en Colombia basado en factores climáticos(Pontificia Universidad Javeriana Cali, 2025) Buitrago Martín, Daniel Mauricio; Martínez López, David Steven; Vidal Godoy, Paula; Arango Londoño, DavidLa puntualidad de los vuelos, medida a través del indicador On-Time Performance (OTP), constituye un aspecto crítico en la calidad del servicio aeronáutico y en la eficiencia operativa de las aerolíneas. En Colombia, las condiciones climáticas se han identificado como uno de los factores que más inciden en los retrasos, generando afectaciones operativas, sobrecostos y una disminución en la satisfacción del pasajero. Este estudio toma como unidad de análisis los vuelos comerciales domésticos operados en Colombia, integrando información histórica de desempeño operacional y variables meteorológicas. El horizonte temporal de análisis comprende datos entre 2019 y 2024, obtenidos de fuentes oficiales como Aerocivil, Cirium, Flightradar24, IDEAM, NOAA y reportes METAR. A partir de estos datos se desarrolla un modelo predictivo basado en técnicas de aprendizaje supervisado, específicamente Random Forest y XGBoost, con un proceso metodológico que incluye análisis exploratorio, selección de características, construcción del modelo y validación mediante métricas estándar de clasificación. El propósito es estimar la probabilidad de retraso y alcanzar un desempeño igual o superior al 85% de precisión, además de identificar las variables meteorológicas más influyentes en el comportamiento de la puntualidad aérea. Los resultados esperados buscan aportar una herramienta de apoyo para la toma de decisiones operativas, optimizar la planificación, reducir costos asociados a demoras y contribuir al fortalecimiento del sector aeronáutico colombiano.Item Modelo predictivo para estimar el crecimiento en la publicación de datos sobre biodiversidad: un enfoque basado en variables socioeconómicas y decisiones gubernamentales en el nodo GBIF Colombia(Pontificia Universidad Javeriana Cali, 2025) Ortiz Gallego, Ricardo; Badillo Mojica, Daniel; Arango Londoño, DavidLa disponibilidad y acceso a datos abiertos sobre biodiversidad son fundamentales para orientar estrategias de conservación y toma de decisiones. Sin embargo, la ausencia de herramientas predictivas que integren variables socioeconómicas y de gobernanza ha limitado la capacidad para anticipar su crecimiento y contribuir al cumplimiento de compromisos internacionales como la Meta 21 del Marco Mundial Kunming-Montreal. Este proyecto tuvo como objetivo desarrollar un modelo predictivo para estimar el crecimiento en la publicación de datos sobre biodiversidad en el nodo GBIF Colombia, combinando información socioeconómica y gubernamental. El proceso metodológico incluyó la recolección, depuración y análisis exploratorio de datos de fuentes principales como el Banco Mundial, GBIF y el Open Government Partnership, seguido de la implementación de modelos estadísticos como Efectos Fijos, LASSO, Ridge y modelos de aprendizaje automático como Random Forest, XGBoost, LSTM, evaluados mediante validación cruzada temporal. Destaca el mejor desempeño, estabilidad y capacidad para capturar la tendencia de crecimiento anual en la publicación de datos a través de un modelo híbrido (Ridge + Random Forest). El modelo propuesto ofrece una herramienta estratégica para proyectar escenarios de crecimiento a partir de variables socioeconómicas, apoyar la planificación y contribuir al cumplimiento de los compromisos internacionales sobre biodiversidad y ciencia abierta.