Repository logo
  • Communities & Collections
  • All of DSpace
  • English
  • Español
  • Log In
    New user? Click here to register.Have you forgotten your password?
  1. Home
  2. Browse by Subject

Browsing by Subject "Data science"

Now showing 1 - 19 of 19
Results Per Page
Sort Options
  • Loading...
    Thumbnail Image
    Item
    Análisis de oferta y demanda del aprovechamiento de residuos en Bogotá mediante aprendizaje no supervisado y ciencia de datos
    (Pontificia Universidad Javeriana Cali, 2026) Mendieta Sánchez, Diana Carolina; Hurtado Bolaños, Henry; Arango Londoño, David
    Bogotá D.C. genera aproximadamente 191.334 toneladas mensuales de residuos con potencial de aprovechamiento (Soluciones Empresariales DCA SAS, 2026), pero su sistema formal de reciclaje opera al 77,4% de la demanda estimada, dejando un déficit estructural de 43.309 ton/mes. A la fecha del estudio, el Registro Único de Recicladores de Oficio (RURO) de la UAESP registraba 29.495 recicladores formalizados (UAESP, 2026), mientras el Sistema Único de Información de la Superintendencia de Servicios Públicos Domiciliarios (SUI-SSPD, 2026) reportaba 430 organizaciones prestadoras del servicio de aprovechamiento. A pesar de la existencia de estos registros oficiales, ningún estudio previo los había integrado con un modelo de demanda territorial para calcular coberturas reales por localidad. Esta brecha motivó el presente proyecto, desarrollado por Diana Carolina Mendieta Sánchez, investigadora principal y representante legal de Soluciones Empresariales DCA SAS, empresa prestadora de servicios a través de asociaciones de recicladores en las 20 localidades de Bogotá y Henry Hurtado Bolaños, en el marco de la Maestría en Ciencia de Datos de la Pontificia Universidad Javeriana Cali. Bajo el marco metodológico CRISP-DM (Chapman et al., 2000), se integraron seis fuentes de datos oficiales heterogéneas mediante un pipeline ETL implementado en Python 3.12. Se aplicaron tres algoritmos de aprendizaje no supervisado K-Means (MacQueen, 1967), clustering jerárquico Ward y DBSCAN (Ester et al., 1996) sobre las 430 organizaciones formalizadas. El número óptimo de clústeres (K=4) se seleccionó mediante la evaluación simultánea de cuatro métricas de validación interna: coeficiente de silueta (0,487; Rousseeuw, 1987), índice Davies-Bouldin (0,854; Davies & Bouldin, 1979), índice Calinski-Harabász (17,59) y suma de cuadrados intra-clúster. La convergencia de los tres algoritmos en la misma solución K=4 confirma la robustez del resultado (Jain, 2010). Se identificaron cuatro tipologías operativas: grandes redes (13,9%, ~860 ton/mes), microoperadores (75,0%, ~208 ton/mes), organizaciones de baja eficiencia (8,3%) y organizaciones en situación crítica (2,8%). Un marco de zonificación territorial clasificó las 20 localidades en cinco cuadrantes de intervención mediante un Índice de Prioridad de Intervención (IPI) normalizado 0-100. Un hallazgo inesperado emergió de la integración de datos: el 94,7% de los recicladores registrados en el RURO (UAESP, 2026) opera fuera de su localidad de residencia. Este desajuste geográfico invalida los indicadores de cobertura calculados exclusivamente desde el SUI-SSPD: los superávits aparentes reportados como el 247,9% (GPS IDECA) en Puente Aranda o el 310% en Teusaquillo son artefactos del registro administrativo, no capacidad operativa real (Ferronato & Torretta, 2019; Moreno Rodríguez, 2018). Un modelo de programación lineal (PuLP, solver CBC, cuatro variantes) mostró que, bajo condiciones ideales de reasignación, redistribuir la capacidad existente sin nueva inversión cubriría teóricamente el 148,9% del déficit total del sistema, con un costo de transporte equivalente al 2,6% del costo operativo (Savelsbergh & Van Woensel, 2016). Este resultado se presenta como escenario exploratorio para apoyar la toma de decisiones, 4 reconociendo que la implementación real depende de restricciones institucionales, contractuales y económicas del sistema. Los resultados se desplegaron en un dashboard interactivo HTML5/Leaflet con 430 organizaciones georreferenciadas, una matriz de cuadrantes e insumos analíticos para la toma de decisiones de la UAESP y los operadores de las cinco Áreas de Servicio Exclusivo (ASE). Este trabajo constituye la primera cuantificación empírica basada en datos del desajuste oferta-demanda en el sistema formal de aprovechamiento de residuos en Bogotá a escala de organización prestadora individual.
  • Loading...
    Thumbnail Image
    Item
    Clasificación de emociones complejas en audio de conversaciones de Call Center de la Universidad Javeriana Cali mediante modelos semi supervisados de Machine Learning
    (Pontificia Universidad Javariana Cali, 2024) Ospina Cuesta, Julián Andrés; Álvarez Vargas, Gloria Inés; Linares Ospina, Diego Luis
    Este proyecto tuvo como objetivo identificar las expresiones emocionales complejas predominantes en llamadas del centro de contacto, para ofrecer una herramienta de medición en la satisfacción de clientes o evaluación de desempeño en la relación empleado-cliente. La problemática abordada se centró en ¿Cómo podría desarrollarse un modelo basado en técnicas de machine learning para la clasificación automática de emociones complejas en grabaciones de llamadas de un centro de contacto universitario, con el propósito de evaluar la satisfacción del cliente? El objetivo principal del proyecto fue desarrollar un modelo semi supervisado de machine learning para la clasificación automática de emociones en grabaciones de llamadas del call center de la Universidad Javeriana Cali, utilizando características acústicas. El alcance se limitó al análisis y clasificación de las emociones complejas predominantes identificadas en estas grabaciones, basándose en definiciones de emociones ajustadas a los objetivos del negocio. Los resultados de este proyecto incluyen: un conjunto de audios procesados y etiquetados de forma semi supervisada en las 'No llamadas', mientras que las 'Llamadas' fueron de manera supervisada; un modelo de clasificación automática de emociones que fue entrenado y validado, logrando una precisión del 95% en 'No llamadas' y del 41% en 'Llamadas'; y, por último, un prototipo de software diseñado como interfaz para cargar audios y clasificar las emociones según los modelos generados.
  • Loading...
    Thumbnail Image
    Item
    Clasificación de emociones en audios de call center utilizando ciencia de datos
    (Pontificia Universidad Javeriana Cali, 2025) Marulanda Almanza, Johan Sebastian; Álvarez Vargas, Gloria Inés; Linares Ospina, Diego Luis
    Este proyecto se desarrolló con el objetivo de clasificar emociones en llamadas de call center utilizando transcripciones de audio y técnicas de machine learning, tomando como caso de estudio el centro de contacto de una Universidad de Cali. La investigación se enmarca dentro de una iniciativa más amplia en la que se exploraron un enfoque de análisis de transcripciones textuales, el presente trabajo se centró exclusivamente en la información textual derivada de los audios, evaluando la efectividad de diferentes modelos de clasificación. El principal desafío fue desarrollar un clasificador capaz de identificar emociones de manera automatizada y eficiente a partir de datos textuales. Para ello, se realizó una limpieza y normalización de datos, seguida de un entrenamiento supervisado con modelos como Logistic Regression, Random Forest y Multi-Layer Perceptron (MLP). Se aplicó un ajuste de hiperparámetros utilizando Grid Search, optimizando el rendimiento de los modelos.
  • Loading...
    Thumbnail Image
    Item
    Correlación entre cobertura vegetal y niveles de contaminación del aire en los alrededores de Cali: un enfoque basado en análisis de datos satelitales e inteligencia artificial
    (Pontificia Universidad Javeriana Cali, 2025) Villarreal Monsalve, Alejandro; Osorio Serna, Carlos Andrés; Méndez Gutiérrez, Nicolás; Solano Correa, Yady Tatiana
    Este trabajo de maestría investiga la relación entre la infraestructura verde urbana y la calidad del aire en Santiago de Cali, empleando técnicas de Ciencia de Datos y teledetección. El objetivo central fue determinar la correlación estadística entre la densidad de la cobertura vegetal y las concentraciones de material particulado (𝑃𝑀10 y 𝑃𝑀2.5) en la ciudad. La metodología consistió en el desarrollo de un flujo de trabajo (ETL) que integró imágenes satelitales de alta resolución de la constelación PlanetScope con datos históricos (2017 2020) de seis estaciones de monitoreo oficiales (SVCASC). Para la clasificación de la cobertura del suelo, se evaluaron diversos algoritmos de aprendizaje automático, siendo Random Forest el de mejor desempeño con una exactitud del 83.33%, superando a modelos como XGBoost y SVM. Los resultados arrojaron una correlación global de Pearson de 𝑟 = −0.37, confirmando que existe una relación inversa moderada: a mayor vegetación, menor contaminación. No obstante, el estudio destacó hallazgos críticos sobre la distribución espacial del problema. En el centro (estaciones Obrero y La Ermita), el efecto de "cañón urbano" y la alta densidad de emisiones saturan la capacidad de mitigación de la vegetación existente. Simultáneamente, se identificó una profunda desigualdad ambiental en el oriente de la ciudad (estación Compartir), donde la pérdida acelerada de cobertura vegetal coincide con un aumento en los niveles de 𝑃𝑀2.5. Se concluye que, si bien la vegetación actúa como un filtro natural funcional, en muchas zonas de Cali se encuentra saturada o es insuficiente. El estudio recomienda integrar urgentemente estrategias de expansión de áreas verdes en la planificación territorial para mejorar la salud pública.
  • Loading...
    Thumbnail Image
    Item
    Desarrollo de modelo para identificación de características positivas/negativas de producto en comentarios en plataforma e-commerce usando aprendizaje automático
    (Pontificia Universidad Javeriana Cali, 2025) Villa Ramos, Jhilbran; Ibarra Enríquez, Santiago; Álvarez Vargas, Gloria Inés; Linares Ospina, Diego Luis
    Este proyecto busca desarrollar una herramienta de análisis de sentimientos automatizada para evaluar comentarios en plataformas de comercio electrónico mediante técnicas de Machine Learning. El objetivo principal es identificar características positivas y negativas en las reseñas de los usuarios, permitiendo a las empresas mejorar su reputación, abordar rápidamente comentarios negativos, optimizar productos y servicios, y diseñar estrategias de marketing más efectivas. La metodología del proyecto se divide en dos etapas principales: preparación de datos e implementación del modelo. En la primera etapa, se realiza la adquisición de datos a partir de comentarios de usuarios, seguida de un proceso de limpieza y transformación del texto para eliminar ruido y normalizar los datos. Posteriormente, se aplican técnicas de incrustación de palabras como Word2Vec y GloVe, junto con métodos léxicos tradicionales (Bag-of-Words, TFIDF, One-Hot Encoding) para convertir el texto en representaciones vectoriales adecuadas para el análisis. En la fase de implementación, se entrenan y comparan distintos modelos de clasificación, utilizando los embeddings generados. Adicionalmente, se aplica modelado de temas (LDA) para identificar patrones en los comentarios. Finalmente, se generan visualizaciones interactivas que permiten una comprensión clara de los resultados.
  • Loading...
    Thumbnail Image
    Item
    Determinantes de la pobreza monetaria en Colombia: Un enfoque integral mediante ciencia de datos y técnicas de Machine Learning
    (Pontificia Universidad Javeriana Cali, 2025) Restrepo Castaño, Daniel Gabriel; González Gómez, Daniel Enrique
    Este proyecto aborda la identificación de los principales determinantes de la pobreza monetaria en Colombia mediante un enfoque integral basado en ciencia de datos y técnicas de aprendizaje automático. A partir de un análisis exhaustivo de factores socioeconómicos, demográficos y de vivienda, se desarrollarán modelos predictivos que permitirán identificar hogares en riesgo de caer en la pobreza. Se utilizarán datos de la Gran Encuesta Integrada de Hogares (GEIH) del DANE y otros conjuntos de datos, aplicando técnicas avanzadas de análisis y modelado para mejorar la comprensión de la pobreza. Los resultados proporcionarán evidencia clave para el diseño de políticas públicas más focalizadas y efectivas en la reducción de la pobreza monetaria en el país.
  • Loading...
    Thumbnail Image
    Item
    “Diseminación selectiva de la información usando ciencia de datos: recomendación de libros y lecturas en las bibliotecas Comfama”
    (Pontificia Universidad Javariana Cali, 2024) Bedoya Henao, Edwin José; Álvarez Vargas, Gloria Inés; Linares Ospina, Diego Luis
    Este proyecto se enfoca en el desarrollo de un sistema de recomendación de libros para las Bibliotecas Comfama, con el objetivo de mejorar la experiencia de los usuarios al proporcionar sugerencias personalizadas basadas en sus preferencias de lectura y comportamiento histórico. La relevancia del proyecto radica en abordar el problema de la infoxicación, o sobrecarga de información, en un entorno donde la vasta cantidad de materiales disponibles dificulta la selección de lecturas adecuadas para cada usuario. El sistema de recomendación se construyó utilizando técnicas avanzadas de ciencia de datos, como modelos de agrupación (K-Means) y representaciones vectoriales de libros mediante Word2Vec, lo que permite identificar patrones de lectura y preferencias individuales. A partir de esta estructura, se generaron recomendaciones altamente precisas y personalizadas que optimizan el servicio de préstamo de las Bibliotecas Comfama, aumentando así la satisfacción de los usuarios. El sistema se fundamenta en una estructura de datos que integra tanto características demográficas como el historial de préstamos y consultas de cada usuario, lo que facilita la identificación de perfiles de lectores y la agrupación de usuarios con intereses similares. Como resultado, el proyecto ofrece un sistema innovador que promueve el uso más frecuente y eficiente de los servicios bibliotecarios, fortaleciendo el papel de las bibliotecas en la promoción de la cultura y el conocimiento. Este enfoque tiene aplicaciones potenciales más allá del ámbito bibliotecario, con posibilidades de implementación en sectores como el comercio electrónico o la selección de contenido digital, aprovechando las capacidades de la ciencia de datos para anticipar y satisfacer las preferencias individuales de los usuarios.
  • Loading...
    Thumbnail Image
    Item
    Modelado de emisiones de CO₂ per cápita a partir de factores socioeconómicos con técnicas de ciencia de datos: una aproximación a la desigualdad climática en América Latina
    (Pontificia Universidad Javeriana Cali, 2026) Collazos Valenzuela, Angie Catherine; Guzmán Diaz, Sandra Patricia; Merchán Burgos, Jhonatan Luis; Pencue-Fierro, Edgar Leonairo
    El presente proyecto aplicado desarrolla un modelo de ciencia de datos para analizar y predecir las emisiones de CO₂ per cápita en función de factores socioeconómicos en 17 países de América Latina, con el propósito de evidenciar patrones estructurales de desigualdad climática en la región. La investigación partió de la integración de múltiples fuentes públicas EDGAR, Banco Mundial y PNUD conformando un panel país-año de 527 observaciones para el período 1990–2020, con 15 variables socioeconómicas, energéticas y ambientales. Tras un proceso riguroso de depuración, estandarización e imputación por interpolación lineal validada, se realizó un análisis exploratorio que identificó al consumo energético, el PIB per cápita y el Índice de Desarrollo Humano como los principales correlatos de las emisiones per cápita. Se implementó una estrategia de modelado dual: modelos econométricos de datos panel con efectos fijos y aleatorios, y cinco algoritmos de aprendizaje automático, Random Forest, XGBoost, KNN, MLP y Support Vector Regression, optimizados mediante GridSearchCV con validación cruzada de cinco pliegues. Entre los algoritmos evaluados, el modelo K-Nearest Neighbors (KNN) alcanzó el mejor desempeño sobre el conjunto de prueba temporal (R² = 0,736; RMSE = 0,250; MAE = 0,174), seguido por XGBoost (R² = 0,728). El análisis SHAP confirmó al consumo de energía, el PIB per cápita y el área selvática como los determinantes de mayor impacto predictivo. Como extensión metodológica, modelos de clasificación multiclase alcanzaron un F1-score de 0,884. Los hallazgos se sintetizaron en un tablero interactivo que facilita la exploración regional y la simulación de escenarios de política energética. Los resultados confirman que la desigualdad climática en América Latina es producto de la interacción entre intensidad energética, desarrollo económico y condiciones sociales. El modelo constituye un insumo técnico para el diseño de políticas de transición energética justa y diferenciada en la región.
  • Loading...
    Thumbnail Image
    Item
    Modelo de clasificación para predecir la salud mental en estudiantes universitarios en Cali: Un enfoque basado en algoritmos desde el modelo de determinantes sociales de la salud
    (Pontificia Universidad Javeriana Cali, 2024) Chaparro Jiménez, Alix Meryam; Ruiz Chacón, Gustavo Adolfo; Charry Jiménez, Jorge Iván; Rocha Niño, Hernán Camilo; Cadavid Ruiz, Natalia
    Comprender los factores asociados con la salud mental de los estudiantes universitarios es de suma importancia en la sociedad actual. Con la intención de abordar este panorama, se realizó un estudio predictivo para identificar los determinantes sociales de la salud que inciden en la percepción de tres aspectos de salud mental negativa y tres de salud mental positiva de estudiantes de pregrado de una institución educativa en Cali. Para ello, se utilizó un enfoque basado en algoritmos en el cual se emplearon datos de 2.786 estudiantes universitarios, documentándose el desarrollo de cuatro modelos de clasificación y su ejecución para cada una de las variables a predecir
  • Loading...
    Thumbnail Image
    Item
    Modelo de Machine Learning para la Identificación de Pólipos en Imágenes de Colonoscopia
    (Pontificia Universidad Javeriana Cali, 2025) Alba Talero, Jairo Enrique; Linares Ospina, Diego Luis; Álvarez Vargas, Gloria Inés
    Un pólipo en el colon es una acumulación pequeña de células formado en el revestimiento del colon. En su mayoría los pólipos no causan daños o alteraciones, sin embargo, algunos de ellos pueden crecer y transformarse en tumores pre-cancerosos o cancerosos, por lo que la detección de los mismos a través de la prueba gold standard, la colonoscopia, es de gran importancia clínica. Un problema en la identificación de estos pólipos es que muchos de ellos se pasan por alto en el momento de realizar el examen, por lo que se propuso elaborar un algoritmo de aprendizaje profundo para que, a través de imágenes, se pueda asistir la interpretación de las imágenes. Se recopilaron imágenes de colonoscopias obtenidas durante procedimientos médicos. Las imágenes se seleccionaron, clasificaron y etiquetaron con la ayuda de expertos para garantizar su calidad e integridad para luego hacer uso de ellas.
  • Loading...
    Thumbnail Image
    Item
    Modelo predictivo para estimar la humedad del suelo en cultivos del CIAT usando técnicas de aprendizaje automático
    (Pontificia Universidad Javeriana Cali, 2025) Paternina Miranda, Fabio Andrés; Zárate Jiménez, Juliana; Álvarez Vargas, Gloria Inés; Barrios Pérez, Camilo
    El presente trabajo desarrolló un modelo predictivo para la estimación de la humedad volumétrica del suelo a partir de la integración de variables espectrales, climáticas y edáficas, empleando técnicas avanzadas de aprendizaje automático y análisis multifuente. El estudio se realizó en parcelas experimentales del Centro Internacional de Agricultura Tropical (CIAT), utilizando datos provenientes de sensores de humedad del suelo, imágenes satelitales PlanetScope (índices NDVI, EVI, NDMI y NDWI) y registros meteorológicos locales (precipitación, temperatura, radiación solar, evapotranspiración y velocidad del viento). El proceso metodológico incluyó un análisis exploratorio para evaluar la calidad y distribución de los datos, identificar correlaciones significativas y eliminar redundancias entre variables. Posteriormente, se seleccionaron nueve variables predictoras finales que representaron de forma eficiente los componentes hidrológicos, energéticos y vegetativos del sistema suelo–planta–atmósfera. Cinco algoritmos fueron evaluados en la fase de modelado: XGBoost, Random Forest, Support Vector Regression (SVR), Multi-Layer Perceptron (MLP) y K-Nearest Neighbors (KNN). Tras un proceso de optimización mediante GridSearchCV y validación cruzada K-Fold (k = 5), el modelo XGBoost optimizado se consolidó como la alternativa más precisa y estable, alcanzando un desempeño sobresaliente (R² = 0.96; MAE = 1.95; RMSE = 2.94). Este resultado evidenció su capacidad para capturar relaciones no lineales y manejar la multicolinealidad entre variables, superando a los demás algoritmos en generalización y eficiencia computacional. Como aplicación práctica, se desarrolló una interfaz web interactiva que permite realizar predicciones en tiempo real de la humedad del suelo a partir de datos climáticos y satelitales ingresados por el usuario. La interfaz integra visualizaciones dinámicas y un sistema de clasificación por categorías de humedad (muy baja, baja, media y alta), facilitando la interpretación de los resultados y la toma de decisiones agronómicas.
  • Loading...
    Thumbnail Image
    Item
    Modelo predictivo para la detección temprana del riesgo de suicidio en policías de Colombia
    (Pontificia Universidad Javeriana Cali, 2026) Caicedo Henríquez, Valentina; Barbosa Rodríguez, Mario Fernando; Torres Romero, Juan Sebastián; Arango Londoño, David
    El suicidio en la Policía Nacional de Colombia representa un problema crítico de salud pública institucional: en 2011 la tasa alcanzó 18 por cada 100.000 efectivos, triplicando la tasa nacional. Este proyecto aplicado desarrolló un modelo predictivo de detección temprana del riesgo de suicidio en policías activos utilizando una base de datos institucional inédita de la Dirección de Sanidad de la Policía Nacional (DISAN PONAL) con 254 casos confirmados, bajo un diseño caso-control retrospectivo con ventana de observación de 24 meses y horizonte de predicción de 90 días. Se construyeron 42 variables predictoras a partir de fuentes clínicas, laborales y sociodemográficas. Se evaluaron cuatro algoritmos —Regresión Logística, Random Forest, XGBoost y LightGBM— bajo escenarios de desbalance 5:1 y 10:1. El modelo LightGBM en escenario 5:1 obtuvo el mejor desempeño en validación cruzada: AUC-PR = 0.9587, AUC-ROC = 0.9888, F1 = 0.9095, Precisión = 0.919 y Recall = 0.902. Una auditoría de data leakage de cuatro capas redujo el AUC-PR de 1.000 a 0.9587, confirmando la ausencia de contaminación metodológica. La validación temporal (hold-out 2022–2025) reveló una degradación significativa en la métrica primaria (AUC-PR: 0.9587 → 0.6553, −32%), indicando que el modelo requiere recalibración antes del despliegue operativo. El análisis SHAP identificó como predictores dominantes los indicadores de utilización general del sistema de salud —tasa de diagnósticos acumulados, polimedicación, antigüedad institucional y edad— no exclusivamente de salud mental formal. Se calculó el PPV esperado bajo prevalencia real, mostrando que el despliegue directo sobre el universo de efectivos requiere estratificación previa de una subcohorte de riesgo. El análisis de equidad por subgrupos reveló brechas de Recall entre hombres y mujeres y entre policías de alta y baja antigüedad, documentadas como limitaciones. El trabajo aporta un protocolo replicable de auditoría de leakage para diseños caso-control retrospectivos en contextos de salud institucional y un conjunto de seis indicadores de riesgo con potencial de integración en programas preventivos de la DISAN.
  • Loading...
    Thumbnail Image
    Item
    Modelo predictivo para la identificación de la enfermedad producida por la plaga Heilipus Lauri en el cultivo de aguacate Hass en Colombia, por medio del procesamiento y clasificación de imágenes con aplicación de técnicas de Machine Learning
    (Pontificia Universidad Javeriana Cali, 2024) Carvajal Jaramillo, Karen Andrea; Castro Collazos, Mauricio; Riveros Pulgarín, Ramón Siddartha; Arango Londoño, David
    Las enfermedades causadas por el insecto-plaga Heilipus Lauri son una de las principales causantes de los daños en los cultivos de aguacate Hass, adicionalmente reducen la calidad de los cultivos al generar problemas fitosanitarios que dificultan alcanzar el potencial exportador de este producto. Por lo cual, el presente proyecto plantea entrenar y evaluar un algoritmo de clasificación de imágenes con el uso de técnicas de aprendizaje automático, con el uso de un banco de imágenes recolectadas por Agrosavia, para la construcción de una herramienta que pueda ser usada por los pequeños y medianos productores de este fruto, que sirva para el control y monitoreo del daño causado por estas plagas. Además, se espera que este proyecto sirva como marco de referencia para futuras investigaciones en el sector agropecuario y académico en el ámbito de procesamiento y clasificación de imágenes.
  • Loading...
    Thumbnail Image
    Item
    Pluralistic homophily in networks
    (Pontificia Universidad Javeriana Cali, 2025) Barraza Alvarado, Fernando; Fernández, Alejandro; Ramírez Ovalle, Carlos Ernesto
    Este trabajo introduce el concepto de Homofilia Pluralista Local como una métrica orientada a identificar nodos cuya tendencia es conectarse con otros nodos con los que comparten similitudes, en términos de las comunidades que tienen en común. Con base en fundamentos teóricos de redes complejas, se propone una ecuación que cuantifica la asortatividad local de cada nodo como función del solapamiento comunitario con sus vecinos. Esta formulación establece un soporte analítico aplicable a estudios de difusión de información, epidemiología y fragmentación estructural en redes complejas.
  • Loading...
    Thumbnail Image
    Item
    Predicción de avistamientos de aves para la conservación de especies endémicas utilizando algoritmos de aprendizaje automático
    (Pontificia Universidad Javeriana Cali, 2025) López Arango, Paula Andrea; Escobar Martínez, María Victoria; Blandón Castaño, Juan Sebastián
    El presente proyecto muestra los resultados sobre predicción de avistamientos de aves para la conservación de especie endémicas mediante la aplicación de algoritmos de Aprendizaje de Automático. La región de América Latina y el Caribe tiene dos características que hacen que el estudio de los efectos del cambio climático sobre la biodiversidad resulte particularmente relevante: i) es una de las regiones más vulnerables frente al cambio climático y ii) es una de las regiones con mayor concentración de biodiversidad del planeta. En Colombia hay aproximadamente el 20 % de las especies de aves del planeta, convirtiéndose en el país con la mayor diversidad en este ámbito, con un número de especies registradas para el 2020 de 1954, y de las cuales 82 eran endémicas. De esta forma, se desarrolló una metodología de predicción de avistamientos de aves con el fin de aportar insumos para la conservación de especies endémicas a partir de algoritmos de ML. Los resultados de la investigación consistieron en implementar algoritmos en Python/R que aporten a la gestión de datos de avistamientos de aves, además permitiendo tratar datos georreferenciados de variables exógenas, para establecer correlaciones entre estas y datos de avistamientos de aves. El módulo de algoritmos de Modelos de Distribución de Especies permitió la identificación de áreas críticas para la conservación y el desarrollo y/o fortalecimiento del aviturismo para ciertos niveles de amenaza y departamentos específicos. Además, estos resultados llevaron a la generación de conocimiento que sirve de insumo para el desarrollo de planes de conservación y/o planificación del aviturismo en las regiones identificadas.
  • Loading...
    Thumbnail Image
    Item
    Predicción de fallas prematuras de componentes en una flota de camiones mineros utilizando ciencia de datos
    (Pontificia Universidad Javeriana Cali, 2025) Martínez Morales, Christian Andrés; Perdomo Olarte, Juan Camilo; García Arboleda, Isabel Cristina
    La temática del proyecto aplicado se relaciona con la predicción de fallas de componentes de una flota determinada de camiones mineros. La problemática que se abordó consistió en que la flota había estado experimentando fallas prematuras en varios de sus componentes, a lo que la fábrica de dichos camiones argumentaba que estos eventos no correspondían a un problema de producto sino más bien a una naturaleza severa de la operación, sin embargo, se desconocía cuáles aspectos de la operación eran los influyentes en la generación de dichas fallas. La minera había manifestado la importancia de predecir este tipo de eventos ya que tenían el potencial de impactar aspectos importantes como la seguridad y salud de los operadores, el cuidado del activo y la producción de la minera convirtiéndose en una problemática en la que participaban interesados como el departamento de producción, mantenimiento, logística e, incluso, la fábrica de los camiones. El objetivo del proyecto fue entonces predecir fallas prematuras de dichos componentes para que la minera pudiera anticiparlas y realizar planes de acción preventivos a partir del análisis de datos disponibles e historial de fallos, del desarrollo de modelos predictivos, la evaluación de dichos modelos y el prototipado de una interfaz gráfica para el seguimiento y control de fallas prematuras. Se generaron 8 modelos por componente utilizando técnicas como Random Forest, XGBoost, Perceptrónes Multicapa y Regresión Logística, a partir de los cuales se pudieron predecir fallas de 6 tipos de componentes con precisiones superiores al 84%. A partir del análisis de importancia proporcionado por el XGBoost, se encontró que los aspectos de la operación que más influyen en la aparición de fallas prematuras son las microfalla por torsión, los valores de torsión y la carga acarreada por el camión ciclo a ciclo. Finalmente, se generó un prototipo de interfaz gráfica para seguimiento y control de dichos aspectos.
  • Loading...
    Thumbnail Image
    Item
    Predicción de la supervivencia en pacientes con cáncer de estómago: integración de características clínicas, genéticas y análisis de imágenes para el apoyo en la toma de decisiones clínicas
    (Pontificia Universidad Javeriana Cali, 2025) López León, William Andrés; Parra Barrera, Eliana Liseth; Meneses Ramírez, Karem Dayana; Tobar Tosse, Henry Fabián
    El cáncer gástrico continúa siendo uno de los principales desafíos en salud pública a nivel mundial, no solo por su elevada mortalidad, sino también por las limitaciones actuales para estratificar adecuadamente el riesgo y personalizar las decisiones terapéuticas. A pesar de los avances diagnósticos y moleculares, la predicción de supervivencia sigue siendo imprecisa debido a la heterogeneidad tumoral y a la fragmentación de la información clínica y genómica. En este escenario, los modelos integrativos basados en ciencia de datos representan una oportunidad para mejorar el pronóstico y apoyar de manera objetiva la toma de decisiones clínicas. Este proyecto tuvo como objetivo desarrollar y evaluar modelos de predicción de supervivencia en cáncer gástrico mediante la integración de variables clínicas (edad, sexo, estadio TNM, grado histológico), perfiles de expresión de miRNA y características cuantitativas derivadas de imágenes histopatológicas digitales H&E. Para ello, se emplearon datos del repositorio TCGA STAD del National Cancer Institute, incluyendo tablas clínicas, matrices de expresión miRNA-seq y Whole Slide Images en formato SVS. El pipeline metodológico incluyó: (1) preprocesamiento clínico con imputación y estandarización; (2) selección de miRNA mediante análisis de expresión diferencial y pruebas univariadas; (3) normalización de color y extracción de parches tisulares con OpenSlide; (4) extracción de características morfológicas, estructurales y texturales con un enfoque interpretable desde criterios histopatológicos; y (5) agregación estadística por paciente. Con este conjunto multimodal se entrenaron tres modelos de supervivencia ampliamente utilizados: Coxnet penalizado, Random Survival Forest (RSF) y DeepSurv, optimizados mediante búsqueda aleatoria y validación interna. Entre las estrategias evaluadas, el modelo Coxnet penalizado se consolidó como el más robusto e interpretable para la predicción de supervivencia en la cohorte TCGA-STAD. Este alcanzó un C index de 0.7315 y valores de AUC(t) de 0.784, 0.758 y 0.760 a 1, 3 y 5 años, respectivamente. El Brier Score obtenido (0.1441) evidenció una adecuada calibración, mientras que las curvas de Kaplan–Meier mostraron una separación significativa entre los grupos de riesgo (log-rank p = 1.36 × 10⁻⁴), confirmando su utilidad para estratificar pacientes según su pronóstico. En conjunto, estos resultados demuestran que los enfoques multimodales permiten capturar de manera más completa la heterogeneidad biológica del cáncer gástrico y proporcionan herramientas predictivas superiores al análisis clínico tradicional, favoreciendo una estratificación temprana del riesgo y decisiones terapéuticas más precisas.
  • Loading...
    Thumbnail Image
    Item
    Predicción de tasa de interés y su relación con los indicadores económicos mediante Ciencia de Datos
    (Pontificia Universidad Javariana Cali, 2024) Meza Pastrana, Sebastián Javier; Arango Londoño, David
    El presente proyecto aborda la predicción de la Tasa de Intervención de Política Monetaria en Colombia, una variable crucial para la estabilidad macroeconómica y la toma de decisiones en política económica. Dada la relevancia de esta tasa para regular la liquidez, influir en las decisiones de inversión y financiamiento, y estabilizar los precios, se exploraron enfoques avanzados de predicción mediante modelos de Machine Learning, contrastándolos con un modelo econométrico tradicional de regresión lineal múltiple. La problemática identificada radica en las limitaciones de los enfoques econométricos lineales para capturar relaciones no lineales y manejar conjuntos de datos de alta dimensionalidad. Con base en esta problemática, el proyecto tuvo como objetivos principales identificar las variables macroeconómicas más relevantes, evaluar la precisión de diferentes algoritmos de Machine Learning (Ridge, Lasso, Random Forest, XGBoost y SVR) y comparar su desempeño con el modelo econométrico. Los resultados evidenciaron que los modelos de Machine Learning, en particular XGBoost y Random Forest, lograron un mejor desempeño predictivo con errores promedio más bajos (MSE de 0.11 y 0.16, respectivamente) y mayor capacidad explicativa (R² superior a 0.97 en prueba). Por otro lado, el modelo econométrico, aunque respaldado por fundamentos teóricos sólidos, se quedó corto en precisión y capacidad para capturar patrones complejos, presentando autocorrelación y heterocedasticidad en los residuos. Además, se implementaron herramientas como SHAP para mejorar la interpretabilidad de los modelos avanzados, identificando las variables macroeconómicas más influyentes en las predicciones. Este análisis integral no solo subraya la relevancia de la tasa de política monetaria para la estabilidad económica, sino que también demuestra la importancia de integrar métodos avanzados para lograr predicciones precisas y proporcionar herramientas útiles para la toma de decisiones en entornos de alta incertidumbre. Las aplicaciones de este trabajo incluyen el fortalecimiento de la planificación financiera y el diseño de políticas públicas más informadas, así como la mejora en la gestión de riesgos económicos en sectores como el financiero y el empresarial. Los hallazgos refuerzan la necesidad de métodos modernos en el análisis de variables clave para enfrentar los retos dinámicos de las economías modernas
  • Loading...
    Thumbnail Image
    Item
    Predicción del valor del suelo en Bogotá en zonas de adopción de planes parciales usando técnicas de aprendizaje automático
    (Pontificia Universidad Javeriana Cali, 2026) Segura Herrera, Ángela; Rodríguez Narváez, Ángela; Nieto Gómez, Ángela; Arango Londoño, David
    La falta de análisis sobre el cambio del valor del suelo tras la adopción de planes parciales ha favorecido procesos de especulación y ha generado desacuerdos entre los actores involucrados. Estas situaciones pueden derivar en modificaciones de los planes, así como retrasos en su formulación, adopción y en el reparto equitativo de cargas y beneficios. El presente proyecto tuvo como objetivo analizar y predecir el comportamiento del valor del suelo en Bogotá en zonas de adopción de planes parciales, utilizando técnicas de aprendizaje automático, a partir de variables de accesibilidad, físicas, socioeconómicas, de uso del suelo, temporales y asociadas con la intervención de Planes Parciales. Para ello, se realizó un proceso de integración, depuración y transformación de información proveniente de diferentes fuentes geográficas y catastrales, disponibles en los portales de datos abiertos del Distrito Capital de Bogotá, permitiendo construir modelos predictivos orientados a identificar patrones asociados a la variación del valor del suelo. Durante el estudio se realizó un análisis de impacto utilizando el método de Diferencias en Diferencias (DiD), con el fin de evaluar el comportamiento del valor del suelo antes y después de la adopción de planes parciales en Bogotá. Posteriormente, se evaluaron diferentes metodologías de aprendizaje automático, incluyendo Regresión Lineal Múltiple, Máquinas de Soporte Vectorial (SVM), XGBoost y Random Forest. Los resultados obtenidos evidenciaron que el modelo Random Forest presentó el mejor desempeño predictivo, alcanzando el mayor coeficiente de determinación y los menores errores de predicción entre los modelos evaluados, permitiendo representar de manera más adecuada la complejidad espacial y económica asociada al comportamiento del valor del suelo (metro cuadrado por manzana) en Bogotá. Posteriormente, mediante un proceso de inferencia espacial, el modelo seleccionado fue aplicado sobre la totalidad de las manzanas de la ciudad, con el propósito de identificar patrones territoriales asociados al comportamiento del valor del suelo y ampliar la interpretación visual de los resultados más allá de las zonas inicialmente utilizadas para el entrenamiento del modelo, correspondientes a las manzanas donde se localizaron los planes parciales adoptados y sus áreas de influencia. Lo anterior facilitó el análisis exploratorio de tendencias espaciales relacionadas con la dinámica urbana y la adopción de estos instrumentos de planificación territorial, así como el desarrollo de una herramienta de visualización para comunicar de manera clara e interactiva los resultados obtenidos, constituyendo un insumo potencial para futuros procesos de planificación, análisis territorial y gestión del suelo en la ciudad de Bogotá.
logo-javeriana

Pontificia Universidad Javeriana Cali

Calle 18 No 118-250 Cali, Colombia

Teléfono:(+57) 602-321-82-00/602-485-64-00 - Línea gratuita nacional 01-8000-180556

Contacto repositorio Vitela: vitela@javerianacali.edu.co

  • Cookie settings
  • Privacy policy
  • End User Agreement
  • Send Feedback