Browsing by Subject "Aprendizaje no supervisado"
Now showing 1 - 4 of 4
Results Per Page
Sort Options
Item Análisis de la deforestación en la Amazonía colombiana usando técnicas de aprendizaje automático(Pontificia Universidad Javeriana Cali, 2023) León Acosta, Paola Andrea; Otero Martínez, Guillermo AndrésDebido al alto impacto de la deforestación en el calentamiento global, el aumento de enfermedades zoonóticas y el riesgo de extinción de la biodiversidad, surge la necesidad de desarrollar nuevos enfoques para la medición y análisis de la deforestación que permitan a los gobiernos tener una mejor compresión de este fenómeno para centrar su atención y recursos a atender esta crisis ambiental en las zonas más vulnerables. Dada esta situación y considerando el amplio uso de los algoritmos de aprendizaje automático para analizar datos complejos como imágenes y textos, este proyecto tuvo como objetivo analizar el comportamiento de la deforestación en la Amazonía colombiana usando diferentes técnicas de aprendizaje automático con imágenes satelitales de Google earth engine, considerando estas metodologías como nuevas propuestas de medición en el análisis de la cobertura forestal. Posteriormente, se evaluaron estos modelos mediante métricas de evaluación, una vez seleccionado el modelo con mejor rendimiento, se identificaron las zonas con deforestación en las imágenes satelitales, y a partir de estos resultados se cuantificó y analizó el incremento de la perdida de bosques en un periodo determinado con el propósito de generar alertas de las zonas más vulnerables, y así brindar una herramienta que se pueda considerar como un insight para la formulación de planes de acción y políticas para la prevención y reforestación.Item Análisis de oferta y demanda del aprovechamiento de residuos en Bogotá mediante aprendizaje no supervisado y ciencia de datos(Pontificia Universidad Javeriana Cali, 2026) Mendieta Sánchez, Diana Carolina; Hurtado Bolaños, Henry; Arango Londoño, DavidBogotá D.C. genera aproximadamente 191.334 toneladas mensuales de residuos con potencial de aprovechamiento (Soluciones Empresariales DCA SAS, 2026), pero su sistema formal de reciclaje opera al 77,4% de la demanda estimada, dejando un déficit estructural de 43.309 ton/mes. A la fecha del estudio, el Registro Único de Recicladores de Oficio (RURO) de la UAESP registraba 29.495 recicladores formalizados (UAESP, 2026), mientras el Sistema Único de Información de la Superintendencia de Servicios Públicos Domiciliarios (SUI-SSPD, 2026) reportaba 430 organizaciones prestadoras del servicio de aprovechamiento. A pesar de la existencia de estos registros oficiales, ningún estudio previo los había integrado con un modelo de demanda territorial para calcular coberturas reales por localidad. Esta brecha motivó el presente proyecto, desarrollado por Diana Carolina Mendieta Sánchez, investigadora principal y representante legal de Soluciones Empresariales DCA SAS, empresa prestadora de servicios a través de asociaciones de recicladores en las 20 localidades de Bogotá y Henry Hurtado Bolaños, en el marco de la Maestría en Ciencia de Datos de la Pontificia Universidad Javeriana Cali. Bajo el marco metodológico CRISP-DM (Chapman et al., 2000), se integraron seis fuentes de datos oficiales heterogéneas mediante un pipeline ETL implementado en Python 3.12. Se aplicaron tres algoritmos de aprendizaje no supervisado K-Means (MacQueen, 1967), clustering jerárquico Ward y DBSCAN (Ester et al., 1996) sobre las 430 organizaciones formalizadas. El número óptimo de clústeres (K=4) se seleccionó mediante la evaluación simultánea de cuatro métricas de validación interna: coeficiente de silueta (0,487; Rousseeuw, 1987), índice Davies-Bouldin (0,854; Davies & Bouldin, 1979), índice Calinski-Harabász (17,59) y suma de cuadrados intra-clúster. La convergencia de los tres algoritmos en la misma solución K=4 confirma la robustez del resultado (Jain, 2010). Se identificaron cuatro tipologías operativas: grandes redes (13,9%, ~860 ton/mes), microoperadores (75,0%, ~208 ton/mes), organizaciones de baja eficiencia (8,3%) y organizaciones en situación crítica (2,8%). Un marco de zonificación territorial clasificó las 20 localidades en cinco cuadrantes de intervención mediante un Índice de Prioridad de Intervención (IPI) normalizado 0-100. Un hallazgo inesperado emergió de la integración de datos: el 94,7% de los recicladores registrados en el RURO (UAESP, 2026) opera fuera de su localidad de residencia. Este desajuste geográfico invalida los indicadores de cobertura calculados exclusivamente desde el SUI-SSPD: los superávits aparentes reportados como el 247,9% (GPS IDECA) en Puente Aranda o el 310% en Teusaquillo son artefactos del registro administrativo, no capacidad operativa real (Ferronato & Torretta, 2019; Moreno Rodríguez, 2018). Un modelo de programación lineal (PuLP, solver CBC, cuatro variantes) mostró que, bajo condiciones ideales de reasignación, redistribuir la capacidad existente sin nueva inversión cubriría teóricamente el 148,9% del déficit total del sistema, con un costo de transporte equivalente al 2,6% del costo operativo (Savelsbergh & Van Woensel, 2016). Este resultado se presenta como escenario exploratorio para apoyar la toma de decisiones, 4 reconociendo que la implementación real depende de restricciones institucionales, contractuales y económicas del sistema. Los resultados se desplegaron en un dashboard interactivo HTML5/Leaflet con 430 organizaciones georreferenciadas, una matriz de cuadrantes e insumos analíticos para la toma de decisiones de la UAESP y los operadores de las cinco Áreas de Servicio Exclusivo (ASE). Este trabajo constituye la primera cuantificación empírica basada en datos del desajuste oferta-demanda en el sistema formal de aprovechamiento de residuos en Bogotá a escala de organización prestadora individual.Item Clusterización aplicada a empresas del sector energético que reportan indicadores ESG (ambiental, social y de gobernanza)(Pontificia Universidad Javeriana Cali, 2025) Fernández Acosta, María Isabel; Joaqui Barandica, OrlandoEste proyecto aplicó técnicas de aprendizaje no supervisado para segmentar empresas del sector energético con base en sus indicadores ESG (Ambientales, Sociales y de Gobernanza), abordando la necesidad de identificar perfiles diferenciados de sostenibilidad corporativa. La problemática detectada radica en la ausencia de clasificaciones sistemáticas que permitan evaluar, comparar y monitorear el desempeño ESG de las empresas, limitando su análisis desde perspectivas técnicas y estratégicas. Para ello, se construyó una base de datos estructurada con 576 registros provenientes de la plataforma London Stock Exchange Group (LSEG), se depuraron las variables mediante limpieza, estandarización y reducción de dimensionalidad usando Análisis de Componentes Principales (PCA), y se entrenaron modelos de clusterización como K-Means y agrupamiento jerárquico. El modelo óptimo fue K-Means con PCA=5 y 40 clústeres, que alcanzó métricas destacadas en cohesión interna y separación entre grupos. No obstante, se adoptó el modelo con K=2 para facilitar la interpretación cualitativa de los clústeres. Los resultados permitieron identificar dos perfiles empresariales claramente diferenciados: uno con alto compromiso en sostenibilidad y otro con desafíos estructurales significativos, aportando valor estratégico para inversionistas, reguladores y gestores de sostenibilidad. Este proyecto demuestra la viabilidad del uso de minería de datos para caracterizar empresas desde una óptica ESG y sienta las bases para futuras investigaciones orientadas a la predicción, monitoreo y evaluación dinámica del desempeño sostenible en sectores estratégicos.Item Detección de anomalías en datos meteorológicos mediante métodos de análisis avanzados(Pontificia Universidad Javariana Cali, 2025) Mena Ramírez, Yamuna Devi; Buss Molina, Antal AlexanderDada la creciente incidencia de fenómenos climáticos, como ciclones, sequías e intensas lluvias, anticipar y estudiar los cambios en las condiciones atmosféricas se ha convertido en una prioridad para países como Colombia, que cuentan con amplias áreas costeras. Estos eventos representan no solo un riesgo significativo para el medio ambiente y la seguridad, sino que también exigen un entendimiento profundo de las dinámicas atmosféricas. Las series de tiempo meteorológicas son herramientas clave en este contexto, ya que permiten el monitoreo continuo de variables climáticas, como la temperatura, la presión, la humedad y la precipitación, facilitando la identificación y estudio de patrones y anomalías que podrían anticipar eventos climáticos. En este contexto, se abordaron las limitaciones actuales en la detección de anomalías en los datos meteorológicos de la Dirección General Marítima en Colombia, siguiendo la metodología CRoss Industry Standard Process for Data Mining (CRISP-DM). Se propuso un enfoque híbrido que combina un algoritmo estadístico diseñado para la detección de anomalías naturalmente imposibles relacionadas con sensores, con un método más robusto que permite detectar días completos como eventos anómalos, en el que se seleccionaron las series multivariadas mediante un análisis de correlación, donde se identificaron las variables que presentaban mayor interdependencia. Luego, se aplicó el clustering utilizando los algoritmos K-means y DBSCAN, con enfoques tanto locales como globales. Los mejores resultados de evaluación se obtuvieron con el enfoque global aplicado a la serie multivariada que incluye temperatura del aire y humedad relativa, mostrando un puntaje de silueta de 0.67 y un índice de Davies Bouldin 0.54 para DBSCAN.