Browsing by Subject "Modelos predictivos"
Now showing 1 - 16 of 16
Results Per Page
Sort Options
Item Análisis y comparación de modelos de aprendizaje automático, estadístico y matemático para la predicción de brotes en salud pública(Pontificia Universidad Javeriana Cali, 2025) Forero Benavides, Deisy; Rodríguez Rodríguez, Jeisson; Romero Pérez, Zujel Enrique; Ortega Lenis, DeliaEl proyecto aplicado abordó la predicción de brotes de enfermedades infecciosas en salud pública, utilizando datos abiertos de COVID19 en la ciudad de Bogotá. Este estudio se realizó a través de la modelación predictiva de tipo matemático, estadístico y de aprendizaje automático realizando comparaciones con el fin de responder a la necesidad crítica de anticipar eventos epidemiológicos que ejercen una alta presión sobre los sistemas sanitarios y generan impactos significativos tanto sociales como económicos. Su importancia radica en que la identificación temprana de tendencias, picos de contagio y zonas de riesgo permite optimizar recursos, mejorar la toma de decisiones y fortalecer las intervenciones preventivas en contextos urbanos densamente poblados. La problemática central consistió en las limitaciones de los sistemas de salud para responder oportunamente a brotes, así como en los desafíos asociados a la calidad, selección y tratamiento de datos relevantes para la modelación predictiva. Como objetivo general, se propuso desarrollar y evaluar dichos modelos predictivos orientados a la preparación y depuración de los datos, la identificación de variables clave, el entrenamiento y ajuste de modelos y la comparación de su desempeño mediante métricas estandarizadas. Como resultado, se diseñaron y evaluaron modelos preliminares que evidenciaron diferencias claras en capacidad predictiva, interpretabilidad y viabilidad operativa, permitiendo identificar fortalezas y limitaciones de cada enfoque y establecer condiciones mínimas para su aplicación en escenarios reales de salud pública. Los hallazgos muestran que la integración de la ciencia de datos con enfoques tradicionales de modelación epidemiológica constituye una herramienta efectiva para la anticipación de brotes. Las posibles aplicaciones incluyen el apoyo a sistemas de alerta temprana, la planificación estratégica de recursos sanitarios y la formulación de políticas públicas basadas en evidencia, con potencial de replicabilidad a nivel nacional y en otros contextos urbanos similares.Item Aplicación de procesamiento de lenguaje natural (PLN) para identificar riesgos operacionales en el sector salud(Pontificia Universidad Javeriana Cali, 2026) Mejía Delgado, Alejandro; Pencue-Fierro, Edgar LeonairoEl presente proyecto aplicado, denominado “Aplicación de procesamiento de lenguaje natural (PLN) para identificar riesgos operacionales en el sector salud”, aborda el análisis de las PQRD reportadas ante la Superintendencia Nacional de Salud como fuente de información para identificar señales asociadas a fallas operacionales en la prestación de servicios de salud. Su importancia radica en que el alto volumen de inconformidades reportadas por los usuarios puede reflejar problemas recurrentes en procesos como acceso a servicios, autorizaciones, entrega de medicamentos, atención asistencial, atención administrativa y continuidad del cuidado, los cuales requieren ser analizados de forma sistemática para apoyar la gestión preventiva del riesgo. El objetivo del proyecto fue aplicar técnicas de PLN y aprendizaje automático para clasificar las PQRD en categorías de riesgo operacional y asociarlas con procesos de la prestación de servicios de salud, siguiendo la metodología CRISP-DM. Para ello, se consolidaron las bases abiertas de PQRD del periodo 2017–2024, se realizó la evaluación de calidad, depuración y normalización de los datos, y se construyó una base final de 8.039.810 registros. Posteriormente, se preparó un corpus textual a partir de los campos normalizados de macromotivo, motivo general y motivo específico, y se elaboró una muestra etiquetada manualmente de 4.000 registros en siete categorías de riesgo operacional. A partir de esta muestra se entrenaron y evaluaron diferentes modelos de clasificación supervisada, seleccionando como modelo final Linear SVC con representación TF-IDF calibrado mediante el método sigmoid, por su equilibrio entre desempeño, interpretabilidad y viabilidad computacional. El modelo fue aplicado sobre la base depurada, permitiendo clasificar las PQRD y relacionarlas con procesos de atención en salud. Como aplicación, los resultados permiten identificar patrones recurrentes de riesgo, priorizar procesos críticos, diseñar visualizaciones analíticas y formular recomendaciones orientadas a mejorar la calidad del servicio y prevenir la recurrencia de fallas operacionales en el sector salud.Item Estimación de la tasa de recuperación de la vegetación tras incendios forestales mediante imágenes satelitales y machine learning(Pontificia Universidad Javeriana Cali, 2025) Cartagena Martínez, Milton; Sáenz Hernández, Germán Darío; Solano Correa, Yady Tatiana; Patiño Velasco, Mario MilverEl presente proyecto tuvo como objetivo estimar la tasa de recuperación vegetal en áreas afectadas por incendios forestales en las regiones de Caquetá y Tolima, las cuales presentan condiciones climáticas diversas influenciadas por el fenómeno de El Niño Oscilación del Sur (ENOS). Se desarrolló un modelo que utiliza imágenes satelitales de Sentinel-2, FACSAT-2 y de sensores Aerotransportados, empleando técnicas de entrenamiento supervisado y redes neuronales con el objetivo de detectar áreas afectadas por incendios y llevar a cabo análisis temporales, por lo tanto, se incorporaron variables climáticas relevantes en la recuperación vegetal, tales como la temperatura y la precipitación. Una vez detectada la zona de interés se aplicó una versión optimizada del algoritmo Gradient Boosting con histogramas (HGB) que permiten mejorar la eficiencia en la estimación de la recuperación vegetal en las zonas seleccionadas debido a su capacidad para manejar grandes volúmenes de datos, los resultados fueron visualizados en un tablero de dashboard de power BI para conocer los tiempos estimados de la tasa de recuperación en las dos zonas de estudio planteadas en este proyecto.Item Gestión del riesgo y cobranza mediante modelos predictivos en ciencia de datos en educación superior(Pontificia Universidad Javeriana Cali, 2026) Tovar Ríos, Paula Andrea; Grajales Castaño, Edgar Esteban; García Arboleda, Isabel CristinaEste proyecto tiene como objetivo aplicar técnicas de Ciencia de Datos para optimizar la gestión del riesgo y la cobranza de créditos en la educación superior, abordando una problemática crítica en la Universidad Autónoma de Occidente (UAO), la necesidad de garantizar la sostenibilidad financiera y la permanencia estudiantil mediante créditos educativos más eficientes. Actualmente, los modelos tradicionales no permiten identificar con precisión los perfiles de estudiantes con mayor riesgo de incumplimiento, lo que afecta la toma de decisiones estratégicas y limita la capacidad de respuesta ante situaciones de morosidad. A través del desarrollo de modelos predictivos y análisis de datos históricos, se espera mejorar la identificación de perfiles de riesgo, reducir la morosidad y fortalecer la eficiencia en la gestión de cobranza. Además, se busca implementar herramientas de visualización que permitan a la Dirección Financiera interpretar los resultados de manera clara y tomar decisiones informadas, con potencial de replicabilidad en otras instituciones de educación superior. El proyecto se basa en datos reales y en un enfoque contextualizado, lo que garantiza su relevancia práctica y la posibilidad de generar soluciones sostenibles y ajustadas a las necesidades.Item Identificación de niveles de riesgos en salud para la gestión de afiliados mediante aprendizaje automático(Pontificia Universidad Javeriana Cali, 2025) Avila Reina, Adriana Janeth; Aguilar Ramírez, David Orlando; Vargas Cardona, Hernán DaríoEl proyecto aplicado tuvo como objetivo desarrollar un modelo automatizado para la identificación de niveles de riesgo en salud de afiliados de la empresa Keralty mediante técnicas de aprendizaje automático supervisado. Su importancia radica en la necesidad de fortalecer los procesos de estratificación de riesgo que actualmente se basan en reglas estáticas definidas por expertos, las cuales no se actualizan automáticamente ante nuevos datos ni aprovechan el potencial analítico de grandes volúmenes de información clínica, demográfica y de utilización de servicios. La problemática abordada se centra en mejorar la capacidad de la organización para identificar oportunamente a los pacientes con mayor probabilidad de deterioro en su estado de salud, permitiendo así priorizar acciones preventivas que optimicen el uso de recursos y reduzcan costos asociados a complicaciones evitables. Para resolver esta limitación, se preparó una base de datos estructurada, anonimizada y etiquetada con 36 clases combinadas de riesgo y severidad, y se entrenaron múltiples clasificadores supervisados, incluyendo XGBoost, Random Forest, Árboles de Decisión, Regresión Logística, KNN y SVM, tanto en versiones balanceadas como desbalanceadas. Los modelos fueron evaluados mediante métricas como exactitud, precisión, recall, F1-score y AUC-ROC, y validados con técnicas de partición aleatoria repetida (random holdout). XGBoost sin balancear fue el modelo con mejor desempeño general en las 36 clases incluso al ser aplicado sobre registros correspondientes a un período posterior, lo cual respalda su estabilidad operativa y capacidad de generalización dentro del mismo sistema de datos. Estos resultados sugieren que los modelos supervisados pueden complementar los enfoques actuales de gestión del riesgo, ofreciendo mayor precisión en la clasificación de pacientes y una base técnica para el diseño de intervenciones diferenciadas. Aunque el proyecto no contempla una fase de despliegue real, sus hallazgos representan un insumo relevante para tomadores de decisión que buscan integrar herramientas de inteligencia artificial en la gestión en salud. Finalmente, se identificó como línea futura la exploración de técnicas no supervisadas para detectar nuevas segmentaciones no capturadas por los esquemas actuales.Item Indicador de desarrollo integral en los niños entre 0 y 5 años, en el Valle del Cauca y 13 municipios del Norte del Cauca, a través de modelo predictivo(Pontificia Universidad Javeriana Cali, 2024) Ávila Huertas, Wladimir; López Álvarez, Daniel Alejandro; Aristizábal, Mario Felipe; Mora Cardona, Mario JuliánEl objetivo de este proyecto se enfocó en el desarrollo de modelos predictivos para clasificar y predecir el potencial de desarrollo de niños menores o iguales de 5 años en el Valle del Cauca y norte del Cauca 3utilizando los datos del Sisbén. Se analizaron factores socioeconómicos y geográficos que influyen en el desarrollo de la primera infancia, con el objetivo de proporcionar información relevante para la toma de decisiones en políticas públicas y programas sociales dirigidos a esta población vulnerable. La actualización de la base de datos del Sisbén es fundamental para garantizar la eficacia y equidad en la asignación de subsidios y programas sociales en Colombia. Al mantener la información actualizada, se asegura que los recursos lleguen de manera eficiente a las familias más necesitadas, permitiendo una distribución equitativa y efectiva de los subsidios. Además, una base de datos actualizada proporciona una visión precisa de la situación socioeconómica de la población, facilitando la identificación de necesidades y la planificación de intervenciones enfocadas en el bienestar de los niños y sus familias. Los beneficios de contar con una base de datos del Sisbén actualizada son significativos. No solo se mejora la focalización de los programas sociales, sino que también se reducen las inequidades y se promueve el desarrollo integral de los niños en situaciones de pobreza y vulnerabilidad. La actualización de la base de datos permite realizar análisis detallados que sirven como base para la formulación de políticas basadas en evidencia, orientadas a mejorar las condiciones de vida de la población infantil en estas regiones específicas de Colombia. En resumen, este proyecto busca aprovechar los datos del Sisbén para desarrollar un modelo predictivo que ayude a comprender y predecir el desarrollo de la primera infancia en el Valle del Cauca y norte del Cauca. La correcta clasificación de categorías en la base de datos del Sisbén garantiza una asignación eficiente de recursos, generando impactos positivos en la calidad de vida y el futuro de los niños en estas regiones.Item Modelo de predicción para el número de especies de Coleoptera en el Departamento de Antioquia(Pontificia Universidad Javeriana Cali, 2025) Marentes Herrera, Esteban; Mora Cardona, Mario JuliánColombia es un país megadiverso, pero el número de especies conocidas está subestimado debido a la falta de información, en especial para grupos poco estudiados y difíciles de muestrear e identificar como los coleópteros. No es posible obtener el número exacto de especies para este grupo a través de métodos convencionales, debido a su diversidad y falta de recursos para investigación en taxonomía, por este motivo una opción es utilizar técnicas y modelos predictivos procedentes de la ciencia de datos, junto a registros biológicos y variables climáticas para realizar una predicción de manera indirecta. El objetivo principal fue estimar el número de especies de coleópteros en el Departamento de Antioquia, debido a que es el Departamento con mayor cantidad de datos disponibles y tienen una gran variedad de hábitats representativos. Para esto se realizó una búsqueda en la literatura de las variables que afectan la distribución de los coleópteros y las técnicas más utilizadas para predecir el número de especies, luego se realizó una implementación de algunas de estas en Python, que fueron evaluadas a través de métricas numéricas y de una elicitación experta de entomólogos. Finalmente se realizó la predicción del número de especies para el país y para el departamento de Antioquia utilizando el modelo que obtuvo el mejor rendimiento. Las variables más relevantes identificadas fueron: velocidad del viento, humedad relativa, precipitación, radiación solar, temperatura, ecosistemas, elevación y las especies de plantas cercanas a los coleópteros, estas se utilizaron junto a los registros biológicos de coleópteros descargados de GBIF para entrenar los modelos, anotando la información a nivel de familia con las listas de chequeo publicadas por expertos. Para la predicción se utilizaron cuatro tipos de modelos diferentes de regresión, regresión lineal múltiple, perceptrón multicapa, redes neuronales profundas y random forest, que fueron identificados en la literatura como los que tenían mejores resultados. Las redes neuronales profundas tuvieron el mejor desempeño, con un R2 de 0.98, MSE de 92.6 y MAE de 4.07, con este se estimó que el número de especies del departamento está entre un mínimo de 2.007 y un máximo de 9.381, con un promedio de 4.210 especies y fue compartida con los expertos que estimaron que el valor real probablemente está cerca del límite superior. Esta información va a permitir tomar decisiones informadas de conservación y la divulgación con el público general sobre la diversidad del grupo.Item Modelo multivariado para predecir la localización de la población a partir de factores sociodemográficos en Colombia(Pontificia Universidad Javeriana Cali, 2024) Valbuena Acosta, Carlos; Mora Cardona, Mario JuliánEl objetivo de este proyecto era determinar cuáles son los factores que inciden sobre la localización de un individuo en Colombia. Para lograrlo, implementó el algoritmo Propensity Score Matching con base en los datos del Censo 2018 para la población del Valle del Cauca, en los módulos de personas, hogares, viviendas y marco de georreferenciación, con un universo de 3,2 millones de registros y 40 variables seleccionadas. Para cumplir el objetivo del proyecto, se construyeron 3 bases de datos con sus grupos de tratamiento y control, así: el primero con datos urbanos de Cali y los demás municipios, el segundo, solo con registro urbanos de Cali y el tercero, con registros del área urbana y centros poblados de Cali. Sobre estos algoritmos se entrenó el PSM, partiendo de una preparación de los datos, luego se realizó la estimación del propensity score que es la determinación del problema binario, es decir, la obtención de la probabilidad que un individuo se ubique en un grupo u otro para hacer las muestras comparables, seleccionando los Conjuntos 1 y 2 con el mejor nivel de accuracy con 61% y 50% respectivamente debido a la alta variabilidad que reviste una base como el Censo; con estos dos conjuntos se dio paso a la fase de emparejamiento a través de vecinos más cercanos – KNN, donde el conjunto 1 de Cali y los demás municipios obtiene las menores diferencias en las variables observables luego del emparejamiento. Posteriormente, para predecir la manzana geográfica como unidad mínima de granularidad que ubica al individuo dentro de los Shapes del Censo-DANE, se implementó el clasificador Random Forest, el cual mostró dificultades para predecir la ubicación en una categoría compuesta por 22 caracteres, alcanzando un accuracy de 32 %, luego se hicieron unas transformaciones en la variable a predecir sin afectar su origen, logrando un mejor resultado del 39% con la predicción de los últimos 8 campos de la localización de los individuos de Cali, pero debido al alto costo computacional este modelo no se pudo replicar para datos nuevos provenientes de SISBEN. Finalmente, se espera que este proyecto contribuya a profundizar los análisis económicos que desarrolle el Centro de Investigación Aplicada Riqueza Completa, mediante la implementación de algoritmos de emparejamiento como el PSM, especialmente dentro del uso de variables sociodemográficas como el Censo y su potencial capacidad para determinar la localización de un individuo a partir de estas.Item Modelo predictivo de puntualidad aérea (OTP) en Colombia basado en factores climáticos(Pontificia Universidad Javeriana Cali, 2025) Buitrago Martín, Daniel Mauricio; Martínez López, David Steven; Vidal Godoy, Paula; Arango Londoño, DavidLa puntualidad de los vuelos, medida a través del indicador On-Time Performance (OTP), constituye un aspecto crítico en la calidad del servicio aeronáutico y en la eficiencia operativa de las aerolíneas. En Colombia, las condiciones climáticas se han identificado como uno de los factores que más inciden en los retrasos, generando afectaciones operativas, sobrecostos y una disminución en la satisfacción del pasajero. Este estudio toma como unidad de análisis los vuelos comerciales domésticos operados en Colombia, integrando información histórica de desempeño operacional y variables meteorológicas. El horizonte temporal de análisis comprende datos entre 2019 y 2024, obtenidos de fuentes oficiales como Aerocivil, Cirium, Flightradar24, IDEAM, NOAA y reportes METAR. A partir de estos datos se desarrolla un modelo predictivo basado en técnicas de aprendizaje supervisado, específicamente Random Forest y XGBoost, con un proceso metodológico que incluye análisis exploratorio, selección de características, construcción del modelo y validación mediante métricas estándar de clasificación. El propósito es estimar la probabilidad de retraso y alcanzar un desempeño igual o superior al 85% de precisión, además de identificar las variables meteorológicas más influyentes en el comportamiento de la puntualidad aérea. Los resultados esperados buscan aportar una herramienta de apoyo para la toma de decisiones operativas, optimizar la planificación, reducir costos asociados a demoras y contribuir al fortalecimiento del sector aeronáutico colombiano.Item Modelo predictivo para la detección temprana del riesgo de suicidio en policías de Colombia(Pontificia Universidad Javeriana Cali, 2026) Caicedo Henríquez, Valentina; Barbosa Rodríguez, Mario Fernando; Torres Romero, Juan Sebastián; Arango Londoño, DavidEl suicidio en la Policía Nacional de Colombia representa un problema crítico de salud pública institucional: en 2011 la tasa alcanzó 18 por cada 100.000 efectivos, triplicando la tasa nacional. Este proyecto aplicado desarrolló un modelo predictivo de detección temprana del riesgo de suicidio en policías activos utilizando una base de datos institucional inédita de la Dirección de Sanidad de la Policía Nacional (DISAN PONAL) con 254 casos confirmados, bajo un diseño caso-control retrospectivo con ventana de observación de 24 meses y horizonte de predicción de 90 días. Se construyeron 42 variables predictoras a partir de fuentes clínicas, laborales y sociodemográficas. Se evaluaron cuatro algoritmos —Regresión Logística, Random Forest, XGBoost y LightGBM— bajo escenarios de desbalance 5:1 y 10:1. El modelo LightGBM en escenario 5:1 obtuvo el mejor desempeño en validación cruzada: AUC-PR = 0.9587, AUC-ROC = 0.9888, F1 = 0.9095, Precisión = 0.919 y Recall = 0.902. Una auditoría de data leakage de cuatro capas redujo el AUC-PR de 1.000 a 0.9587, confirmando la ausencia de contaminación metodológica. La validación temporal (hold-out 2022–2025) reveló una degradación significativa en la métrica primaria (AUC-PR: 0.9587 → 0.6553, −32%), indicando que el modelo requiere recalibración antes del despliegue operativo. El análisis SHAP identificó como predictores dominantes los indicadores de utilización general del sistema de salud —tasa de diagnósticos acumulados, polimedicación, antigüedad institucional y edad— no exclusivamente de salud mental formal. Se calculó el PPV esperado bajo prevalencia real, mostrando que el despliegue directo sobre el universo de efectivos requiere estratificación previa de una subcohorte de riesgo. El análisis de equidad por subgrupos reveló brechas de Recall entre hombres y mujeres y entre policías de alta y baja antigüedad, documentadas como limitaciones. El trabajo aporta un protocolo replicable de auditoría de leakage para diseños caso-control retrospectivos en contextos de salud institucional y un conjunto de seis indicadores de riesgo con potencial de integración en programas preventivos de la DISAN.Item ¿Permiten los modelos predictivos y el análisis técnico optimizar los resultados de estrategias de inversión periódica sobre un índice bursátil?(Pontificia Universidad Javeriana Cali, 2024) Duque González, Andrés Felipe; Lofruscio Vallejo, María Antonia; Arango Londoño, DavidEl presente estudio explora la inversión pasiva o indexación proponiendo un método periódico de inversión que ofrece una alternativa al convencional Dollar Cost Averaging (DCA). La estrategia propuesta armoniza principios de los mercados eficientes con el análisis técnico, combinando dos perspectivas históricamente divergentes, y emplea el modelo predictivo ARIMA, para optimizar la cantidad invertida en cada período. El propósito de esta aproximación es ajustar las inversiones a las fluctuaciones del mercado, basándose en datos históricos y tendencias actuales para guiar las decisiones de inversión, desplazando así el foco de la predicción de precios hacia la optimización del monto invertido. Aunque investigaciones previas han explorado ajustes periódicos en el volumen de inversión, la novedad de este estudio radica en integrar el análisis técnico y modelos predictivos para la toma de decisiones sobre el volumen de aportes, un enfoque poco explorado en la literatura existente. A partir de este proyecto de investigación se espera que la estrategia propuesta, superé en rendimiento y riesgo al enfoque tradicional de Dollar Cost Averaging.Item Predicción de desenlaces de pacientes de emergencias atendidas por hospitales nivel I y II en el Valle del Cauca(Pontificia Universidad Javariana Cali, 2024) Castañeda González, Luis Carlos; Gallego Paz, Sonia Yurany; León Tabares, Juan José; Paz Roa, Juan CamiloEste proyecto parte de la problemática de la sobreocupación en los servicios de urgencias y la necesidad de optimizar la atención al paciente, agilizando la toma de decisiones en este entorno crítico. El servicio de urgencias inicia con una valoración de Triage al momento de la llegada del paciente, posteriormente, el paciente pasa a la valoración inicial por parte de un médico tratante que determina el manejo del paciente. Durante la atención, los pacientes terminan su servicio con uno de varios desenlaces que puede ser entre otros: 1) Alta de urgencia, 2) hospitalización, 3) remisión normal, 4) remisión prioritaria y 5) remisión urgente. Este proyecto aplicado propone un modelo de aprendizaje automático que puede apoyar al personal médico en su predicción de los desenlaces clínicos, y de esta manera contribuir a una mejor toma de decisiones de alta de urgencias, hospitalización o remisión a un nivel superior de complejidad. La implementación de este modelo en la valoración inicial podría contribuir a la optimización de la atención a los pacientes al agilizar las decisiones de traslados, minimizar errores humanos, y aliviar la fatiga cognitiva de los médicos. Se emplearon tres modelos de aprendizaje automático: Regresión Logística Multinomial (RLM), Máquinas de Soporte Vectorial (SVM) y Extreme Gradient Boosting (XGBoost). El rendimiento se evaluó con métricas como precisión, sensibilidad y F1-score. Se incluyó un análisis de texto utilizando TF-IDF para enriquecer los datos y mejorar la precisión del modelo. Se encontró que tanto RLM como SVM mostraron limitaciones en la predicción de clases minoritarias, como la necesidad de hospitalización o remisión. El modelo XGBoost, potenciado con análisis de texto, obtuvo el mejor rendimiento, mejorando la precisión, especialmente en la predicción de clases minoritarias. Los resultados obtenidos confirman que la inclusión de información textual permite mejorar la predicción. Asimismo, evidencian las limitaciones de RLM y SVM en conjuntos de datos desbalanceados y destaca la superioridad de XGBoost y otros algoritmos avanzados. Los resultados obtenidos se alinean con la literatura, que también evidencia las limitaciones de RLM y SVM en conjuntos de datos desbalanceados y destaca la superioridad de XGBoost y otros algoritmos avanzados. Este proyecto de ciencia de datos contribuye al desarrollo de herramientas que pueden ayudar a optimizar la atención en urgencias, mejorando la toma de decisiones, la asignación de recursos y la calidad del servicio. A futuro, se propone validar los modelos en otros contextos e incorporar nuevas variables para mejorar aún más la predicción.Item Predicción de errores del modelo Black‑Scholes mediante modelos clásicos de ciencia de datos(Pontificia Universidad Javeriana Cali, 2026) Rojas Ramírez, Julián; Tangarife Acevedo, Natalia María; Torres Valencia, Cristian AlejandroLa valoración precisa de opciones financieras es crucial para la toma de decisiones de inversión informada. El modelo Black-Scholes, aunque fundamental para la valoración teórica de opciones europeas, presenta limitaciones inherentes a sus supuestos que generan discrepancias con los precios reales del mercado. Este proyecto desarrolló un sistema de predicción basado en técnicas de ciencia de datos para predecir y corregir los errores sistemáticos del modelo Black-Scholes, utilizando un dataset de 40,337 contratos de opciones sobre 10 activos representativos del mercado estadounidense. Siguiendo la metodología CRISP-DM, se implementaron y compararon progresivamente seis modelos de aprendizaje automático de complejidad creciente, evaluando su capacidad para ajustar los precios teóricos. Los resultados demuestran que los modelos de ensamble logran las mayores reducciones del RMSE, con Random Forest como mejor modelo para opciones call (82,20%) y XGBoost para opciones put (89,54%) respecto al baseline, evidenciando que el aprendizaje automático puede complementar eficazmente los modelos teóricos de valoración financiera sin reemplazar su estructura fundamental.Item Predicción de fallas prematuras de componentes en una flota de camiones mineros utilizando ciencia de datos(Pontificia Universidad Javeriana Cali, 2025) Martínez Morales, Christian Andrés; Perdomo Olarte, Juan Camilo; García Arboleda, Isabel CristinaLa temática del proyecto aplicado se relaciona con la predicción de fallas de componentes de una flota determinada de camiones mineros. La problemática que se abordó consistió en que la flota había estado experimentando fallas prematuras en varios de sus componentes, a lo que la fábrica de dichos camiones argumentaba que estos eventos no correspondían a un problema de producto sino más bien a una naturaleza severa de la operación, sin embargo, se desconocía cuáles aspectos de la operación eran los influyentes en la generación de dichas fallas. La minera había manifestado la importancia de predecir este tipo de eventos ya que tenían el potencial de impactar aspectos importantes como la seguridad y salud de los operadores, el cuidado del activo y la producción de la minera convirtiéndose en una problemática en la que participaban interesados como el departamento de producción, mantenimiento, logística e, incluso, la fábrica de los camiones. El objetivo del proyecto fue entonces predecir fallas prematuras de dichos componentes para que la minera pudiera anticiparlas y realizar planes de acción preventivos a partir del análisis de datos disponibles e historial de fallos, del desarrollo de modelos predictivos, la evaluación de dichos modelos y el prototipado de una interfaz gráfica para el seguimiento y control de fallas prematuras. Se generaron 8 modelos por componente utilizando técnicas como Random Forest, XGBoost, Perceptrónes Multicapa y Regresión Logística, a partir de los cuales se pudieron predecir fallas de 6 tipos de componentes con precisiones superiores al 84%. A partir del análisis de importancia proporcionado por el XGBoost, se encontró que los aspectos de la operación que más influyen en la aparición de fallas prematuras son las microfalla por torsión, los valores de torsión y la carga acarreada por el camión ciclo a ciclo. Finalmente, se generó un prototipo de interfaz gráfica para seguimiento y control de dichos aspectos.Item Predicción de la resiliencia escolar en municipios colombianos afectados por el conflicto armado(Pontificia Universidad Javeriana Cali, 2025) Lucumí Hernández, Luz Carime; Martínez Martínez, Luis Carlos; Álvarez Vargas, Gloria Inés; Linares Ospina, Diego LuisEste proyecto tiene como objetivo predecir la resiliencia escolar en los municipios colombianos afectados por el conflicto armado, utilizando técnicas de aprendizaje automático y análisis espacial. La resiliencia escolar se refiere a la capacidad de los estudiantes para mantener un buen rendimiento académico a pesar de las adversidades, dado que, aunque estas regiones enfrentan grandes desafíos, algunos estudiantes logran sobresalir, lo que subraya la importancia de identificar los factores que contribuyen a este éxito. El proyecto se enfoca en desarrollar un modelo predictivo para estimar la resiliencia escolar en estas zonas, basado en datos educativos, sociales y económicos. Entre los objetivos se incluyen la preparación de los datos, la construcción y evaluación de los modelos predictivos, y el desarrollo de un prototipo para visualizar los resultados. Este enfoque basado en el análisis de grandes volúmenes de datos ofrece una manera de comprender y abordar la resiliencia escolar en contextos de conflicto.Item Predicción del gasto de bolsillo en salud de los hogares en Colombia usando modelos de aprendizaje automático(Pontificia Universidad Javariana Cali, 2024) Parada Portilla, Juan Sebastián; Ortega Lenis, DeliaEste trabajo desarrolla modelos de aprendizaje automático para predecir el gasto de bolsillo en salud de los hogares colombianos. Utilizando datos de la Encuesta de Calidad de Vida (ECV), se identificaron variables clave como la presencia de enfermedades crónicas en el hogar, el ingreso del hogar, el tamaño del hogar, el estado de salud y la afiliación al sistema de seguridad social. Inicialmente, se exploraron modelos de regresión, pero debido a la alta proporción de valores nulos (85\% de los hogares no reportan gasto en salud), su desempeño fue limitado. Para abordar este problema, se transformó la variable dependiente en una binaria y se aplicaron modelos de clasificación, incluyendo Random Forest, Gradient Boosting y regresión logística, optimizados con la técnica SMOTE para balancear las clases. Los resultados muestran que los modelos de clasificación superan a los de regresión, con Random Forest y Gradient Boosting logrando los mejores desempeños en términos de ROC AUC. Este estudio proporciona herramientas útiles para el diseño de políticas públicas basadas en evidencia, permitiendo identificar hogares con mayor riesgo de incurrir en altos gastos en salud y facilitando intervenciones para reducir el impacto financiero en las familias colombianas.