Mora Cardona, Mario JuliánDuque Carreño, Johan CamiloPeñuela Cárdenas, Sergio2026-07-212026-07-212026http://hdl.handle.net/11522/5688El presente trabajo desarrolla un prototipo de extracción inteligente de metadatos del Anexo No. 2 del Fondo Nacional de Garantías (FNG), formulario estandarizado utilizado en procesos de reclamación de garantías en Colombia. La solución implementa un pipeline híbrido compuesto por un componente basado en reglas para PDFs digitales y un modelo TrOCR con fine-tuning para formularios manuscritos. Dado que la Ley 1581 de 2012 (Habeas Data) prohíbe el envío de datos personales sensibles a servidores externos, se construyó un corpus sintético de 551 documentos para entrenamiento y evaluación, garantizando cero exposición de datos reales. El pipeline digital alcanzó una cobertura global del 80.3%, con precisión del 100% en campos críticos como NIT, cédulas y teléfono. El modelo TrOCR con fine-tuning obtuvo un CER de 0.1176 (equivalente al 88.2% de precisión), representando una mejora relativa del 61% sobre la línea base de Tesseract OCR. Ambos componentes se integran en un flujo unificado con salida estructurada en CSV para los 13 campos de identificación y contacto del formulario.81 p.application/pdfspaExtracción de metadatosReconocimiento óptico de caracteres (OCR)Corpus sintéticoFormularios manuscritosPrivacidad de datosMetadata extractionOptical character recognition (OCR)Synthetic corpusHandwritten formsData privacyExtracción inteligente de metadatos del Anexo No. 2 en reclamación de garantías: automatización con ciencia de datos aplicada al FNGmaster thesishttps://creativecommons.org/licenses/by-nc-sa/4.0/http://purl.org/coar/access_right/c_abf2