Informe de Proyecto: Automatización de Procesos para el
Flujo de Trabajo en Machine Learning con el Dataset del Titanic
Grupo 10:
Alexander Oviedo Fadul
Maria Fernanda Ruiz Paipilla
Neheman Samir Jaller Cerchiaro
William David Obando Lopez
Especialización en Inteligencia Artificial, Corporación Universitaria Minuto de Dios
NRC-8772: Machine Learning Avanzado
Profesor: Leonardo Valderrama García
21 de junio de 2026
Enlaces de Acceso al Proyecto
Para facilitar la revisión y reproducibilidad de las pruebas de este proyecto, se proporcionan los accesos directos al video de sustentación y al entorno interactivo de código:
🎥 Enlace presentación:
https://docs.google.com/presentation/d/1Kmwunr30aYWmHBjMPW9yQDeESbVubXhQ/edit
🚀 Enlace del Cuaderno Interactivo (Google Colab):
https://colab.research.google.com/drive/1UI3mmIOlSzQ8G8PTwDHKnatIRqeD8e32
Datos Generales del Proyecto
| Título del trabajo | Automatización de procesos para el flujo de trabajo en ML |
|---|---|
| Nombres de integrantes | Grupo 10: - Alexander Oviedo Fadul - Maria Fernanda Ruiz Paipilla - Neheman Samir Jaller Cerchiaro - William David Obando Lopez |
| Nombre del curso | NRC-8772: Machine Learning Avanzado |
| Número de la semana | Semana 7 |
| Nombre del profesor | Leonardo Valderrama García |
| Fecha de entrega | 21 de junio de 2026 |
| Framework principal | scikit-learn (Pipeline / ColumnTransformer) |
| Enlace de Google Colab | https://colab.research.google.com/drive/1UI3mmIOlSzQ8G8PTwDHKnatIRqeD8e32 |
Introducción
En la industria contemporánea del desarrollo de inteligencia artificial, la automatización de los flujos de trabajo en Machine Learning (MLOps) se ha convertido en un requisito técnico e industrial crítico. A medida que los modelos transicionan desde scripts experimentales en entornos locales a sistemas de toma de decisiones integrados en producción, asegurar la consistencia del preprocesamiento de datos y la reproducibilidad de los resultados es fundamental (Janiesch et al., 2021).
Este informe presenta la solución desarrollada por el Grupo 10 para modelar y evaluar la predicción de supervivencia en el histórico dataset del Titanic. El enfoque central del proyecto reside en la automatización del flujo de datos usando scikit-learn. Mediante estructuras como Pipelines y ColumnTransformers, encapsulamos las fases de imputación, codificación de variables categóricas, normalización de variables numéricas, ingeniería de características personalizada y optimización de hiperparámetros, previniendo fallas de diseño comunes como la fuga de datos (data leakage).
Diseño Metodológico del Flujo Automatizado
El flujo de trabajo se automatizó completamente mediante la librería scikit-learn en Python. En lugar de aplicar transformaciones de forma manual y aislada sobre el dataset completo, diseñamos una arquitectura modular compuesta por un preprocesador central de variables y estimadores de extremo a extremo.
Ingeniería de Características
Implementamos una etapa personalizada de feature engineering para extraer patrones que el modelo no podría identificar por sí solo: (a) family_size, que representa el tamaño de la familia a bordo sumando sibsp y parch más 1; (b) is_alone, una variable binaria que indica si el pasajero viajaba sin acompañantes; y (c) title, que extrae y limpia los títulos de cortesía de los nombres (Mr, Mrs, Miss, Master, etc.) para utilizarlos como un proxy social y de edad.
ColumnTransformer y Pipeline de Modelado
El preprocesador utiliza ColumnTransformer para aplicar tratamientos diferenciados: las variables numéricas pasan por un SimpleImputer con estrategia de mediana y un StandardScaler. Las variables categóricas se imputan con la moda (most_frequent) y se codifican con OneHotEncoder. Las binarias pasan sin alteración (passthrough). Finalmente, este preprocesador se conecta en serie con el clasificador (Random Forest o SVM) en un objeto Pipeline unificado.
Resultados y Análisis Comparativo
Evaluamos dos familias de clasificadores: Random Forest (ensamble basado en árboles de decisión) y Support Vector Machine (SVM con kernel radial RBF). Para garantizar resultados óptimos, integramos una búsqueda de cuadrícula con GridSearchCV para optimizar los hiperparámetros (como la profundidad máxima en Random Forest y la regularización C y gamma en SVM).
Métricas en Validación Cruzada (5-Fold CV)
La validación cruzada con 5 particiones sobre el conjunto de entrenamiento nos brindó una estimación sólida del rendimiento de los modelos, libre de sobreajuste. A continuación, se resume el comportamiento de las métricas de rendimiento promedio (F1-score, Accuracy, Precision, Recall):
| Métrica | Random Forest (Promedio CV) | SVM (Promedio CV) |
|---|---|---|
| Accuracy | 81.46% | 81.60% |
| Precision | 77.84% | 76.32% |
| Recall | 74.20% | 76.01% |
| F1-score | 75.92% | 76.15% |
El análisis comparativo demuestra que ambos modelos alcanzan un desempeño muy equilibrado, con un F1-score de validación en torno al 76% y un accuracy superior al 81%. SVM muestra un mejor recall (sensibilidad) promedio, detectando un mayor porcentaje de supervivientes reales, mientras que Random Forest destaca con una mayor precisión promedio (menor tasa de falsos positivos).
Respuestas a Preguntas Orientadoras
¿Cómo puede la automatización de procesos aumentar la eficiencia y precisión?
La automatización mediante Pipelines evita la fuga de datos al aplicar las transformaciones de escala e imputación de manera independiente en cada iteración de la validación cruzada, previniendo sobreestimaciones del rendimiento. Además, elimina el trabajo manual repetitivo de limpieza de datos y permite automatizar la búsqueda de parámetros sobre todo el flujo simultáneamente, garantizando consistencia técnica.
¿Cuáles son las herramientas y técnicas utilizadas y sus casos de uso?
Las principales herramientas incluyen los Pipelines de scikit-learn para flujos locales, MLflow para el seguimiento de experimentos, y Vertex AI o Kubeflow Pipelines para orquestación en la nube. Se aplican en detección de fraudes, recomendaciones comerciales o predicción de fallas industriales, donde los modelos deben actualizarse y evaluarse continuamente ante la deriva de datos (data drift).
Dilemas Éticos y Sesgo Algorítmico
El análisis del dataset expone dilemas éticos abordados por Carsten (2020) y Béranger (2018). La supervivencia en el Titanic estuvo fuertemente determinada por el género ("mujeres y niños primero") y la clase socioeconómica del pasajero. Entrenar un modelo de IA con estos datos genera un sesgo algorítmico que simplemente replica y automatiza prejuicios históricos.
Si un sistema de asignación de rescates marítimos actual dependiera de este modelo de IA, discriminaría de forma automática a los hombres de clase trabajadora. Esto demuestra que los algoritmos no son neutros: heredan las desigualdades de los datos. De allí la necesidad de una gobernanza algorítmica y auditorías constantes de las características de entrada.
Conclusiones
1. El diseño del pipeline modular simplificó la ingeniería de características y el procesamiento diferenciado de datos, resolviendo la fuga de datos (data leakage).
2. Random Forest y SVM demostraron comportamientos complementarios y competitivos, obteniendo un F1-score promedio del 76%.
3. La auditoría ética es indispensable para evitar que la IA automatice sesgos discriminatorios de los conjuntos de datos históricos.
Referencias
Béranger, J. (2018). The Framework for Algorithmic Processing. En The algorithmic code of ethics: Ethics at the bedside of the digital revolution (pp. 122-164). John Wiley & Sons, Incorporated.
Campesato, O. (2020). Introduction to AI / Introduction to Machine Learning / Classifiers in Machine Learning. En Artificial intelligence, machine learning, and deep learning (pp. 1-66). Mercury Learning and Information.
Carsten, B. (2020). Ethical Issues of AI / Addressing Ethical Issues in AI. En Artificial Intelligence for a Better Future: An Ecosystem Perspective on the Ethics of AI and Emerging Digital Technologies (pp. 35-64). Springer.
Valderrama García, L. (2026, 20 de junio). Clase 7: Automatización de procesos para el flujo de trabajo en Machine Learning [Clase magistral]. NRC-8772 Machine Learning Avanzado, Corporación Universitaria Minuto de Dios.