# 🎬 Prompt para Video con Voz en Off — Semana 7 MLA
## Automatización de Procesos para el Flujo de Trabajo en Machine Learning
### NRC-8772 — Machine Learning Avanzado — Grupo 10 (Ponente: Alexander Oviedo Fadul)

### Integrantes del Grupo 10
- Alexander Oviedo Fadul (Ponente)
- Maria Fernanda Ruiz Paipilla
- Neheman Samir Jaller Cerchiaro
- William David Obando Lopez

---

## Instrucciones de producción

| Aspecto | Especificación |
|---------|---------------|
| **Duración máxima** | 5 minutos |
| **Formato** | Video con voz en off (se permite TTS) |
| **Secciones obligatorias** | 4: Introducción, Diseño del Pipeline, Resultados y Discusión Ética, Conclusiones |
| **Plataforma** | Subir a YouTube (sin restricciones de visualización) |
| **Herramientas sugeridas** | Canva, OBS Studio, PowerPoint + grabación, Google Slides |
| **TTS sugerido** | ElevenLabs, Google Text-to-Speech, NaturalReader |

---

## Guión completo para TTS / Voz en Off

### 🎬 INTRODUCCIÓN Y CONTEXTO (0:00 – 0:45)

> Bienvenidos a esta presentación sobre la automatización de procesos para el flujo de trabajo en Machine Learning, utilizando el histórico dataset de supervivencia del Titanic. Este trabajo corresponde a la actividad de la semana 7 del curso de Machine Learning Avanzado, NRC ocho siete siete dos.
>
> Mi nombre es Alexander Oviedo Fadul y, en representación del Grupo 10 —integrado por Maria Fernanda Ruiz Paipilla, Neheman Samir Jaller Cerchiaro, William David Obando Lopez y mi persona—, les detallaré cómo diseñamos un flujo de trabajo automatizado, robusto y ético empleando pipelines de scikit-learn.
>
> En la industria del software, automatizar estos procesos es crucial para asegurar la reproducibilidad, evitar la fuga de datos y optimizar el ciclo de vida del modelado.

**🖥️ En pantalla:** Diapositiva de título con el logotipo de UNIMINUTO, identificación del Grupo 10, listado de integrantes y rol del ponente (Alexander Oviedo Fadul).

---

### 📐 DISEÑO DEL PIPELINE Y FEATURE ENGINEERING (0:45 – 2:15)

> **[0:45]** Comencemos con el diseño metodológico. Para esta actividad, el principal reto técnico consistió en procesar datos de distinta naturaleza sin incurrir en fuga de datos o data leakage. La fuga de datos ocurre cuando la información del conjunto de validación o prueba se filtra en la fase de entrenamiento, lo que infla artificialmente el rendimiento del modelo.
>
> **[1:10]** Para evitar esto, diseñamos un preprocesador central utilizando la clase ColumnTransformer de scikit-learn. Las variables numéricas son tratadas en un pipeline que imputa los valores faltantes con la mediana y normaliza las escalas con StandardScaler. Las variables categóricas se imputan con la moda y se transforman mediante OneHotEncoder.
>
> **[1:35]** Adicionalmente, aplicamos ingeniería de características para extraer patrones sociales implícitos en los nombres. Creamos la variable 'family_size' sumando el número de hermanos, cónyuges, padres e hijos a bordo, y definimos la variable lógica 'is_alone' para identificar a los pasajeros que viajaban solos. También extrajimos los títulos de cortesía del nombre como proxies de estatus y rango de edad.
>
> **[1:55]** Finalmente, encapsulamos este preprocesador en serie con los clasificadores dentro de un objeto Pipeline unificado. Esto nos permite entrenar y evaluar todo el flujo en un solo bloque estructurado.

**🖥️ En pantalla:** Esquema conceptual del ColumnTransformer y Pipeline. Bloques de código de ingeniería de características y pipelines de Random Forest y SVM.

---

### 📊 COMPARATIVA Y RESULTADOS DEL MODELADO (2:15 – 3:45)

> **[2:15]** Evaluamos dos familias de clasificadores complementarios: Random Forest, basado en ensambles de árboles de decisión, y Support Vector Machine (o SVM) con kernel radial RBF.
>
> **[2:35]** Para encontrar los mejores parámetros de forma automatizada, integramos GridSearchCV directamente en el Pipeline. Esto nos permitió optimizar la profundidad de los árboles en Random Forest y las constantes de regularización en SVM, maximizando el F1-score mediante una validación cruzada de 5 particiones (o 5-Fold Cross Validation).
>
> **[3:00]** Los resultados en validación cruzada revelaron un rendimiento sumamente competitivo y balanceado. El Accuracy promedio de ambos modelos superó el 81 por ciento. Al comparar el F1-score promedio, SVM obtuvo un 76.15 por ciento, superando ligeramente al 75.92 por ciento de Random Forest.
>
> **[3:20]** Random Forest mostró una mayor precisión promedio de 77.84 por ciento, lo que significa que comete menos falsos positivos. Por otro lado, SVM destacó con un Recall del 76.01 por ciento, mostrando una mayor sensibilidad para identificar correctamente a las personas que sobrevivieron. Las matrices de confusión ratifican que el modelo es robusto ante datos nunca antes vistos.

**🖥️ En pantalla:** Tabla comparativa de métricas (Accuracy, Precision, Recall, F1-score) y matrices de confusión (heatmaps) para ambos modelos en el conjunto de prueba.

---

### ⚖️ ÉTICA DE LA IA Y SESGO ALGORÍTMICO (3:45 – 4:30)

> **[3:45]** Como profesionales de la Inteligencia Artificial, no podemos limitarnos a optimizar números; debemos auditar el contexto social de los datos. El dataset del Titanic expone un claro sesgo histórico, donde la supervivencia estuvo fuertemente determinada por la regla implícita de 'mujeres y niños primero' y el acceso privilegiado de la primera clase frente a la clase trabajadora.
>
> **[4:05]** Si entrenamos un modelo de IA con estos datos sin una auditoría ética previa, el algoritmo aprenderá y automatizará el prejuicio de que salvar a los hombres y a las clases trabajadoras es una prioridad estadística menor. Tal como señalan autores como Béranger y Carsten, la toma de decisiones automatizada no es neutra: hereda y perpetúa las desigualdades humanas. Por ello, la gobernanza de datos y la equidad algorítmica deben formar parte fundamental de todo flujo de trabajo.

**🖥️ En pantalla:** Diapositiva sobre Ética de la IA, citando a Carsten (2020) y Béranger (2018), con gráficos que muestran la tasa de supervivencia segregada por género y clase social.

---

### 🎬 CONCLUSIONES Y CIERRE (4:30 – 5:00)

> **[4:30]** En conclusión, el uso de Pipelines y ColumnTransformers en scikit-learn simplifica drásticamente el flujo de modelado y garantiza la solidez del proceso al eliminar la fuga de datos. Los modelos Random Forest y SVM demostraron ser altamente competitivos, logrando un excelente equilibrio entre precisión y sensibilidad. Por último, la auditoría ética de los modelos es un paso insustituible para evitar la reproducción de sesgos discriminatorios en sistemas automáticos.
>
> **[4:50]** Agradecemos su atención. En representación del Grupo 10 de Machine Learning Avanzado, les habló Alexander Oviedo Fadul. Hasta pronto.

**🖥️ En pantalla:** Diapositiva final con resumen de conclusiones, el enlace al código interactivo en Google Colab y las referencias bibliográficas en formato APA 7.

---

## Storyboard visual (resumen)

| Tiempo | Sección | En pantalla | Narración |
|--------|---------|-------------|-----------|
| 0:00-0:45 | Intro | Diapositiva de portada con datos del grupo | Presentación del grupo y relevancia de MLOps |
| 0:45-1:35 | Diseño Pipeline | Gráfico de ColumnTransformer y Pipeline | Descripción del flujo y prevención de Data Leakage |
| 1:35-2:15 | Feature Engineering | Código con family_size, is_alone y title | Ingeniería de características para capturar patrones |
| 2:15-3:00 | Modelado | Explicación de GridSearchCV y CV de 5 folds | Configuración de optimización de hiperparámetros |
| 3:00-3:45 | Resultados | Tabla comparativa y matrices de confusión | Comparativa métricas de Random Forest vs. SVM |
| 3:45-4:30 | Ética de la IA | Dilemas éticos, citas y tasas de supervivencia | Discusión sobre sesgo algorítmico y género |
| 4:30-5:00 | Cierre | Conclusiones, Enlace Colab y Referencias | Conclusiones técnicas y despedida |

---

## Referencias bibliográficas para el video

- Béranger, J. (2018). *The Framework for Algorithmic Processing*. En The algorithmic code of ethics: Ethics at the bedside of the digital revolution (pp. 122-164). John Wiley & Sons, Incorporated.
- Campesato, O. (2020). *Classifiers in Machine Learning*. En Artificial intelligence, machine learning, and deep learning (pp. 63-66). Mercury Learning and Information.
- Carsten, B. (2020). *Ethical Issues of AI*. En Artificial Intelligence for a Better Future (pp. 35-53). Springer.
- Janiesch, C., Zschech, P. y Heinrich, K. (2021). *Aprendizaje automático y aprendizaje profundo*. Electron Markets, 31, 685-695.
- Valderrama García, L. (2026, 20 de junio). *Clase 7: Automatización de procesos para el flujo de trabajo en Machine Learning* [Clase magistral]. NRC-8772 Machine Learning Avanzado, Corporación Universitaria Minuto de Dios.

---

## Notas de producción

1. **Duración estricta:** El video debe durar máximo 5 minutos.
2. **Material visual:** Utiliza capturas de las gráficas de EDA y de la matriz de confusión generadas en el cuaderno `Grupo10_MLA_Automatizacion_S7.ipynb`.
3. **Conversión a voz:** Puedes copiar directamente el texto dentro de las comillas angulares (`>`) e ingresarlo en una plataforma TTS (como ElevenLabs) configurando una voz profesional en español para Alexander Oviedo Fadul.
4. **Entrega final:** El enlace de YouTube resultante del video debe colocarse en el cuaderno de Jupyter y en el reporte final de Word (.docx).
