Automatización del flujo con pipelines de scikit-learn
Machine Learning Avanzado · Semana 7
15 de junio de 2026 · NRC-8772 ·
3 entregables
El docente compartió 2 cuadernos esta semana. No los subo: son suyos.
De qué iba
Aquí se trataba de automatizar el flujo, así que metí todo el preprocesamiento dentro de un ColumnTransformer: mediana y StandardScaler para las numéricas, moda y OneHotEncoder para las categóricas, passthrough para la binaria. Saqué el título de cortesía del nombre de cada pasajero con una expresión regular y agrupé los raros bajo una sola etiqueta. Optimicé Random Forest y SVM con GridSearchCV apuntando al F1 y los comparé con validación cruzada de cinco particiones. Fui el ponente del grupo: escribí el guión completo de los cinco minutos de voz en off, con las cuatro secciones que pedían, y el video quedó armado y entregado como Automatización_en_ML.mp4.
Encadené preprocesamiento y clasificador en un solo objeto Pipeline, de modo que la imputación y el escalado se recalculan dentro de cada fold y no se filtra información del conjunto de prueba
GridSearchCV dejó el bosque en max_depth 8, min_samples_split 5 y 50 árboles (F1 0.7656) y el SVM en C=10 con gamma 'auto' (F1 0.7574)
En validación cruzada el bosque marcó 0.8936 de accuracy en entrenamiento contra 0.8216 en validación, y en el conjunto de prueba terminó en 82%
Escribí el guión completo de los cinco minutos de voz en off del video, con las cuatro secciones exigidas, y grabé la sustentación
Añadí una sección sobre sesgo algorítmico: sex y pclass dominan la predicción porque el modelo memoriza las reglas sociales de 1912
Lo que costó. El enunciado de la semana venía en PDF de imagen. La extracción de texto salió vacía y el OCR que corrí con ocr_pdfs.py devolvió puro ruido ilegible; me quedé leyendo el anexo MachineLearning_Actividad_S7_180423_V2.pdf, que sí traía texto.
Qué pedían
El enunciado y la rúbrica, tal cual los publicaron.