Portafolio de evidencias: canalización y optimización
Machine Learning Avanzado · Semana 8
22 de junio de 2026 · NRC-8772 ·
2 entregables
De qué iba
El portafolio cerró el curso y lo armé sobre el mismo Titanic de la semana anterior, que era justo lo que el profesor autorizó en la sesión: reusar un ejercicio ya hecho y acomodarlo a la estructura de objetivos, recopilación, selección de algoritmo, evaluación y optimización. Comparé tres clasificadores dentro del mismo pipeline —Random Forest, Gradient Boosting y SVC—, primero con sus valores por defecto y luego afinados con GridSearchCV. Gradient Boosting se quedó con el mejor F1 en la línea base y en el conjunto de prueba; después de optimizar, el que más subió en validación cruzada fue el bosque, hasta 0.7816, y además terminó con el mayor AUC en prueba.
Levanté la línea base con validación cruzada estratificada de 5 particiones: Gradient Boosting arriba con F1 0.7571 y AUC 0.8710, seguido de SVC (F1 0.7358) y Random Forest (F1 0.7275)
Con GridSearchCV sobre los tres pipelines subí el F1 del bosque de 0.7275 a 0.7816, limitando la profundidad a 10 y exigiendo dos muestras por hoja como regularizador
En las 179 muestras de prueba, Gradient Boosting quedó con F1 0.7474 y 81.0% de accuracy; Random Forest con el mejor AUC, 0.8653
Agregué curva de aprendizaje para mostrar que la brecha entre entrenamiento y validación se mantuvo por debajo de 0.06
Escribí una sección de ética con el dato incómodo: el género aporta cerca del 45% de la importancia en el bosque, o sea que el modelo aprendió y repite la regla de evacuación de 1912
Qué pedían
El enunciado y la rúbrica, tal cual los publicaron.