Esta semana fueron dos partes. Primero un script de entrenamiento sobre Iris siguiendo lo que el profesor mostró en la sesión del 21 de febrero, con énfasis en usar stratify al dividir: 120 muestras de entrenamiento y 30 de prueba, 0,9667 de accuracy con regresión logística y 0,9333 con el árbol de decisión. Después el estudio de caso de verdad: clasificar tumores benignos y malignos del Breast Cancer Wisconsin, 569 muestras repartidas en 455 y 114. La regresión logística llegó a 0,9825 de accuracy con 0,976 de recall en la clase maligna; el Random Forest se quedó en 0,9561 y 0,9286. Argumenté que aquí la métrica que decide no es el accuracy sino el recall de la clase maligna, porque un falso negativo es un tumor que se pasa por alto. De la importancia de variables del Random Forest quedó de primera 'worst area', con 0,1400.
En Iris entrené regresión logística y árbol de decisión con división estratificada 120/30, y quedaron en 0,9667 y 0,9333 de accuracy
En Breast Cancer Wisconsin (569 muestras, 455 de entrenamiento y 114 de prueba) la regresión logística llegó a 0,9825 de accuracy con 0,976 de recall en la clase maligna, por encima del Random Forest, que se quedó en 0,9561 y 0,9286
Argumenté que en este caso la métrica que decide no es el accuracy sino el recall de la clase maligna, porque un falso negativo es un tumor que se pasa por alto
Saqué la importancia de variables del Random Forest y 'worst area' quedó de primera con 0,1400
Qué pedían
El enunciado y la rúbrica, tal cual los publicaron.