Volví al dataset Adult, pero usado al revés: sin mirar la etiqueta de ingresos, a ver qué encontraba K-Means por su cuenta. Estandaricé, busqué el número de grupos con el codo y la silueta, entrené y después crucé los clusters con la columna de ingresos para ver si el algoritmo había descubierto algo parecido a la realidad económica.
Estandaricé cinco variables numéricas (age, education_num, capital_gain, capital_loss, hours_per_week) y dejé fuera fnlwgt, que es un peso de muestreo del censo y no una característica de la persona
Evalué K de 2 a 10 con inercia y silueta, entrené el modelo final con K=4 (inercia 79.738 y silueta 0,2576) y proyecté los grupos con PCA, que en dos componentes solo alcanzó a explicar el 46,54 % de la varianza
Al cruzar clusters contra ingresos apareció el hallazgo que más me gustó: el grupo más pequeño, de 159 registros, tiene capital_gain de 99.999 y el 100 % gana más de 50K
Presenté el quiz de puntos extra el 9 de febrero
Lo que costó. La silueta seguía subiendo hasta K=10 y aun así me quedé en K=4. Preferí poder contar una historia con los grupos antes que ganar unas centésimas en la métrica, y lo dejé escrito en el cuaderno: un clustering que no puedo explicar no me sirve de mucho.
Qué pedían
El enunciado y la rúbrica, tal cual los publicaron.