Clustering K-Means sobre Adult Census Income

Machine Learning · Semana 4

9 de febrero de 2026 · NRC-200 · 3 entregables

De qué iba

Volví al dataset Adult, pero usado al revés: sin mirar la etiqueta de ingresos, a ver qué encontraba K-Means por su cuenta. Estandaricé, busqué el número de grupos con el codo y la silueta, entrené y después crucé los clusters con la columna de ingresos para ver si el algoritmo había descubierto algo parecido a la realidad económica.

  • Estandaricé cinco variables numéricas (age, education_num, capital_gain, capital_loss, hours_per_week) y dejé fuera fnlwgt, que es un peso de muestreo del censo y no una característica de la persona
  • Evalué K de 2 a 10 con inercia y silueta, entrené el modelo final con K=4 (inercia 79.738 y silueta 0,2576) y proyecté los grupos con PCA, que en dos componentes solo alcanzó a explicar el 46,54 % de la varianza
  • Al cruzar clusters contra ingresos apareció el hallazgo que más me gustó: el grupo más pequeño, de 159 registros, tiene capital_gain de 99.999 y el 100 % gana más de 50K
  • Presenté el quiz de puntos extra el 9 de febrero

Lo que costó. La silueta seguía subiendo hasta K=10 y aun así me quedé en K=4. Preferí poder contar una historia con los grupos antes que ganar unas centésimas en la métrica, y lo dejé escrito en el cuaderno: un clustering que no puedo explicar no me sirve de mucho.

Qué pedían

El enunciado y la rúbrica, tal cual los publicaron.

ML_Actividad_S4.pdfdocumento · 256,8 KB

Qué entregué

Lo que salió de esa semana.

ML_Semana4_Taller.ipynbcuaderno · 574,9 KB · 32 celdas
Oviedo_Alexander_Taller.docxinforme · 27,8 KB · 174 palabras
Oviedo_Alexander_Taller.pdfdocumento · 46,7 KB

El examen de la semana

Presenté el cuestionario opcional de puntos extra. No publico las respuestas ni la nota: era una evaluación.

Lo que usé por el camino

Notas sueltas, datos y código de apoyo.

Analisis_Recursos_S4.mdnota · 6,7 KB
generar_docx_portada.pyscript · 7,7 KB

Seguir leyendo

Esa misma semana, en las otras materias: