El docente compartió 1 cuaderno esta semana. No lo subo: es suyo.
De qué iba
Trabajé los dos conjuntos de datos del repositorio UCI que pedía el anexo: Adult Census Income y Congressional Voting Records. Cargué ambos con pandas, revisé qué faltaba, imputé por moda las categóricas y quité los 24 duplicados de Adult, con lo que pasé de 32.561 a 32.537 filas. Los extremos de capital_gain y capital_loss los dejé quietos: el máximo llega a 99.999 y son ganancias reales, así que lo expliqué en el informe en vez de borrarlos. Entregué el documento en Word con portada y el enlace al cuaderno de Colab, con el código comentado paso a paso.
Imputé por moda las tres columnas de Adult que traían '?': workclass con 1.836 faltantes, occupation con 1.843 y native_country con 583
Quité 24 registros duplicados en Adult, así que pasé de 32.561 a 32.537 filas; en el dataset de votos no había ninguno
Dejé los valores extremos de capital_gain y capital_loss (el máximo llega a 99.999) sin eliminar, porque son ganancias reales, y expliqué esa decisión en el informe
Escribí un script aparte que vuelve a cargar los dos datasets y verifica que las cifras del documento cuadren con lo que sale al ejecutar
Lo que costó. Descargar los archivos .data directamente desde las URLs de UCI me fallaba en el Mac con SSLCertVerificationError bajo Python 3.13. Terminé escribiendo un configurar_ssl.py que ajusta el contexto SSL antes de leer las URLs, y de ahí en adelante cargó sin problema.
Qué pedían
El enunciado y la rúbrica, tal cual los publicaron.