TALLER: ADQUISICIÓN Y ADECUACIÓN DE BASE DE DATOS
Machine Learning - Semana 2
Presentado por:
Alexander Oviedo Fadul
Presentado a:
Docente de Machine Learning
Curso:
NRC-200 Machine Learning
Corporación Universitaria Minuto de Dios
Enero 2026
1. Introducción
El presente documento presenta el análisis de limpieza y adecuación de datos realizado sobre dos conjuntos de datos del repositorio UCI Machine Learning: Adult Census Income y Congressional Voting Records. El objetivo principal es aplicar técnicas de tratamiento de datos que permitan preparar estos datasets para su uso en modelos de Machine Learning.
1.1 Objetivo
Aplicar el proceso de adecuación de datos (limpieza) a conjuntos de datos proporcionados para utilizarlos en modelos de Machine Learning.
1.2 Datasets Utilizados
| Dataset | Registros | Variables | Variable Objetivo |
|---|---|---|---|
| Adult Census Income | 32,561 | 15 | income (≤50K / >50K) |
| Congressional Voting | 435 | 17 | class (republican/democrat) |
2. Análisis del Dataset Adult Census Income
2.1 Descripción
Este dataset proviene del Censo de EE.UU. de 1994 y contiene información demográfica y laboral. El objetivo es predecir si una persona gana más o menos de $50,000 al año.
2.2 Problemas Identificados
• Valores faltantes: Se encontraron valores representados con '?' en las columnas workclass (1,836), occupation (1,843) y native_country (583).
• Duplicados: Se identificaron 24 registros duplicados.
• Outliers: Las variables capital_gain y capital_loss presentan valores extremadamente altos (máximo de 99,999).
2.3 Tratamiento Aplicado
1. Imputación de valores faltantes: Se utilizó la moda (valor más frecuente) para imputar las variables categóricas:
- workclass → 'Private'
- occupation → 'Prof-specialty'
- native_country → 'United-States'
2. Eliminación de duplicados: Se removieron 24 registros duplicados.
3. Outliers: Se identificaron pero no se eliminaron, ya que representan casos reales de altas ganancias de capital.
2.4 Resultados
• Registros originales: 32,561
• Registros finales: 32,537
• Valores faltantes restantes: 0
• Dataset listo para modelado: Sí
3. Análisis del Dataset Congressional Voting Records
3.1 Descripción
Este dataset contiene los votos de los miembros del Congreso de EE.UU. en 16 temas clave durante 1984. El objetivo es clasificar si un congresista es Republicano o Demócrata basándose en sus patrones de votación.
3.2 Problemas Identificados
• Valores faltantes: El símbolo '?' representa abstenciones o votos no registrados. Se encontraron valores faltantes en 16 de las 17 columnas, con porcentajes entre 2% y 24%.
• Variables: Todas las variables son categóricas (y/n/?), lo cual es apropiado para este tipo de análisis.
3.3 Tratamiento Aplicado
1. Imputación de valores faltantes: Se utilizó la moda para cada columna de votación. Esto significa que las abstenciones fueron reemplazadas por el voto mayoritario en cada tema.
2. Verificación de duplicados: No se encontraron registros duplicados en este dataset.
3.4 Resultados
• Registros originales: 435
• Registros finales: 435
• Valores faltantes restantes: 0
• Distribución de clases:
- Demócratas: 267 (61.4%)
- Republicanos: 168 (38.6%)
4. Conclusiones
El tratamiento de datos es un paso fundamental en cualquier proyecto de Machine Learning. A través de este taller se evidenció la importancia de:
1. Explorar los datos antes de cualquier tratamiento para identificar problemas de calidad.
2. Seleccionar estrategias de imputación apropiadas según el tipo de variable (moda para categóricas, mediana para numéricas con outliers).
3. Documentar cada decisión tomada durante el proceso de limpieza para garantizar reproducibilidad.
4. Verificar el estado final de los datos para confirmar que están listos para el modelado.
La calidad del modelo depende directamente de la calidad de los datos. Datos con errores, valores faltantes o ruido generan modelos poco confiables.
5. Referencias Bibliográficas
Dua, D., & Graff, C. (2019). UCI Machine Learning Repository. University of California, Irvine. https://archive.ics.uci.edu/ml
Rothman, D. (2018). Artificial Intelligence by Example: Develop Machine Intelligence from Scratch Using Real Artificial Intelligence Use Cases (pp. 30-45). Packt Publishing.
Bishop, C. M. (2006). Pattern Recognition and Machine Learning (pp. 67-76, 136-182). Springer.
Boschetti, A., & Massaron, L. (2018). Python Data Science Essentials: A Practitioner's Guide Covering Essential Data Science Principles, Tools, and Techniques (3rd ed., pp. 35-58). Packt Publishing.