CORPORACIÓN UNIVERSITARIA MINUTO DE DIOS
Especialización en Inteligencia Artificial
SCRIPT: UTILIZACIÓN DE DATOS DE UN DATA SET
NRC-197 Fundamentos para IA
Semana 2
EQUIPO DE TRABAJO 10
Alexander Oviedo Fadul
William David Obando López
Josmar Peña Buitrago
María Fernanda Ruiz Paipilla
Neheman Samir Jaller Cerchiaro
Docente: Dr. Breyner Alexander Parra Rojas
Enero de 2026
1. INTRODUCCIÓN
Este documento presenta el desarrollo del script solicitado para la actividad de la Semana 2 del curso Fundamentos para IA. El objetivo es demostrar la aplicación de Python y la librería Pandas para el análisis de datos, enfocándose en operaciones básicas de Ciencia de Datos.
Objetivos del script:
Cargar un dataset desde una URL externa
Explorar la estructura y características de los datos
Calcular medidas de tendencia central (media, mediana, moda)
Calcular medidas de dispersión (máximo, mínimo, desviación estándar)
Realizar análisis comparativos por grupos
Dataset utilizado: Diabetes Dataset - Datos de 442 pacientes con diabetes para análisis estadístico. Fuente: https://www4.stat.ncsu.edu/~boos/var.select/diabetes.html
2. DESARROLLO DEL SCRIPT
El script completo se encuentra en el archivo Jupyter Notebook adjunto (FIA_Semana2_Script_Equipo10.ipynb). A continuación se presenta un resumen de las principales secciones:
• Celda 1 - Importación de librerías: Se importan Pandas y NumPy, las librerías fundamentales para análisis de datos en Python.
• Celda 2 - Carga del dataset: Se utiliza pd.read_csv() para cargar los datos directamente desde la URL proporcionada.
• Celda 3 - Exploración inicial: Se visualizan las primeras filas con head() para entender la estructura de los datos.
• Celda 4 - Información general: Se utiliza info() y describe() para obtener un resumen estadístico completo.
• Celda 5 - Medidas de tendencia central: Se calculan media, mediana y moda para las variables AGE y BMI.
• Celda 6 - Medidas de dispersión: Se calculan máximo, mínimo, rango, desviación estándar y varianza.
• Celda 7 - Análisis por grupos: Se utiliza groupby() para comparar estadísticas entre hombres y mujeres.
• Celda 8 - Tabla resumen: Se consolidan todas las estadísticas en una tabla para fácil referencia.
3. RESULTADOS PRINCIPALES
Los principales hallazgos del análisis son:
| Estadística | Edad (AGE) | BMI |
|---|---|---|
| Media | ~48.5 años | ~26.4 |
| Mediana | ~50 años | ~25.7 |
| Máximo | 79 años | 42.2 |
| Mínimo | 19 años | 18.0 |
4. CONCLUSIONES
1. La edad promedio de los pacientes con diabetes en el dataset es de aproximadamente 48-49 años, lo que sugiere que esta condición afecta principalmente a la población de mediana edad.
2. El Índice de Masa Corporal (BMI) promedio supera el umbral de 25 establecido por la OMS para clasificar sobrepeso, evidenciando la correlación entre obesidad y diabetes.
3. Python y sus librerías (Pandas, NumPy) permiten realizar análisis estadísticos complejos con pocas líneas de código, facilitando la extracción de información útil de los datos.
4. El análisis de datos es fundamental para la toma de decisiones en salud, permitiendo identificar grupos de riesgo y diseñar programas de prevención personalizados.
5. Este ejercicio demuestra la importancia de la Ciencia de Datos como disciplina que transforma datos crudos en información valiosa para las organizaciones.
5. REFERENCIAS
Boschetti, A. y Massaron, L. (2018). Python Data Science Essentials: A Practitioner's Guide Covering Essential Data Science Principles, Tools, and Techniques (pp. 64-135). Packt Publishing.
So, A., Joseph, T. V., John, R. T., Worsley, A. y Asare, S. (2020). The data science workshop: A new, interactive approach to learning data science (pp. 16-36). Packt Publishing.
Mert, U., y Cuhadaroglu, M. (2018). Mastering numerical computing with NumPy: Master scientific computing and perform complex operations with ease (pp. 55-87). Packt Publishing.
Dataset de Diabetes. NC State University. Recuperado de: https://www4.stat.ncsu.edu/~boos/var.select/diabetes.html
Documentación oficial de Pandas. https://pandas.pydata.org/docs/