OviedoFadul_Alexander_Script_Equipo10.docx
Fundamentos para Inteligencia Artificial · Semana 2 · 25 de enero de 2026
← volver descargar
Lo entregué en Word con formato APA. Aquí lo puedes leer sin descargar nada, aunque los márgenes y la tipografía originales sólo están en el archivo.

CORPORACIÓN UNIVERSITARIA MINUTO DE DIOS

Especialización en Inteligencia Artificial

SCRIPT: UTILIZACIÓN DE DATOS DE UN DATA SET

NRC-197 Fundamentos para IA

Semana 2

EQUIPO DE TRABAJO 10

Alexander Oviedo Fadul

William David Obando López

Josmar Peña Buitrago

María Fernanda Ruiz Paipilla

Neheman Samir Jaller Cerchiaro

Docente: Dr. Breyner Alexander Parra Rojas

Enero de 2026

1. INTRODUCCIÓN

Este documento presenta el desarrollo del script solicitado para la actividad de la Semana 2 del curso Fundamentos para IA. El objetivo es demostrar la aplicación de Python y la librería Pandas para el análisis de datos, enfocándose en operaciones básicas de Ciencia de Datos.

Objetivos del script:

  • Cargar un dataset desde una URL externa

  • Explorar la estructura y características de los datos

  • Calcular medidas de tendencia central (media, mediana, moda)

  • Calcular medidas de dispersión (máximo, mínimo, desviación estándar)

  • Realizar análisis comparativos por grupos

Dataset utilizado: Diabetes Dataset - Datos de 442 pacientes con diabetes para análisis estadístico. Fuente: https://www4.stat.ncsu.edu/~boos/var.select/diabetes.html

2. DESARROLLO DEL SCRIPT

El script completo se encuentra en el archivo Jupyter Notebook adjunto (FIA_Semana2_Script_Equipo10.ipynb). A continuación se presenta un resumen de las principales secciones:

• Celda 1 - Importación de librerías: Se importan Pandas y NumPy, las librerías fundamentales para análisis de datos en Python.

• Celda 2 - Carga del dataset: Se utiliza pd.read_csv() para cargar los datos directamente desde la URL proporcionada.

• Celda 3 - Exploración inicial: Se visualizan las primeras filas con head() para entender la estructura de los datos.

• Celda 4 - Información general: Se utiliza info() y describe() para obtener un resumen estadístico completo.

• Celda 5 - Medidas de tendencia central: Se calculan media, mediana y moda para las variables AGE y BMI.

• Celda 6 - Medidas de dispersión: Se calculan máximo, mínimo, rango, desviación estándar y varianza.

• Celda 7 - Análisis por grupos: Se utiliza groupby() para comparar estadísticas entre hombres y mujeres.

• Celda 8 - Tabla resumen: Se consolidan todas las estadísticas en una tabla para fácil referencia.

3. RESULTADOS PRINCIPALES

Los principales hallazgos del análisis son:

Estadística Edad (AGE) BMI
Media ~48.5 años ~26.4
Mediana ~50 años ~25.7
Máximo 79 años 42.2
Mínimo 19 años 18.0

4. CONCLUSIONES

1. La edad promedio de los pacientes con diabetes en el dataset es de aproximadamente 48-49 años, lo que sugiere que esta condición afecta principalmente a la población de mediana edad.

2. El Índice de Masa Corporal (BMI) promedio supera el umbral de 25 establecido por la OMS para clasificar sobrepeso, evidenciando la correlación entre obesidad y diabetes.

3. Python y sus librerías (Pandas, NumPy) permiten realizar análisis estadísticos complejos con pocas líneas de código, facilitando la extracción de información útil de los datos.

4. El análisis de datos es fundamental para la toma de decisiones en salud, permitiendo identificar grupos de riesgo y diseñar programas de prevención personalizados.

5. Este ejercicio demuestra la importancia de la Ciencia de Datos como disciplina que transforma datos crudos en información valiosa para las organizaciones.

5. REFERENCIAS

Boschetti, A. y Massaron, L. (2018). Python Data Science Essentials: A Practitioner's Guide Covering Essential Data Science Principles, Tools, and Techniques (pp. 64-135). Packt Publishing.

So, A., Joseph, T. V., John, R. T., Worsley, A. y Asare, S. (2020). The data science workshop: A new, interactive approach to learning data science (pp. 16-36). Packt Publishing.

Mert, U., y Cuhadaroglu, M. (2018). Mastering numerical computing with NumPy: Master scientific computing and perform complex operations with ease (pp. 55-87). Packt Publishing.

Dataset de Diabetes. NC State University. Recuperado de: https://www4.stat.ncsu.edu/~boos/var.select/diabetes.html

Documentación oficial de Pandas. https://pandas.pydata.org/docs/