# Analisis de Recursos — Semana 6
## NRC-197 Fundamentos para Inteligencia Artificial

**Estudiante:** Alexander Oviedo Fadul
**Actividad:** Script de Analisis Estadistico (Semana 6)
**Fecha:** 23 de febrero de 2026

---

## 1. Requerimientos de la Actividad (FIA_Actividad_S6.pdf)

La actividad solicita el desarrollo de un **script en Python** (cuaderno de Jupyter) que aplique, sobre un conjunto de datos de libre acceso, los siguientes conceptos estadisticos:

| N° | Concepto Requerido | Descripcion |
|----|-------------------|-------------|
| 1 | Medidas de posicion central | Media, mediana y moda |
| 2 | Relacion entre medias | Media aritmetica, geometrica y armonica |
| 3 | Medidas de posicion no central | Cuartiles, percentiles, rango intercuartilico |
| 4 | Medidas de dispersion | Rango, varianza, desviacion estandar, coeficiente de variacion |
| 5 | Asimetria y curtosis | Skewness y kurtosis de la distribucion |
| 6 | Frecuencias | Tabla de frecuencias absolutas, relativas y acumuladas |
| 7 | Graficos | Graficos embebidos que ilustren los analisis anteriores |

**Estructura requerida del trabajo:**
- Portada (titulo, nombre, curso, semana, docente, fecha)
- Script comentado con resultados identificados
- Conclusiones
- Referencias en formato APA

**Dataset utilizado:** Diabetes Dataset — NCSU / scikit-learn
Referencia: https://www4.stat.ncsu.edu/~boos/var.select/diabetes.html

---

## 2. Analisis de Recursos — Tematicas Extraidas por Archivo

### 2.1 Boschetti, A. y Massaron, L. (2018). *Python Data Science Essentials*. Packt Publishing.
**Paginas asignadas en la actividad: pp. 281–331**
**Capitulo cubierto: Capitulo 5 — Visualization, Insights, and Results**

| Paginas del libro | Tema cubierto | Relevancia para la actividad |
|-------------------|---------------|------------------------------|
| p. 282–283 | Introduccion a visualizacion de datos con Python; reglas basicas de visualizacion de datos | Base conceptual para los graficos del script |
| p. 284–287 | Configuracion de Matplotlib inlineen Jupyter; creacion de graficos de lineas, curvas y paneles multiples | Tecnica aplicada en las figuras del script |
| p. 288–290 | Diagramas de dispersion (scatterplots) para analizar relaciones entre variables; histogramas conjuntos | Grafico scatter BMI vs target del script |
| p. 291–292 | Graficos de barras (horizontales y verticales) para comparacion de categorias | Grafico de frecuencias por intervalo del script |
| p. 296–300 | Herramientas EDA de Pandas DataFrame: boxplots, histogramas, graficos de densidad (KDE), hexbins | Boxplot y panel de distribucion del script |
| p. 301–302 | Matriz de scatterplots y coordenadas paralelas para descubrimiento de patrones | Mapa de correlaciones del script |
| p. 303–310 | Comandos completos de Matplotlib; introduccion a Seaborn, temas y paletas de colores | Estilo visual y paleta de colores del script |
| p. 311–316 | Seaborn para EDA: countplot, regplot, jointplot, pairplot, violin plot, FacetGrid | Visualizaciones avanzadas del script |
| p. 317–322 | Representaciones avanzadas: curvas de aprendizaje, curvas de validacion | Contexto de modelos de ML ligados al EDA |
| p. 323–331 | Importancia de caracteristicas en modelos (RandomForest, Gradient Boosting); despliegue de resultados con Flask | Conexion con semanas siguientes (regresion) |

**Correspondencia con la actividad:** Alta. El capítulo 5 pp.282-316 cubre directamente las tecnicas de visualizacion usadas en el script (histograma, boxplot, scatter, heatmap, barras, panel comparativo).

---

### 2.2 Cady, F. (2020). *Data Science: The Executive Summary*. John Wiley & Sons.
**Paginas asignadas en la actividad: pp. 55–95**
**Capitulo cubierto: Capitulo 4 — Telling the Story, Summarizing Data**

| Paginas del libro | Tema cubierto | Relevancia para la actividad |
|-------------------|---------------|------------------------------|
| p. 55–56 | Introduccion a la sintesis de datos; importancia de graficos y resumenes estadisticos frente a modelos complejos | Marco conceptual del analisis |
| p. 57–58 | Eleccion de metricas de medicion; importancia de que la metrica elegida sea objetiva y representativa | Justificacion del uso de la variable target |
| p. 58–60 | Outliers, visualizaciones y limites de las estadisticas de resumen; cuarteto de Anscombe | Deteccion de outliers con metodo Tukey |
| p. 63–65 | **Medidas de tendencia central**: media, mediana, moda; cuando usar cada una; robustez de la mediana frente a outliers | Seccion 3 del script (posicion central) |
| p. 65–68 | **Medidas de dispersion**: desviacion estandar, varianza, rango intercuartilico (IQR); boxplots como herramienta visual de dispersion | Secciones 5 y 6 del script |
| p. 68–69 | Graficos de cola pesada; distribucion de frecuencias acumuladas | Seccion 8 del script (frecuencias) |
| p. 69–72 | **Correlaciones y diagramas de dispersion**; correlacion de Pearson vs Spearman | Seccion de mapa de calor y scatter del script |
| p. 73–76 | Ajuste de lineas y curvas; residuos y precision del modelo | Anticipa la regresion lineal de semana 7 |
| p. 77–82 | Estadistica: como no engañarse; pruebas de hipotesis; valor-p; hipotesis nula y alternativa | Contexto de estadistica inferencial (clase) |
| p. 82–85 | **Intervalos de confianza**; T-test de Student; pruebas de dos grupos | Tema central de la sesion de clase |
| p. 87–95 | **Distribuciones de probabilidad**: normal, Bernoulli, binomial, uniforme, exponencial, Pareto | Contexto estadistico subyacente al analisis |

**Correspondencia con la actividad:** Muy alta. Las paginas 63-68 son la referencia directa para las medidas de posicion central y dispersion del script. Las paginas 77-85 fundamentan la estadistica inferencial tratada en clase.

---

### 2.3 Fuentes, A. (2018). *Become a Python Data Analyst*. Packt Publishing.
**Paginas asignadas en la actividad: pp. 121–156** *(recurso complementario)*
**Capitulo cubierto: Capitulo 5 — Statistical Computing with Python**

| Paginas del libro | Tema cubierto | Relevancia para la actividad |
|-------------------|---------------|------------------------------|
| p. 121–122 | Introduccion a SciPy para computacion cientifica; modulos principales (`scipy.stats`) | Uso de `scipy.stats` en el script |
| p. 122–124 | Estadistica descriptiva con SciPy: media, mediana, moda, varianza, rango | Funciones usadas en secciones 3-6 del script |
| p. 124–126 | Pruebas de normalidad; histogramas de distribucion; comparacion con distribucion normal | Interpretacion de asimetria y curtosis |
| p. 127–130 | **Asimetria (skewness) y curtosis (kurtosis)**: calculo con `scipy.stats.skew` y `scipy.stats.kurtosis` | Seccion 7 del script |
| p. 130–133 | Pruebas de hipotesis con SciPy: t-test, correlaciones, regresion lineal simple | Antepone la semana 7 |
| p. 133–137 | Chi-cuadrado (`chi2_contingency`); analisis de tablas de contingencia | Estadistica inferencial aplicada |
| p. 139–156 | Introduccion a modelos predictivos: regresion logistica, clasificacion | Anticipacion de semana 8 |

**Correspondencia con la actividad:** Alta para el aspecto tecnico. El capitulo 5 justifica el uso de `scipy.stats` para el calculo de skewness, kurtosis, medias alternativas y la prueba de hipotesis posterior.

---

### 2.4 Articulo: *Introduction to ANOVA for Statistics and Data Science* (GeeksForGeeks, 2024)
**Recurso complementario — sin paginas de libro asignadas; recurso de acceso libre**

| Paginas del PDF | Tema cubierto | Relevancia para la actividad |
|-----------------|---------------|------------------------------|
| p. 1 | Introduccion al ANOVA; motivacion con caso COVID-19 | Extiende la estadistica inferencial de clase |
| p. 2–3 | Definicion de ANOVA como generalizacion del t-test para mas de 2 grupos; hipotesis nula y alternativa | Hypothesis testing visto en clase |
| p. 4–8 | ANOVA de una via (One-Way ANOVA); supuestos (normalidad, homogeneidad de varianzas) | Pruebas de validacion de modelos |
| p. 9–13 | ANOVA de dos vias (Two-Way ANOVA); efectos de interaccion entre variables | Estadistica inferencial avanzada |
| p. 14–18 | Implementacion en Python (`statsmodels`, `ols`, `anova_lm`); graficos Q-Q | Liberia alternativa a SciPy |
| p. 18–28 | Estudio de caso COVID-19: transformacion Box-Cox, modelo OLS, interpretacion de p-values | Ejemplo practico de estadistica inferencial |
| p. 28–29 | Prueba post-hoc Tukey HSD; diferencias significativas entre grupos | Contexto de los outliers detectados en el script |

**Correspondencia con la actividad:** Media-alta como recurso de contexto. El ANOVA extiende el analisis estadistico mas alla de la estadistica descriptiva, conectando con la estadistica inferencial discutida en clase.

---

### 2.5 Articulo: *How to Perform ANOVA in Python* (Statology / complementario)
**Recurso complementario adicional — acceso libre**

| Paginas del PDF | Tema cubierto | Relevancia para la actividad |
|-----------------|---------------|------------------------------|
| p. 1–5 | ANOVA de una via con `scipy.stats.f_oneway`; interpretacion del estadistico F y valor-p | Uso de `scipy.stats` en el script |
| p. 6–12 | Supuestos del ANOVA: normalidad (Shapiro-Wilk), homogeneidad de varianzas (Levene) | Validacion de supuestos estadisticos |
| p. 13–20 | Ejemplos practicos de ANOVA aplicados a datos numericos en Python | Codigo replicable con el dataset de diabetes |
| p. 21–29 | Prueba Welch ANOVA para datos no homogeneos; Games-Howell como prueba post-hoc | Variantes robustas para datos reales |
| p. 30–35 | Repeated Measures ANOVA; comparacion entre grupos con medidas repetidas | Estadistica avanzada para semanas siguientes |

**Correspondencia con la actividad:** Media. Util como referencia de contexto para la validacion de hipotesis sobre los grupos del dataset de diabetes.

---

## 3. Validacion: Correspondencia entre Recursos y Actividad

| Requerimiento de la actividad | Cubierto en recursos | Paginas de referencia |
|-------------------------------|---------------------|-----------------------|
| Medidas de posicion central (media, mediana, moda) | Cady (2020), Fuentes (2018) | Cady pp.63-65; Fuentes pp.122-124 |
| Relacion entre medias | Cady (2020) | Cady pp.63-65 |
| Medidas de posicion no central (cuartiles, percentiles) | Cady (2020) | Cady pp.65-68 |
| Medidas de dispersion (varianza, desv. est., CV) | Cady (2020), Fuentes (2018) | Cady pp.65-68; Fuentes pp.122-124 |
| Asimetria y curtosis | Fuentes (2018) | Fuentes pp.127-130 |
| Frecuencias | Cady (2020), Boschetti (2018) | Cady pp.68-69; Boschetti pp.291-292 |
| Graficos (histograma, boxplot, scatter, heatmap) | Boschetti (2018) | Boschetti pp.283-316 |
| Uso de Python (librerías NumPy, Pandas, SciPy, Seaborn) | Boschetti (2018), Fuentes (2018) | Boschetti pp.282-316; Fuentes pp.121-136 |
| Dataset de libre acceso | Solicitado por actividad | https://www4.stat.ncsu.edu/~boos/var.select/diabetes.html |
| Estructura: portada, script comentado, conclusiones, referencias APA | Especificado en actividad | FIA_Actividad_S6.pdf, p.3 |

**Resultado de la validacion:** Todos los requerimientos de la actividad cuentan con soporte bibliografico en los recursos de la Semana 6.

---

## 4. Validacion del Cuaderno Oviedo_Alexander_Script.ipynb

### 4.1 Estructura

| Elemento requerido | Presente en el .ipynb | Observacion |
|-------------------|----------------------|-------------|
| Portada con datos del estudiante | Si | Tabla con nombre, curso, docente, semana, fecha |
| Introduccion contextualizada | Si | Conecta con MARDUK y la sesion de clase |
| Importacion de librerias comentada | Si | NumPy, Pandas, SciPy, Seaborn, Matplotlib, sklearn |
| Carga y descripcion del dataset | Si | Diabetes NCSU via sklearn; 442 obs. x 11 variables |
| Medidas de posicion central | Si | Media, mediana, moda con interpretacion automatica |
| Relacion entre medias | Si | Aritmetica, geometrica y armonica con verificacion de propiedad |
| Medidas de posicion no central | Si | Q1, Q2, Q3, IQR, P10, P90, limites Tukey, conteo de outliers |
| Medidas de dispersion | Si | Rango, varianza muestral, desv. est., CV, error estandar |
| Asimetria y curtosis | Si | `scipy.stats.skew` y `scipy.stats.kurtosis` (Fisher) |
| Tabla de frecuencias | Si | 8 intervalos; frecuencias absolutas, relativas y acumuladas |
| Resumen integrado | Si | Tabla consolidada de todas las metricas |
| Grafico — Histograma + KDE + medidas centrales | Si | Lineas de media, mediana y moda sobrepuestas |
| Grafico — Boxplot con cuartiles y outliers | Si | Metodo Tukey; anotaciones de Q1 y Q3 |
| Grafico — Mapa de calor de correlaciones | Si | Triangulo inferior con valores numericos |
| Grafico — Scatter BMI vs target con linea de tendencia | Si | Regresion lineal simple (anticipa semana 7) |
| Grafico — Barras de frecuencias por intervalo | Si | Etiquetas de valores sobre cada barra |
| Grafico — Panel comparativo multi-variable | Si | 5 variables con media y mediana superpuestas |
| Conclusiones humanizadas | Si | 5 reflexiones con perspectiva LegalTech |
| Referencias APA | Si | Boschetti, Cady, Fuentes, Pedregosa et al., Efron et al. |

### 4.2 Aspectos por Mejorar (detectados en esta revision)

1. **Emoticones:** El notebook original usa emoticones en exceso (emojis tipo `📊`, `📦`, etc.). La actividad solicita presentacion formal y los recursos de humanizacion del docente indican uso minimo. Se eliminarán en la version final.

2. **Comentarios en el codigo:** Algunos bloques requieren comentarios mas detallados que expliquen no solo el *que* sino el *por que* de cada funcion estadistica. Se ampliaran.

3. **Referencias APA con paginas exactas:** Las referencias deben incluir las paginas especificas de los recursos de la Semana 6 donde se encuentra la informacion utilizada. Se actualizaran.

4. **URL de Google Colab:** Se incluira el campo de URL en la portada para cuando el estudiante suba el cuaderno.

---

## 5. Correspondencia con la Sesion de Clase (Transcripcion del 21-feb-2026)

Los siguientes temas tratados en clase corresponden directamente con el contenido del script:

| Tema de clase | Referencia en script |
|---------------|---------------------|
| Diferencia estadistica descriptiva e inferencial | Introduccion del notebook (celda 1) |
| Poblacion vs muestra; representatividad | Descripcion del dataset (442 pacientes = muestra) |
| Datos incompletos, ruido y atipicos | Deteccion de outliers con Tukey; verificacion de nulos |
| Intervalos de confianza | Interpretacion del error estandar de la media |
| Incertidumbre y probabilidad en IA | Conclusiones — reflexion sobre prediccion |
| Visualizacion como herramienta de decision | Los 6 graficos del script |

---

## 6. Conclusion del Analisis

Los cinco recursos de la Semana 6 cubren de manera complementaria y exhaustiva los requerimientos de la actividad. Boschetti y Massaron aportan el sustento tecnico de la visualizacion con Python. Cady proporciona el fundamento conceptual de las medidas estadisticas y las pruebas de hipotesis. Fuentes complementa con el calculo estadistico usando SciPy. Los articulos de ANOVA amplian hacia la estadistica inferencial que el docente menciono como el hilo conductor de las semanas 6, 7 y 8.

El cuaderno `Oviedo_Alexander_Script.ipynb` cumple con todos los requerimientos formales de la actividad, con oportunidades de mejora en la formalizacion del lenguaje (reduccion de emoticones), profundidad de comentarios y precision de las referencias APA con numeros de pagina exactos de los recursos asignados.
