# Analisis de Recursos — Semana 6
## NRC-200 Machine Learning

**Estudiante:** Alexander Oviedo Fadul
**Actividad:** Estudio de Caso — Entrenamiento de Modelos (Semana 6)
**Fecha:** 23 de febrero de 2026

---

## 1. Requerimientos de la Actividad (ML_Actividad_S6.pdf)

La actividad de la Semana 6 tiene **dos partes**:

### Parte I — Script de Entrenamiento de Modelos

| N° | Requerimiento | Descripcion |
|----|--------------|-------------|
| 1 | Script en Python | Cuaderno Jupyter con entrenamiento de al menos dos modelos de ML |
| 2 | Dataset libre | Usar un dataset de libre acceso (en clase se uso Iris) |
| 3 | Division de datos | Train/Test split con stratify para mantener proporciones |
| 4 | Entrenamiento | Aplicar al menos dos algoritmos (ej. regresion logistica, arbol de decision) |
| 5 | Predicciones | Comparar valores reales vs predichos |
| 6 | Metricas | Evaluar precision, recall, F1-score, accuracy |
| 7 | Comentarios | Resultados comentados e interpretados |
| 8 | Portada y APA | Titulo, nombre, curso, semana, docente, fecha, referencias APA |

### Parte II — Estudio de Caso (ML en Sector Medico)

| N° | Requerimiento | Descripcion |
|----|--------------|-------------|
| 1 | Procesador de textos | Arial 11, interlineado 1.5, 5-10 paginas sin contar portada ni bibliografia |
| 2 | Dataset medico | Breast Cancer Wisconsin (tumor benigno/maligno), sin usar clase ni id |
| 3 | Objeto de estudio | Identificar el problema por analizar |
| 4 | Actores y contextos | Describir actores y contextos del problema |
| 5 | Objetivos | Definir objetivos del estudio de caso |
| 6 | Informe final | Analisis descriptivo, procesamiento, 2 modelos ML, metricas, conclusiones |

---

## 2. Analisis de Recursos — Tematicas Extraidas por Archivo

### 2.1 Bonaccorso, G. (2018). *Machine Learning Algorithms*. Packt Publishing.
**Paginas asignadas: pp. 104–140**

| Paginas | Tema cubierto | Relevancia para la actividad |
|---------|---------------|------------------------------|
| pp. 104-106 | Introduccion a algoritmos de clasificacion supervisada | Marco conceptual para ambas partes |
| pp. 107-112 | Regresion logistica: funcion sigmoide, frontera de decision, gradiente descendente | Modelo 1 del script (Parte I) |
| pp. 113-118 | Arboles de decision: criterio de Gini, entropia, poda | Modelo 2 del script (Parte I) |
| pp. 119-123 | Random Forest: ensamble de arboles, bagging, importancia de caracteristicas | Modelo alternativo para Parte II |
| pp. 124-128 | Support Vector Machines (SVM): hiperplano optimo, kernel trick, margen maximo | Modelo alternativo para clasificacion de tumores |
| pp. 129-133 | Naive Bayes: teorema de Bayes, clasificador probabilistico | Modelo alternativo para Parte II |
| pp. 134-137 | K-Nearest Neighbors (KNN): distancia euclidiana, eleccion de k | Modelo complementario |
| pp. 138-140 | Metricas de evaluacion: accuracy, precision, recall, F1-score, matriz de confusion | Seccion de evaluacion en ambas partes |

**Correspondencia:** Muy alta. Es el recurso principal para los algoritmos de clasificacion y las metricas de evaluacion usados en ambas partes de la actividad.

---

### 2.2 Campesato, O. (2020). *Artificial Intelligence, Machine Learning, and Deep Learning*. Mercury Learning.
**Paginas asignadas: pp. 23–57 (fragmento pp. 41–176 del libro)**

| Paginas del fragmento | Tema cubierto | Relevancia para la actividad |
|----------------------|---------------|------------------------------|
| pp. 1-5 (41-45 del libro) | Introduccion a ML: definicion, tipos de aprendizaje (supervisado, no supervisado, reforzado) | Marco conceptual |
| pp. 6-12 (46-52) | Aprendizaje supervisado: clasificacion vs regresion, dataset de entrenamiento vs prueba | Division de datos en el script |
| pp. 13-18 (53-58) | Regresion lineal y logistica: ecuacion, funcion de costo, optimizacion | Regresion logistica del script |
| pp. 19-25 (59-65) | Arboles de decision y Random Forest: estructura, criterios de division | Arbol de decision del script |
| pp. 30-40 (70-80) | Redes neuronales: perceptron, capas, activacion | Contexto teorico |
| pp. 50-60 (90-100) | Evaluacion de modelos: overfitting, underfitting, cross-validation | Validacion del modelo |
| pp. 80-100 (120-140) | Deep Learning: CNN, RNN, aplicaciones | Contexto para semanas futuras |
| pp. 120-136 (160-176) | Aplicaciones de ML en salud, finanzas, seguridad | Contexto del estudio de caso medico |

**Correspondencia:** Alta. Proporciona los fundamentos teoricos de todos los algoritmos y la justificacion para aplicar ML en el sector salud.

---

### 2.3 Cady, F. (2017). *The Data Science Handbook*. John Wiley & Sons.
**Paginas asignadas: pp. 165–170 (fragmento pp. 185–268 del libro)**

| Paginas del fragmento | Tema cubierto | Relevancia para la actividad |
|----------------------|---------------|------------------------------|
| pp. 1-3 (185-187) | Introduccion a modelos predictivos: marco general | Base conceptual |
| pp. 4-8 (188-192) | Regresion logistica como modelo de clasificacion | Modelo 1 de la actividad |
| pp. 9-15 (193-199) | Evaluacion de modelos: metricas de clasificacion, ROC, AUC | Evaluacion de metricas |
| pp. 20-30 (204-214) | Arboles de decision y ensambles | Modelo 2 de la actividad |
| pp. 40-50 (224-234) | Validacion cruzada, seleccion de modelos | Practica de evaluacion |
| pp. 60-84 (244-268) | Aplicaciones practicas de modelos de clasificacion | Contexto del estudio de caso |

**Correspondencia:** Media-alta como recurso complementario. Refuerza los conceptos de evaluacion de modelos y clasificacion.

---

### 2.4 Presentacion: *ML Sesion 6 — Entrenamiento de Modelos* (Diapositivas del docente)
**Recurso de clase — 15 paginas**

| Pagina(s) | Tema cubierto | Relevancia para la actividad |
|-----------|---------------|------------------------------|
| pp. 1-2 | Portada y agenda de la sesion | Estructura de la clase |
| pp. 3-5 | Repaso de conceptos: dataset, train/test split, stratify | Division de datos del script |
| pp. 6-8 | Regresion logistica con scikit-learn: `LogisticRegression`, `max_iter`, `fit`, `predict` | Codigo del script (Parte I) |
| pp. 9-11 | Arbol de decision con scikit-learn: `DecisionTreeClassifier`, visualizacion | Codigo del script (Parte I) |
| pp. 12-13 | Metricas de evaluacion: `accuracy_score`, `classification_report`, `confusion_matrix` | Evaluacion del script |
| pp. 14-15 | Ejemplo completo con dataset Iris | Ejemplo de referencia |

**Correspondencia:** Muy alta. Es la guia directa del docente para la Parte I del script.

---

### 2.5 Özdemir, R. y Turanli, M. (2024). *Comparison and Evaluation of Classification Algorithms for Customer Purchase Prediction*.
**Articulo complementario — 12 paginas**

| Paginas | Tema cubierto | Relevancia para la actividad |
|---------|---------------|------------------------------|
| pp. 1-2 | Introduccion a clasificacion supervisada en e-commerce | Contexto de aplicaciones de ML |
| pp. 3-4 | Regresion logistica: fundamento matematico, funcion sigmoide | Refuerza Parte I |
| pp. 5-6 | Arboles de decision: criterio de Gini, entropia, poda | Refuerza Parte I y II |
| pp. 7-8 | SVM: hiperplano, vectores soporte, clasificacion binaria | Modelo alternativo para tumores |
| pp. 8-10 | Naive Bayes: clasificador probabilistico basado en Bayes | Modelo complementario |
| pp. 11-12 | Comparacion de metricas entre modelos (accuracy, precision, recall, F1) | Evaluacion de modelos |

**Correspondencia:** Media-alta. Articulo que compara los mismos algoritmos requeridos en la actividad.

---

### 2.6 Lokanan, M., Tran, V. y Vuong, N. H. (2019). *Detecting Anomalies in Financial Statements Using Machine Learning Algorithm*.
**Articulo complementario — 21 paginas**

| Paginas | Tema cubierto | Relevancia para la actividad |
|---------|---------------|------------------------------|
| pp. 1-3 | Introduccion: deteccion de anomalias con ML en estados financieros | Aplicacion real de ML |
| pp. 4-6 | Revision de literatura: comparacion de algoritmos (ANN, logistica, SVM) | Comparacion de modelos |
| pp. 7-9 | Metodologia: normalizacion, distancia de Mahalanobis, preprocesamiento | Preprocesamiento de datos |
| pp. 10-14 | Implementacion: Random Forest, regresion logistica, Naive Bayes | Modelos del estudio de caso |
| pp. 15-18 | Resultados: metricas de clasificacion, matrices de confusion | Evaluacion de modelos |
| pp. 19-21 | Conclusiones y limitaciones | Estructura de informe final |

**Correspondencia:** Media. Ejemplo de estudio de caso con ML aplicado, util como referencia de estructura para la Parte II.

---

### 2.7 Datasets proporcionados

| Archivo | Descripcion | Uso en la actividad |
|---------|-------------|---------------------|
| `adult.data` | Base de datos UCI Adult (ingreso >50K / <=50K) | Dataset alternativo para clasificacion |
| `house-votes-84.data` | Votaciones del Congreso de EE.UU. (1984) | Dataset alternativo para clasificacion |

---

## 3. Validacion: Correspondencia entre Recursos y Actividad

| Requerimiento | Cubierto en | Paginas de referencia |
|---------------|------------|----------------------|
| Regresion logistica | Bonaccorso (2018), Campesato (2020), Presentacion | Bonaccorso pp.107-112; Campesato pp.53-58; Slides pp.6-8 |
| Arbol de decision | Bonaccorso (2018), Campesato (2020), Presentacion | Bonaccorso pp.113-118; Campesato pp.59-65; Slides pp.9-11 |
| Train/Test split con stratify | Campesato (2020), Presentacion | Campesato pp.46-52; Slides pp.3-5 |
| Metricas de evaluacion | Bonaccorso (2018), Cady (2017) | Bonaccorso pp.138-140; Cady pp.193-199 |
| ML en sector medico (tumores) | Campesato (2020), Lokanan et al. (2019) | Campesato pp.160-176; Lokanan pp.10-18 |
| SVM como modelo alternativo | Bonaccorso (2018), Özdemir (2024) | Bonaccorso pp.124-128; Özdemir pp.7-8 |
| Comparacion de algoritmos | Özdemir (2024), Lokanan (2019) | Özdemir pp.11-12; Lokanan pp.15-18 |

**Resultado:** Todos los requerimientos de la actividad cuentan con soporte bibliografico en los recursos.

---

## 4. Correspondencia con la Sesion de Clase (Transcripcion 21-feb-2026)

| Tema de clase | Referencia en la actividad |
|---------------|---------------------------|
| Carga de dataset Iris con sklearn | Ejemplo de referencia para Parte I |
| `train_test_split` con `stratify=y` | Division de datos en el script |
| `LogisticRegression(max_iter=5000)` | Modelo 1 del script |
| Comparacion de predicciones vs reales en DataFrame | Seccion de predicciones |
| Importancia de la distribucion proporcional de clases | Justificacion de stratify |
| Solo se hace la Parte II (el docente lo confirmo en la sesion) | La Parte I es opcional si no se hizo previamente |

---

## 5. Conclusion

Los recursos de la Semana 6 cubren todos los algoritmos y conceptos necesarios para las dos partes de la actividad. Bonaccorso es el recurso central para algoritmos y metricas. Campesato fundamenta la teoria. La presentacion del docente da el codigo de referencia directo. Los articulos de Özdemir y Lokanan proporcionan ejemplos de aplicacion real de los mismos algoritmos en contextos de clasificacion binaria similar al del estudio de caso medico.
