# 🎬 Prompt para Video con Voz en Off — Semana 7
## Red Neuronal Convolucional Clasificadora de Imágenes
### NRC-8773 — Visión por Computador — Grupo 10 (Ponente: Alexander Oviedo Fadul)

### Integrantes del Grupo 10
- Alexander Oviedo Fadul (Ponente)
- Maria Fernanda Ruiz Paipilla
- Neheman Samir Jaller Cerchiaro
- William David Obando Lopez
- Yesith Stiven Vizcano Mican

---

## Instrucciones de producción

| Aspecto | Especificación |
|---------|---------------|
| **Duración máxima** | 5 minutos |
| **Formato** | Video con voz en off (se permite TTS) |
| **Secciones obligatorias** | 3: Diseño, Implementación, Resultados |
| **Plataforma** | Subir a YouTube (sin restricciones de visualización) |
| **Herramientas sugeridas** | Canva, OBS Studio, PowerPoint + grabación, Google Slides |
| **TTS sugerido** | ElevenLabs, Google Text-to-Speech, NaturalReader |

---

## Guión completo para TTS / Voz en Off

### 🎬 INTRO (0:00 – 0:30)

> Bienvenidos a esta presentación sobre el diseño e implementación de una red neuronal convolucional clasificadora de imágenes, desarrollada como parte de la actividad de la semana 7 del curso de Visión por Computador, NRC ocho siete siete tres.
>
> Mi nombre es Alexander Oviedo Fadul y, en representación del Grupo 10 —integrado por Maria Fernanda Ruiz Paipilla, Neheman Samir Jaller Cerchiaro, William David Obando Lopez, Yesith Stiven Vizcano Mican y mi persona—, les presentaré las tres etapas de nuestro proyecto: el diseño de la arquitectura, la implementación en Python y los resultados obtenidos.

**🖥️ En pantalla:** Diapositiva de título con logo de UNIMINUTO, identificación del Grupo 10, listado de integrantes y rol del ponente (Alexander Oviedo Fadul).

---

### 📐 ETAPA 1: DISEÑO (0:30 – 2:00)

> **[0:30]** Comencemos con la etapa de diseño. Para esta actividad diseñé una red neuronal convolucional inspirada en la arquitectura VGG, siguiendo la recomendación del profesor Félix de utilizar filtros de tres por tres y dar profundidad a la red de forma progresiva.

**🖥️ En pantalla:** Diagrama de la arquitectura CNN (bloques visuales).

> **[0:50]** La arquitectura consta de tres bloques convolucionales. El primer bloque tiene dos capas de convolución con 32 filtros de tres por tres, seguidas de max pooling y dropout al 25 por ciento. El segundo bloque duplica los filtros a 64, y el tercer bloque los lleva a 128.

**🖥️ En pantalla:** Tabla con las capas y parámetros.

> **[1:10]** Después de los bloques convolucionales, se aplana la salida y se conecta a dos capas densas de 256 y 128 neuronas con activación ReLU y dropout al 50 por ciento para regularización. La capa de salida utiliza una función de activación Softmax para clasificar en las 10 clases del dataset.

**🖥️ En pantalla:** Diagrama del flujo: Input → Conv Blocks → Flatten → Dense → Softmax.

> **[1:30]** Incluí Batch Normalization en cada capa convolucional para estabilizar el entrenamiento, y Data Augmentation con rotaciones, desplazamientos y volteos horizontales para aumentar la variedad de datos sin necesidad de recolectar más imágenes.

**🖥️ En pantalla:** Ejemplos de data augmentation (imagen original vs. transformada).

> **[1:45]** Como optimizador seleccioné Adam por su convergencia adaptativa, y como función de pérdida, la entropía cruzada categórica, que es el estándar para clasificación multiclase con Softmax, tal como lo explicó el profesor Félix en la clase.

**🖥️ En pantalla:** Tabla de hiperparámetros (optimizador, learning rate, batch size, épocas).

---

### 💻 ETAPA 2: IMPLEMENTACIÓN (2:00 – 3:30)

> **[2:00]** Pasemos a la implementación. El proyecto se desarrolló en un Notebook de Jupyter usando Python con TensorFlow y Keras como framework principal.

**🖥️ En pantalla:** Captura del notebook con las importaciones.

> **[2:15]** Para el entrenamiento utilicé el dataset CIFAR-10 de TensorFlow, que contiene sesenta mil imágenes a color de 32 por 32 píxeles distribuidas en diez clases: avión, automóvil, pájaro, gato, ciervo, perro, rana, caballo, barco y camión.

**🖥️ En pantalla:** Grid de muestras del dataset CIFAR-10 (una imagen por clase).

> **[2:35]** El preprocesamiento incluyó la normalización de los valores de píxeles al rango cero a uno, la codificación one-hot de las etiquetas, y la configuración del generador de data augmentation.

**🖥️ En pantalla:** Código del preprocesamiento y ejemplo de transformaciones.

> **[2:50]** El modelo se entrenó durante 30 épocas con un batch size de 64. Implementé dos callbacks importantes: Early Stopping para detener el entrenamiento si la pérdida de validación no mejora en 7 épocas, y Reduce Learning Rate on Plateau para reducir automáticamente la tasa de aprendizaje cuando el entrenamiento se estanca.

**🖥️ En pantalla:** Código de compilación, callbacks y entrenamiento.

> **[3:10]** Para la validación externa, cargué un dataset de autoría propia con más de cien imágenes desde mi Google Drive. Las imágenes fueron redimensionadas a 32 por 32 píxeles y normalizadas al mismo rango que el dataset de entrenamiento, tal como indicó el profesor.

**🖥️ En pantalla:** Código de carga del dataset propio + ejemplos de imágenes propias.

---

### 📊 ETAPA 3: RESULTADOS (3:30 – 4:45)

> **[3:30]** Veamos los resultados obtenidos. Las curvas de entrenamiento muestran una convergencia saludable, con el accuracy de entrenamiento y validación acercándose progresivamente y sin indicios graves de sobreajuste gracias a las técnicas de regularización aplicadas.

**🖥️ En pantalla:** Gráficas de accuracy y loss (entrenamiento vs. validación).

> **[3:50]** En el conjunto de prueba de CIFAR-10, el modelo alcanzó un accuracy competitivo. El reporte de clasificación muestra que las clases con mejor rendimiento fueron automóvil y barco, mientras que las clases gato y perro tuvieron mayor confusión entre sí, algo esperable dada su similitud visual.

**🖥️ En pantalla:** Métricas textuales + Matriz de confusión del test set.

> **[4:10]** La matriz de confusión permite visualizar exactamente dónde el modelo acierta y dónde se equivoca. Las confusiones más frecuentes ocurren entre clases visualmente similares como gato-perro y avión-pájaro.

**🖥️ En pantalla:** Matriz de confusión con heatmap de colores.

> **[4:25]** En la validación externa con el dataset propio de más de cien imágenes, el modelo demostró su capacidad de generalización. La comparación entre los resultados del dataset CIFAR-10 y el dataset propio nos permite evaluar qué tan bien el modelo transfiere su conocimiento a datos completamente nuevos.

**🖥️ En pantalla:** Gráfica comparativa de accuracy (CIFAR-10 vs. Dataset propio) + predicciones visuales.

---

### 🎬 CIERRE (4:45 – 5:00)

> [4:45] En conclusión, la arquitectura CNN basada en VGG con filtros de tres por tres, batch normalization y data augmentation demostró ser efectiva para la clasificación de imágenes. La validación con el dataset propio confirmó la capacidad de generalización del modelo.
>
> Gracias por su atención. A nombre del Grupo 10, les habló Alexander Oviedo Fadul. Curso de Visión por Computador, semana siete.

**🖥️ En pantalla:** Diapositiva final con identificación del Grupo 10, listado de integrantes y referencias bibliográficas.

---

## Storyboard visual (resumen)

| Tiempo | Sección | En pantalla | Narración |
|--------|---------|-------------|-----------|
| 0:00-0:30 | Intro | Título + datos | Presentación personal |
| 0:30-1:15 | Diseño | Diagrama arquitectura | Descripción de bloques y filtros |
| 1:15-2:00 | Diseño | Hiperparámetros + Data Aug. | Justificación técnica |
| 2:00-2:35 | Implementación | CIFAR-10 muestras | Dataset y preprocesamiento |
| 2:35-3:10 | Implementación | Código entrenamiento | Callbacks y configuración |
| 3:10-3:30 | Implementación | Dataset propio | Carga y validación externa |
| 3:30-4:10 | Resultados | Curvas + métricas | Análisis de convergencia |
| 4:10-4:45 | Resultados | Matrices de confusión | Análisis de errores |
| 4:45-5:00 | Cierre | Diapositiva final | Conclusiones y despedida |

---

## Referencias para el video

- Dadhich, A. (2018). *Practical computer vision*. Packt Publishing. (pp. 88-125).
- Zafar, I. et al. (2018). *Hands-on convolutional neural networks with TensorFlow*. Packt Publishing. (pp. 48-65).
- Masterson, L. (2019). *TensorFlow deep learning projects*. Packt Publishing. (pp. 6-26).
- Gutiérrez Bernal, F. J. (2026, 17 de junio). Clase 7 [Clase magistral]. NRC-8773, UNIMINUTO.

---

## Notas de producción

1. **Duración estricta:** No exceder 5 minutos.
2. **Captar gráficas del notebook:** Ejecutar el notebook en Colab, tomar capturas de las gráficas generadas.
3. **TTS:** Copiar el texto entre `>` (citas) y pegarlo en un servicio TTS para generar el audio.
4. **YouTube:** Subir con visibilidad "No listado" o "Público", sin restricciones.
5. **PDF final:** Incluir el enlace de YouTube en el documento .docx y exportar a PDF.
