Intervencion_2_Replica.html
Machine Learning Avanzado · Semana 2 · 11 de mayo de 2026
← volver descargar
Esto lo escribí en el foro de la asignatura. Lo dejo tal como se veía en el aula, por eso el fondo claro.

Réplica a la participación de William David Obando Lopez - Semana 4

Autor: Alexander Oviedo Fadul | Grupo 10

¡Excelente aporte, William!

Comparto plenamente tu postura sobre cómo la arquitectura física de los procesadores y su capacidad de procesamiento en paralelo condicionan el rendimiento de nuestros modelos. En el marco del desarrollo de nuestro **Ecosistema MARDUK**, el análisis que realizas sobre la GPU y la gestión de tensores a través de TPUs nos da una perspectiva muy valiosa de ingeniería.

Complementando tu justificación y el debate sobre la eficiencia en el entrenamiento y la predicción de redes neuronales convolucionales, me gustaría centrarme en dos variables críticas que mencionas: **la limitación de memoria dedicada (VRAM)** y los **cuellos de botella del bus de datos**:

Análisis del Rendimiento de Memoria y cuells de botella de Software-Hardware
Como bien anotas, mientras que la CPU accede a grandes cantidades de RAM general del sistema, las GPUs se ven restringidas por su VRAM integrada. Esto define el tamaño del lote (batch size) y la profundidad de la CNN que podemos procesar. Sin embargo, para que esta memoria de alta velocidad rinda al máximo, es mandatorio que la comunicación a bajo nivel esté optimizada mediante las librerías de aceleración (NVIDIA CUDA/cuDNN). Si no existe esta sincronización fina, la GPU se quedará ociosa esperando las instrucciones de la CPU, creando un cuello de botella crítico.

A partir de esto, identifico tres puntos clave que sustentan tu intervención:

  • El Trade-off de la VRAM: Un batch size demasiado pequeño debido a límites de VRAM ralentiza la convergencia del entrenamiento, mientras que un lote demasiado grande satura la memoria provocando un error fatal de falta de memoria (OOM). Debemos calibrar meticulosamente esta variable según la tarjeta física disponible.
  • Optimización Híbrida del Pipeline: En nuestro módulo de reconocimiento facial **SIRFAJ**, es indispensable que la CPU se encargue enteramente de la decodificación, limpieza y estructuración de los tensores de imagen para que la GPU se dedique en exclusiva y sin interrupciones a ejecutar las operaciones matemáticas de la red neuronal.
  • Aceleración Específica en Edge AI: Comparto tu visión sobre la transición hacia aceleradores dedicados. Al integrar procesadores neurales ligeros de bajo costo (como las NPUs) en la infraestructura local de los despachos judiciales, podemos ejecutar la inferencia en tiempo real sin requerir costosos servidores dedicados y con un consumo de energía sostenible.

En conclusión, coincido en que la GPU representa la mejor opción absoluta para sustentar el procesamiento matemático pesado de una red neuronal artificial. No obstante, el éxito de la aplicación práctica dependerá de un diseño colaborativo y coordinado entre la flexibilidad lógica de la CPU y la velocidad de cómputo paralelo de la GPU.