Compartimos nuestras reflexiones sobre redes neuronales, integrando los conceptos del curso con experiencias prácticas del equipo.
Las redes neuronales artificiales han demostrado ser herramientas transversales con capacidad de adaptarse a cualquier dominio donde existan grandes volúmenes de datos y patrones que los métodos estadísticos convencionales no logran capturar. En medicina, los modelos de visión artificial detectan anomalías en radiografías, resonancias magnéticas y tomografías con una precisión comparable a la de especialistas certificados. En el sector financiero, los modelos de clasificación identifican transacciones fraudulentas en tiempo real, construyen perfiles de riesgo crediticio y optimizan carteras de inversión minimizando la exposición a pérdidas.
En el ámbito jurídico —área de interés de nuestro equipo—, proyectos como MARDUK con la Rama Judicial de Colombia han demostrado que las CNN pueden segmentar y reconocer estructuras dentro de expedientes judiciales escaneados: detectar sellos, firmas, números de cédula y fechas de manera automática, reduciendo horas de revisión manual. La elección del tipo de arquitectura —Feedforward para clasificación tabular, RNN para secuencias de texto o CNN para visión— no es arbitraria sino que depende directamente de la naturaleza de los datos de entrada.
Las aplicaciones de las redes neuronales son tan variadas como los tipos de datos existentes. En el campo del Procesamiento de Lenguaje Natural (NLP), arquitecturas basadas en Transformers como BERT y GPT han revolucionado la traducción automática, el análisis de sentimientos y la generación de texto. En visión artificial, modelos como ResNet y EfficientNet permiten clasificar imágenes, detectar objetos en video en tiempo real y segmentar escenas completas píxel a píxel. En sistemas de recomendación, las redes predicen qué producto o contenido interesará a un usuario basándose en su historial de comportamiento.
En logística e industria, los modelos de predicción de series temporales anticipan la demanda de inventario y detectan fallos en maquinaria antes de que ocurran. Sarkar, Bali y Ghosh (2018) destacan que el poder del aprendizaje por transferencia permite reutilizar modelos preentrenados en grandes conjuntos de datos —como ImageNet— y adaptarlos en pocas épocas a tareas específicas, reduciendo significativamente el costo computacional del entrenamiento desde cero. Esta capacidad es especialmente valiosa en contextos con datos limitados, como los expedientes judiciales digitalizados.
Una Red Neuronal Convolucional funciona emulando el proceso de percepción visual del córtex cerebral. La entrada es un tensor tridimensional (alto × ancho × canales de color). Sobre este tensor se aplican sucesivos filtros o kernels convolucionales: matrices de pesos que se deslizan sobre la imagen calculando el producto punto entre cada región local de píxeles y el filtro, generando un feature map. Cada filtro aprende un patrón diferente: algunas neuronas responden a bordes horizontales, otras a esquinas, otras a texturas específicas. Tras cada capa convolucional se aplica ReLU, que elimina valores negativos y permite modelar relaciones complejas.
Las capas de pooling (generalmente MaxPooling) submuestrean los feature maps reduciendo su resolución espacial y la cantidad de parámetros a entrenar, introduciendo además invarianza a traslaciones pequeñas. Galea y Capelo (2018) destacan que este diseño jerárquico permite que las capas iniciales detecten características simples —bordes, colores, texturas— y que las capas profundas combinen esas características para reconocer objetos complejos como rostros, vehículos o firmas manuscritas, sin que el programador deba definir ningún descriptor de manera manual. Esto representa una ruptura fundamental con el enfoque de visión artificial clásica basada en features hard-coded.
Para tareas de detección de imágenes, la arquitectura de una CNN debe estar cuidadosamente estratificada. La secuencia técnica estándar comienza con una capa de entrada que recibe el tensor de imagen normalizado. Le siguen bloques convolucionales compuestos por Conv2D → BatchNormalization → ReLU → MaxPooling, repetidos con profundidad y número de filtros crecientes (p. ej., 32 → 64 → 128 filtros). Esta progresión logra representaciones progresivamente más ricas en semántica y más compactas en resolución espacial. Entre los bloques convolucionales se insertan capas de Dropout que desactivan aleatoriamente neuronas durante el entrenamiento, reduciendo el sobreajuste.
Una capa Flatten convierte el tensor multidimensional en un vector que alimenta capas Dense con activación Softmax para clasificación. Para detección de objetos —que implica localizar además de clasificar—, arquitecturas como Faster R-CNN introducen una Region Proposal Network (RPN) que genera candidatos de región, mientras que YOLO reformula el problema como una única pasada hacia adelante prediciendo bounding boxes e índices de confianza por celda de cuadrícula, logrando detección en tiempo real. Como expone Sarkar et al. (2018), esta elección entre precisión y velocidad es uno de los compromisos centrales del diseño de sistemas de visión artificial.
Lo más valioso no es dominar la matemática subyacente, sino entender cuándo y por qué elegir cada arquitectura en función del problema. Las redes neuronales han cruzado en tiempo récord de los laboratorios al corazón de las tecnologías cotidianas, y entender sus fundamentos nos convierte en profesionales capaces de evaluar críticamente qué promete la IA y qué aún requiere intervención humana experta.
Galea, A., y Capelo, L. (2018). Applied Deep Learning with Python: Use Scikit-Learn, TensorFlow, and Keras to Create Intelligent Systems and Machine Learning Solutions. Packt Publishing.
Sarkar, D., Bali, R., y Ghosh, T. (2018). Hands-on transfer learning with Python: Implement advanced deep learning and neural network models using TensorFlow and Keras. Packt Publishing.