Aporte Principal — Semana 4: Redes Neuronales Recurrentes (RNN) y LSTM

Autor: Alexander Oviedo Fadul | Grupo 7

Buenas noches, profesora Nathalia y compañeros. En representación del Grupo 7 —conformado por María Fernanda Ruiz, Neheman Samir Jaller, William David Obando y mi persona—, comparto nuestra intervención sobre las redes neuronales recurrentes y las LSTM, un tema que me resulta cercano por las limitaciones que enfrenté al procesar secuencias de texto judicial en mis propios proyectos.

1. Aplicaciones de las Redes Neuronales Recurrentes (RNN)

Las RNN fueron concebidas para una tarea que las redes neuronales tradicionales simplemente no podían resolver bien: procesar datos donde el orden importa. A diferencia de una red feedforward —que mira cada entrada como si fuera un dato aislado—, una RNN mantiene un estado oculto (hidden state) que funciona como una memoria interna de lo que ya procesó (Goodfellow et al., 2016). Esa memoria es lo que permite que, al leer la palabra "pagan" en la oración "¿Cuándo me pagan la prima?", el modelo recuerde que la pregunta empezó con "cuándo" y mantenga la noción de que se trata de una consulta temporal, no de una afirmación.

Las aplicaciones que más me interesan —y donde he podido experimentar de primera mano— son las siguientes:

El problema central de las RNN simples: sufren del desvanecimiento del gradiente (vanishing gradient). En la práctica, esto significa que cuando la secuencia es larga —digamos, un párrafo de una sentencia judicial de 400 palabras—, la red "olvida" lo que leyó al principio. Ese fue exactamente mi problema con Isabella: las consultas cortas ("¿cuándo pagan?") se procesaban bien, pero las explicaciones extensas de los funcionarios perdían contexto a mitad de camino.

2. Características principales de las redes LSTM

Las redes Long Short-Term Memory nacieron precisamente para resolver ese olvido prematuro. Hochreiter y Schmidhuber (1997) propusieron una arquitectura con una celda de estado (cell state) que actúa como una especie de cinta transportadora de información a lo largo de toda la secuencia. Pero lo verdaderamente ingenioso es el sistema de tres compuertas que regulan qué información fluye por esa cinta:

Las funciones de activación que regulan estas compuertas son la sigmoide (para decidir qué porcentaje de información pasa, entre 0 y 1) y la tangente hiperbólica (para generar los candidatos a nueva información, con valores entre −1 y +1). Esa combinación permite que las LSTM mantengan dependencias a largo plazo que las RNN simples pierden irremediablemente (Ganegedara, 2018).

Conexión con nuestra práctica: En la clase de esta semana, la profesora Nathalia nos mostró cómo la elección del modelo y la representación del texto (bolsa de palabras vs. embeddings) impactan directamente en el desempeño. Cuando probamos embeddings de 300 dimensiones, pasamos de un accuracy de 71% a casi 89% en algunos casos. Esto se relaciona con las LSTM porque los embeddings capturan la semántica que las LSTM después procesan secuencialmente para mantener el contexto a lo largo de la oración.

3. Campos tecnológicos donde se utilizan las LSTM

Aunque las LSTM fueron inicialmente concebidas para el procesamiento de lenguaje, su capacidad para modelar dependencias temporales las ha convertido en una herramienta transversal. A partir de mi experiencia profesional y de la bibliografía revisada, destaco los siguientes campos:

4. Reflexión y conexión con la Semana 4

Algo que me llamó la atención en nuestra sesión fue la discusión sobre cuándo usar bolsa de palabras versus embeddings, y cómo eso conecta con las arquitecturas recurrentes. La bolsa de palabras pierde el orden de las palabras —que es justamente lo que las RNN/LSTM necesitan para funcionar bien—, mientras que los embeddings preservan la semántica y sirven como entrada natural para las capas recurrentes. En la práctica con el CSV de opiniones, vimos que la diferencia de rendimiento entre ambas representaciones no era trivial: pasamos de un ~71% con BoW a un ~89% con embeddings, lo que sugiere que para tareas de clasificación de sentimiento donde el matiz lingüístico importa, la representación semántica marca la diferencia.

A modo de conclusión honesta, las LSTM fueron una revolución cuando aparecieron en 1997. Hoy, los Transformers (BERT, GPT) las han superado en muchas tareas de NLP gracias a su capacidad de procesamiento en paralelo y mecanismos de atención. Sin embargo, comparto lo que mencionaron varios compañeros en sus aportes: las LSTM siguen siendo la herramienta más eficiente cuando los recursos computacionales son limitados, las secuencias son de longitud moderada o se trabaja con series temporales. En el sector público colombiano, donde el presupuesto para infraestructura de IA es restringido, las LSTM continúan siendo una alternativa completamente viable y, en muchos casos, la opción más sensata.

Referencias Bibliográficas: