Buenas noches, profesora Nathalia y compañeros. En representación del Grupo 7 —conformado por María Fernanda Ruiz, Neheman Samir Jaller, William David Obando y mi persona—, comparto nuestra intervención sobre las redes neuronales recurrentes y las LSTM, un tema que me resulta cercano por las limitaciones que enfrenté al procesar secuencias de texto judicial en mis propios proyectos.
1. Aplicaciones de las Redes Neuronales Recurrentes (RNN)
Las RNN fueron concebidas para una tarea que las redes neuronales tradicionales simplemente no podían resolver bien: procesar datos donde el orden importa. A diferencia de una red feedforward —que mira cada entrada como si fuera un dato aislado—, una RNN mantiene un estado oculto (hidden state) que funciona como una memoria interna de lo que ya procesó (Goodfellow et al., 2016). Esa memoria es lo que permite que, al leer la palabra "pagan" en la oración "¿Cuándo me pagan la prima?", el modelo recuerde que la pregunta empezó con "cuándo" y mantenga la noción de que se trata de una consulta temporal, no de una afirmación.
Las aplicaciones que más me interesan —y donde he podido experimentar de primera mano— son las siguientes:
- Clasificación y análisis de sentimiento: En la Semana 4 trabajamos con un CSV de 2.000 opiniones de tiendas ARA, donde el objetivo era predecir la calificación en estrellas a partir del texto. Este tipo de tarea, donde una secuencia variable de palabras se mapea a una etiqueta única, es un caso clásico de arquitectura muchos a uno.
- Generación de texto secuencial: La capacidad de predecir la siguiente palabra de una secuencia es la base de sistemas de autocompletado y modelos generativos. Cuando Isabella —el chatbot judicial que desarrollé para el Consejo Seccional de la Judicatura de Sucre— sugiere respuestas contextuales al funcionario, internamente está prediciendo la secuencia de tokens más probable dado el historial de la conversación.
- Traducción automática y chatbots conversacionales: La arquitectura muchos a muchos (encoder-decoder) revolucionó la traducción automática al permitir que la longitud de la entrada y la salida fueran diferentes (Sutskever et al., 2014). Esto resulta particularmente relevante en nuestro contexto colombiano, donde las consultas pueden llegar en un español coloquial y la respuesta debe ser formalmente estructurada.
- Series temporales y predicción: Más allá del texto, las RNN procesan cualquier dato secuencial: señales de audio para reconocimiento de voz, registros temporales de sensores IoT para mantenimiento predictivo, o —como mencionaba la profesora Nathalia en clase— los flujos de tickets que llegan a los sistemas de atención al cliente y cuyo volumen varía de 1 a miles en cuestión de horas.
El problema central de las RNN simples: sufren del desvanecimiento del gradiente (vanishing gradient). En la práctica, esto significa que cuando la secuencia es larga —digamos, un párrafo de una sentencia judicial de 400 palabras—, la red "olvida" lo que leyó al principio. Ese fue exactamente mi problema con Isabella: las consultas cortas ("¿cuándo pagan?") se procesaban bien, pero las explicaciones extensas de los funcionarios perdían contexto a mitad de camino.
2. Características principales de las redes LSTM
Las redes Long Short-Term Memory nacieron precisamente para resolver ese olvido prematuro. Hochreiter y Schmidhuber (1997) propusieron una arquitectura con una celda de estado (cell state) que actúa como una especie de cinta transportadora de información a lo largo de toda la secuencia. Pero lo verdaderamente ingenioso es el sistema de tres compuertas que regulan qué información fluye por esa cinta:
- Compuerta de olvido (forget gate): Decide qué información del pasado ya no es relevante y debe descartarse. Piensen en cuando un juez lee un expediente: hay párrafos de antecedentes que puede descartar para concentrarse en los hechos probados.
- Compuerta de entrada (input gate): Determina qué información nueva de la entrada actual merece guardarse en la memoria. Si el sistema recibe la palabra "tutela", esta compuerta le asigna alta prioridad porque cambia por completo el contexto procesal.
- Compuerta de salida (output gate): Controla qué parte de la información almacenada se utiliza para producir la predicción en ese paso. No todo lo que la red recuerda es relevante para la respuesta inmediata.
Las funciones de activación que regulan estas compuertas son la sigmoide (para decidir qué porcentaje de información pasa, entre 0 y 1) y la tangente hiperbólica (para generar los candidatos a nueva información, con valores entre −1 y +1). Esa combinación permite que las LSTM mantengan dependencias a largo plazo que las RNN simples pierden irremediablemente (Ganegedara, 2018).
Conexión con nuestra práctica: En la clase de esta semana, la profesora Nathalia nos mostró cómo la elección del modelo y la representación del texto (bolsa de palabras vs. embeddings) impactan directamente en el desempeño. Cuando probamos embeddings de 300 dimensiones, pasamos de un accuracy de 71% a casi 89% en algunos casos. Esto se relaciona con las LSTM porque los embeddings capturan la semántica que las LSTM después procesan secuencialmente para mantener el contexto a lo largo de la oración.
3. Campos tecnológicos donde se utilizan las LSTM
Aunque las LSTM fueron inicialmente concebidas para el procesamiento de lenguaje, su capacidad para modelar dependencias temporales las ha convertido en una herramienta transversal. A partir de mi experiencia profesional y de la bibliografía revisada, destaco los siguientes campos:
- Sector judicial y legal (LegalTech): En mi trabajo desarrollando la plataforma MARDUK para la Rama Judicial colombiana, las LSTM nos permitieron clasificar automáticamente peticiones ciudadanas según su tipología procesal (tutelas, derechos de petición, recursos de apelación). El beneficio clave fue que la red podía distinguir entre expresiones como "interpongo recurso de reposición" y "solicito reposición de documento perdido", donde la misma palabra "reposición" tiene significados jurídicos completamente diferentes según la secuencia que la acompaña.
- Medicina y señales biomédicas: Las LSTM analizan electrocardiogramas (ECG) y electroencefalogramas (EEG) como secuencias temporales, detectando arritmias o anomalías neurológicas que dependen de patrones que se desarrollan a lo largo del tiempo (Graves, 2012).
- Finanzas y predicción de mercados: Los precios de acciones y criptomonedas son series temporales con dependencias complejas. Las LSTM modelan esas relaciones mejor que métodos estadísticos tradicionales porque capturan patrones no lineales.
- Ciberseguridad: Como mencionaba el compañero del Grupo 14, las LSTM analizan secuencias de logs de tráfico de red para detectar patrones anómalos que podrían indicar un ciberataque en desarrollo. La secuencialidad es clave: un solo paquete sospechoso no dice nada, pero una secuencia de paquetes con cierto patrón temporal sí activa la alerta.
- Visión por computadora: Combinadas con redes convolucionales (CNN + LSTM), procesan fotogramas sucesivos de video para tareas como reconocimiento de acciones o videovigilancia inteligente, donde el significado emerge de la secuencia temporal de imágenes.
4. Reflexión y conexión con la Semana 4
Algo que me llamó la atención en nuestra sesión fue la discusión sobre cuándo usar bolsa de palabras versus embeddings, y cómo eso conecta con las arquitecturas recurrentes. La bolsa de palabras pierde el orden de las palabras —que es justamente lo que las RNN/LSTM necesitan para funcionar bien—, mientras que los embeddings preservan la semántica y sirven como entrada natural para las capas recurrentes. En la práctica con el CSV de opiniones, vimos que la diferencia de rendimiento entre ambas representaciones no era trivial: pasamos de un ~71% con BoW a un ~89% con embeddings, lo que sugiere que para tareas de clasificación de sentimiento donde el matiz lingüístico importa, la representación semántica marca la diferencia.
A modo de conclusión honesta, las LSTM fueron una revolución cuando aparecieron en 1997. Hoy, los Transformers (BERT, GPT) las han superado en muchas tareas de NLP gracias a su capacidad de procesamiento en paralelo y mecanismos de atención. Sin embargo, comparto lo que mencionaron varios compañeros en sus aportes: las LSTM siguen siendo la herramienta más eficiente cuando los recursos computacionales son limitados, las secuencias son de longitud moderada o se trabaja con series temporales. En el sector público colombiano, donde el presupuesto para infraestructura de IA es restringido, las LSTM continúan siendo una alternativa completamente viable y, en muchos casos, la opción más sensata.