Replica_Mario_Grupo6.html
Procesamiento de Lenguaje Natural · Semana 4 · 20 de julio de 2026
← volver descargar
Esto lo escribí en el foro de la asignatura. Lo dejo tal como se veía en el aula, por eso el fondo claro.

Comentario en el Foro — Alexander Oviedo Fadul | Grupo 7

En respuesta a los compañeros Mario Alberto Villegas Cardona y María Katerine Zapata (Grupo 6)

Estimados Mario y María Katerine, excelente aporte. Me parece muy acertado su análisis y quiero responder directamente a la pregunta que plantean al cierre: ¿los Transformers reemplazarán completamente a las LSTM? 🤝

Desde mi experiencia desarrollando soluciones de procesamiento de lenguaje natural en el sector judicial colombiano, la respuesta corta es no, y les explico por qué. Cuando diseñé los módulos de clasificación de peticiones para la plataforma MARDUK, evalué ambas arquitecturas. Los Transformers (específicamente modelos como BERT en español) ofrecían un desempeño superior en tareas de comprensión general, pero requerían GPUs dedicadas que simplemente no existían en la infraestructura del Consejo Seccional de la Judicatura de Sucre. Una LSTM bidireccional, en cambio, corría en un servidor modesto con tiempos de inferencia aceptables para producción. Ese trade-off entre rendimiento y costo computacional es real, no teórico.

Coincido con ustedes en que la referencia a Vaswani et al. (2017) y el mecanismo de atención fue un punto de inflexión. Sin embargo, creo que el panorama actual es de coexistencia pragmática, no de reemplazo. Y esto no es solo mi opinión: en el ejercicio práctico de esta misma semana con las opiniones de tiendas ARA, la profesora Nathalia nos guio desde modelos simples (bolsa de palabras + árbol de decisión) hacia embeddings más sofisticados. Esa escalada gradual refleja exactamente la lógica de producción: se empieza con lo más liviano que funcione y se escala solo cuando el caso de negocio lo justifica.

Me permito agregar tres escenarios concretos donde las LSTM siguen siendo la opción más sensata frente a los Transformers:

  • Dispositivos edge e IoT: En sensores industriales o dispositivos médicos con capacidad de cómputo limitada, una LSTM pequeña puede ejecutarse localmente sin conexión a la nube.
  • Series temporales en tiempo real: Para predicción de demanda energética o monitoreo de señales biomédicas, las LSTM procesan datos de forma incremental —un paso a la vez— sin necesidad de conocer toda la secuencia de antemano, lo cual las hace más naturales para streaming continuo.
  • Entidades públicas con restricciones presupuestales: En el contexto colombiano, y particularmente en el sector público, no todas las organizaciones pueden costear la infraestructura que exigen los modelos Transformer. Una LSTM bien entrenada puede cubrir el 80% de los requerimientos con una fracción del costo.

Finalmente, me pareció muy valioso que mencionaran el artículo seminal de Hochreiter y Schmidhuber (1997). Ese paper tiene casi 30 años y la arquitectura que propone sigue en producción en miles de sistemas alrededor del mundo. Eso, por sí solo, dice bastante sobre la vigencia de las LSTM.

Un saludo cordial para ambos y felicitaciones por la calidad de su análisis. La pregunta que plantearon enriqueció notablemente la discusión del foro. 🚀

Referencias:
  • Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735–1780. https://doi.org/10.1162/neco.1997.9.8.1735
  • Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, Ł., & Polosukhin, I. (2017). Attention is all you need. Advances in Neural Information Processing Systems, 30.