¡Buenas noches, profesora Nathalia y compañeros! En representación de mi equipo de trabajo (Grupo 7), conformado por María Fernanda, Neheman Samir, William David y mi persona, procedo a realizar el aporte principal para este foro sobre las fases, ventajas, desventajas y desafíos del Procesamiento de Lenguaje Natural.
Ejemplo seleccionado: Isabella — Chatbot Judicial con PLN
Para este análisis seleccioné Isabella, un chatbot con procesamiento de lenguaje natural que desarrollé entre 2020 y 2024 dentro del ecosistema MARDUK, para brindar atención automatizada 24/7 a servidores judiciales del Consejo Seccional de la Judicatura de Sucre. El proyecto fue construido con Python (backend), PHP (interfaz web), MariaDB (persistencia de conversaciones), y actualmente integra APIs de modelos de lenguaje como GPT-4o, Claude y Gemini para enriquecer las respuestas generadas.
1. Fases del Procesamiento del Lenguaje Natural aplicadas a Isabella
Cuando un funcionario judicial escribe, por ejemplo: "¿Cuándo me pagan la prima de servicios de este semestre?", el sistema procesa la consulta atravesando las siguientes fases:
- Fase Léxica: El sistema tokeniza la oración, dividiendo el texto en unidades mínimas: ["¿", "Cuándo", "me", "pagan", "la", "prima", "de", "servicios", "de", "este", "semestre", "?"]. Como señala Ganegedara (2018), esta fase es la base de cualquier pipeline de PLN porque convierte texto en bruto en unidades procesables.
- Fase Morfológica: Se identifica la categoría gramatical de cada token: "pagan" es un verbo conjugado en tercera persona del plural, "prima" es un sustantivo, "este" funciona como adjetivo demostrativo. Además, se aplica lematización para reducir "pagan" a su forma base "pagar".
- Fase Sintáctica: Se analiza la estructura gramatical de la oración para determinar las relaciones entre palabras. El sistema reconoce que "prima de servicios" es un sintagma nominal compuesto que funciona como objeto directo del verbo "pagar".
- Fase Semántica y Pragmática: Se interpreta el significado contextual y cultural del mensaje. Por ejemplo, en el lenguaje coloquial colombiano (y muy especialmente en nuestra región sucreña), es común recibir expresiones como: "Tengo un chicharrón con un auto de notificación" o "Me pasaron este chicharrón de tutela". Aquí la fase pragmática —tal como lo discutíamos en la sesión sincrónica de la Semana 2— es crucial: el modelo no debe interpretar "chicharrón" de forma literal como el alimento gastronómico tradicional, sino que debe mapear el modismo cultural para comprender que se refiere a una "dificultad procesal compleja" o un "problema judicial", direccionando al usuario a la ayuda adecuada.
Nota de contexto sobre el preprocesamiento: Al desarrollar Isabella, aplicamos una de las directrices clave explicadas por la docente Natalia: conocer el corpus antes de automatizar la limpieza. Si hubiésemos eliminado stop words usando listas estándar de NLTK o spaCy sin supervisión manual, habríamos purgado términos que en el derecho tienen un valor operativo fundamental (por ejemplo, las palabras "estado", "auto" o "recurso", que el preprocesamiento general suele filtrar como ruido, pero que en el dominio judicial son sustantivos críticos).
2. Ventajas y desventajas del PLN en los distintos ámbitos de la tecnología
Ventajas:
- Automatización de tareas repetitivas: En el contexto judicial, Isabella logró reducir consultas telefónicas recurrentes (horarios, nómina, trámites documentales) en un porcentaje significativo, liberando tiempo del equipo humano para tareas de mayor complejidad.
- Análisis masivo de texto no estructurado: Herramientas de PLN permiten procesar miles de sentencias judiciales, tutelas y expedientes para extraer patrones relevantes de forma automatizada (Arumugam & Shanmugamani, 2018).
- Accesibilidad y disponibilidad: Un chatbot con PLN ofrece atención ininterrumpida, eliminando la dependencia del horario laboral presencial.
Desventajas:
- Dependencia de la calidad de los datos: Como afirman Srinivasa-Desikan et al. (2018), aplica el principio Garbage In, Garbage Out: si los datos de entrenamiento contienen errores o sesgos, las respuestas del sistema los replicarán fielmente.
- Dificultad con expresiones coloquiales y regionales: En mi experiencia con Isabella, la jerga jurídica regional sucreña ("despachar un memorial", "correr traslado") generaba confusión en modelos entrenados predominantemente con corpus anglosajones.
- Riesgo de alucinaciones: Los modelos generativos modernos pueden producir respuestas convincentes pero factualmente incorrectas, lo cual en el ámbito judicial es inaceptable por las consecuencias legales que implica.
3. Influencia de la estructura gramatical en aplicaciones de PLN
La estructura gramatical es el andamiaje que sostiene todo el análisis posterior. En español, a diferencia del inglés, la flexibilidad sintáctica y la existencia del sujeto tácito representan un desafío considerable para los modelos de PLN. Consideren este par de oraciones que recibíamos frecuentemente en Isabella:
- "El juez notificó al demandante." → El sujeto (juez) realiza la acción sobre el objeto (demandante).
- "Al demandante lo notificó." → Misma intención semántica, pero el orden gramatical cambió completamente y el sujeto quedó tácito.
Como explica Ganegedara (2018), si el análisis sintáctico falla en identificar correctamente estas estructuras flexibles, todo el procesamiento semántico y pragmático posterior se contamina. Por eso, para Isabella tuvimos que enriquecer los datos de entrenamiento con corpus específicos del español jurídico colombiano, no bastaba con modelos preentrenados genéricos.
4. Desafíos que enfrenta el PLN
Desde mi experiencia práctica desarrollando soluciones de PLN en el sector público, identifico los siguientes desafíos críticos:
- Ambigüedad contextual y cultural: El sarcasmo, las ironías y los regionalismos son casi imposibles de capturar para un modelo entrenado con datos genéricos. En la Rama Judicial colombiana, la expresión "eso está para fallo" puede significar tanto que un proceso está listo para sentencia como que algo está a punto de fallar.
- Visualización y evaluación de embeddings: Cuando representamos los textos jurídicos en embeddings vectoriales densos (típicamente configurados a 300 dimensiones), se hace difícil evaluar la calidad de los agrupamientos semánticos. Para resolver esto en las fases iniciales de Isabella —similar a los laboratorios que realizamos con la herramienta Orange—, aplicamos técnicas de reducción de dimensionalidad como PCA y UMAP para mapear los vectores a 2D y 3D. Comprobamos que UMAP era muy superior a PCA para aislar las variables no lineales del lenguaje jurídico, facilitando la identificación visual de agrupaciones anómalas antes de entrenar los clasificadores.
- Privacidad y manejo de datos sensibles: En el contexto judicial, las consultas contienen información protegida por reserva legal. Integrar APIs de terceros (como GPT-4o) implica un dilema ético y normativo sobre dónde se almacenan y procesan esos datos.
- Consumo energético y sostenibilidad: Entrenar modelos de lenguaje de gran escala requiere recursos computacionales masivos. Para organizaciones públicas con presupuestos limitados, esto representa una barrera real de adopción.