Intervención Principal - Grupo 10
Foro Semana 2: Fundamentos de Machine Learning Avanzado
Integrantes: María Fernanda, Neheman Samir, William Andrés, Yesith y Alexander Oviedo Fadul.
Apreciado docente Leonardo Valderrama García y compañeros,
Iniciamos la participación de nuestro Grupo 10 abordando las tres preguntas orientadoras propuestas para este foro. Como bien señalaba el profesor Leonardo en nuestra sesión sincrónica, la utilidad del Machine Learning no radica en ver los algoritmos como simples fórmulas, sino en comprender cómo intentan emular la forma en que los seres humanos identificamos patrones para tomar decisiones.
1. Diferencias entre los modelos
Desde la experiencia integrando tecnologías emergentes en entornos reales (como el ecosistema MARDUK para la Rama Judicial), la principal diferencia entre estos modelos radica en la existencia de un objetivo preconcebido (etiquetas) y la naturaleza de la salida esperada:
- Clasificación (Supervisado): La salida es discreta o categórica. El modelo actúa como un juez que emite un veredicto definitivo (ej. ¿Es este expediente "Fraude" o "No Fraude"?). Un ejemplo clásico visto en clase es el filtro de correos Spam.
- Regresión (Supervisado): La salida es un valor continuo. El modelo predice magnitudes numéricas. Como ilustró el profesor, predecir el valor comercial de un apartamento basado en sus metros cuadrados y ubicación histórica.
- Agrupamiento / Clustering (No Supervisado): Agrupa datos fríos por similitud para generar hipótesis sin tener etiquetas previas. Ej: Segmentar ciudadanos según sus patrones de acceso web.
- Asociación (No Supervisado): Revela reglas ocultas transaccionales y de co-ocurrencia ("si ocurre A, qué tan probable es que ocurra B") sin buscar predecir el futuro inmediato de un solo registro.
2. ¿Cuándo es apropiado utilizar cada uno de ellos?
El paradigma a elegir depende de tres variables críticas: 1) ¿Tengo datos etiquetados? 2) ¿Es una salida discreta o continua? y 3) ¿Cuál es el costo ético/económico de equivocarme?
- Clasificación: Apropiada cuando la entidad pública o privada exige decisiones categóricas contundentes (ej. rechazar o aprobar un crédito, clasificar un paquete de red como legítimo o DDoS).
- Regresión: Idónea para proyectar presupuestos futuros o elasticidades, estimando valores cuantitativos a lo largo del tiempo.
- Agrupamiento: Vital cuando tenemos datos crudos y nuestra tarea exploratoria es encontrar patrones latentes (ej. mapear perfiles clínicos masivos para encontrar subgrupos de pacientes silenciosos).
- Asociación: Perfecta para optimización de la experiencia de usuario (UX) en comercio o portales gubernamentales, sugiriendo el trámite "B" a quien consulta el trámite "A".
3. Principales algoritmos de clasificación y sus aplicaciones
Dentro del aprendizaje supervisado, el arsenal de clasificación es extenso, pero destacamos:
- Regresión Logística: Excelente para Credit Scoring bancario por su alta explicabilidad probabilística (clasificación binaria).
- Random Forest: Ensamble robusto que reduce el sesgo. Se usa ampliamente en evaluación de fraudes financieros.
- Máquinas de Soporte Vectorial (SVM): Buscan proyectar datos multidimensionales y son vitales en biometría o clasificación de imágenes.
- K-Nearest Neighbors (KNN): Asigna la clasificación mediante "votación" de vecindad, muy útil en motores de recomendación iniciales.
Reflexión Final del Equipo:
A lo largo de nuestras intervenciones hemos detallado el ecosistema técnico del Machine Learning. Sin embargo, no podemos omitir la lúcida reflexión que nos compartió el docente Leonardo sobre el caso Cambridge Analytica y el uso de los datos para la manipulación psicológica de las masas durante la campaña presidencial estadounidense de 2016. Un excelente algoritmo de clasificación o agrupamiento con datos masivos no solo genera una inferencia estadística, sino que se puede convertir en un arma social y política si viola la ética. Nosotros, como futuros Especialistas, somos garantes éticos de que el modelo predictivo que lancemos respete la autonomía humana. ¡Esa no es tarea de la red neuronal, es exclusivamente nuestra!