Estudio de caso: análisis de la cesta de compra mediante algoritmos de agrupamiento (k-means) y reglas de asociación (apriori) en aprendizaje no supervisado
Machine Learning Avanzado - Semana 3
Integrantes del Grupo 10:
Alexander Oviedo Fadul
María Fernanda Ruiz Paipilla
Neheman Samir Jaller Cerchiaro
William David Obando López
Presentado al Docente:
Leonardo Valderrama García
Corporación Universitaria Minuto de Dios - UNIMINUTO
Maestría en Inteligencia Artificial
Bogotá D.C., Colombia
Mayo de 2026
Contenido
Pag.
4. Informe Final y Desarrollo 7
4.1. Enlace Directo de Google Colab (Notebook Ejecutado): 7
4.2. Preparacion y limpieza de datos. 7
4.3. Análisis exploratorio de datos 7
4.5. Aplicación del algoritmo A priori 9
4.6. Interpretación de resultados 9
6. Referencias Bibliográficas 12
Introducción
El aprendizaje no supervisado permite encontrar patrones y relaciones en conjuntos de datos sin necesidad de contar con una variable objetivo definida (Bi et al., 2019). Dentro de estas técnicas se encuentran los algoritmos de agrupamiento y las reglas de asociación, los cuales son ampliamente utilizados para analizar hábitos de consumo y apoyar la toma de decisiones en diferentes sectores comerciales (Luengo-Oroz, 2020).
En este estudio de caso se trabajó con un conjunto de datos de una panadería comercial que contiene miles de registros de compras realizadas por los clientes. A partir de esta información se aplicaron dos técnicas de Machine Learning no supervisado: el algoritmo K-Means para segmentar las transacciones y el algoritmo Apriori para identificar productos que suelen comprarse juntos.
El desarrollo de la actividad se realizó en Google Colab utilizando Python y librerías especializadas para análisis de datos. Los resultados obtenidos permitieron identificar patrones de compra útiles para el diseño de promociones, organización de productos y mejora en las estrategias comerciales del negocio.
Objeto de Estudio
El caso seleccionado corresponde al análisis de compras realizadas en una panadería. El conjunto de datos contiene más de 21.000 registros asociados a facturas y productos adquiridos por los clientes.
El propósito principal fue identificar patrones de comportamiento en las transacciones utilizando técnicas de aprendizaje no supervisado (Bonaccorso, 2018). Para ello se aplicó el algoritmo K-Means con el fin de agrupar las compras según características similares, y posteriormente se utilizó Apriori para descubrir asociaciones frecuentes entre productos.
Con este análisis se buscó generar información útil para apoyar decisiones relacionadas con promociones, organización de productos y estrategias de venta cruzada.
Actores y Contextos
En el desarrollo del caso intervienen diferentes actores relacionados con el funcionamiento de la panadería:
• Clientes: son quienes realizan las compras y generan la información transaccional analizada.
• Administradores: utilizan los resultados del análisis para tomar decisiones comerciales y diseñar promociones.
• Personal operativo: puede apoyarse en los resultados para mejorar la producción y disponibilidad de productos.
Desde el contexto ético, es importante que el análisis de datos se realice respetando la privacidad de los consumidores y promoviendo un uso responsable de la información (Cabanelas, 2019). Por esta razón, la información utilizada no contiene datos personales y se trabaja únicamente con registros de compras de manera anónima.
Objetivos
3.1 Objetivo General
Aplicar técnicas de aprendizaje no supervisado mediante los algoritmos K-Means y Apriori para analizar el comportamiento de compra de los clientes de una panadería.
3.2 Objetivos Específicos
• Analizar las características principales del conjunto de datos.
• Agrupar las transacciones utilizando el algoritmo K-Means.
• Identificar relaciones frecuentes entre productos mediante Apriori.
• Interpretar los resultados obtenidos para apoyar decisiones comerciales.
Desarrollo Taller semana 3, estudio de caso: análisis de la cesta de compra mediante algoritmos de agrupamiento (k-means) y reglas de asociación (apriori) en aprendizaje no supervisado
Informe Final y Desarrollo
Enlace Directo de Google Colab (Notebook Ejecutado):
El desarrollo completo del taller y la ejecución de los algoritmos se realizaron en Google Colab utilizando Python: https://colab.research.google.com/drive/1BxCPo09szpaq5odvINE0CE3giQDK2nPH
Preparacion y limpieza de datos.
Inicialmente se realizó la carga del dataset Bread Basket en Google Colab utilizando Python. Durante esta etapa se identificaron registros vacíos representados como “NONE”, los cuales fueron eliminados. También se estandarizaron los nombres de los productos y se eliminaron registros duplicados dentro de una misma factura para mejorar la calidad de los datos.
La limpieza y preparación de los datos es una etapa fundamental dentro de cualquier proceso de Machine Learning, ya que influye directamente en la calidad de los resultados obtenidos (Bi et al., 2019).
Análisis exploratorio de datos
Posteriormente se desarrolló un análisis exploratorio de datos (EDA) para identificar los productos más vendidos y las características principales de las transacciones. Se encontró que el café y el pan eran los productos con mayor frecuencia dentro del conjunto de datos.
Tabla 1
Productos con mayor frecuencia de compra
| Puesto | Producto | Porcentaje |
|---|---|---|
| 1 | Coffee | 47.8% |
| 2 | Bread | 32.7% |
| 3 | Tea | 14.3% |
| 4 | Cake | 10.4% |
| 5 | Pastry | 8.6% |
Nota. Elaboración propia con base en el análisis del dataset Bread Basket.
Aplicación de K-Means
Para aplicar el algoritmo K-Means se utilizaron variables relacionadas con la cantidad de productos comprados, la hora de compra y la presencia de café en la factura. Las variables fueron normalizadas mediante StandardScaler antes del entrenamiento.
Para determinar la cantidad adecuada de grupos se utilizó el método del codo (Elbow Method), seleccionando finalmente tres clústeres principales.
Para aplicar el algoritmo K-Means se utilizaron variables relacionadas con la cantidad de productos comprados, la hora de compra y la presencia de café en la factura. Las variables fueron normalizadas mediante StandardScaler antes del entrenamiento.
Tabla 2
Segmentación de transacciones mediante K-Means
| Clúster | Características | Horario | % Café |
|---|---|---|---|
| 0 | Compra rápida | 8:00 - 11:00 | 40% |
| 1 | Compra compuesta | Todo el día | 60% |
| 2 | Compra vespertina | 14:00 - 17:00 | 55% |
Nota. Resultados obtenidos a partir del modelo K-Means.
Aplicación del algoritmo A priori
Posteriormente se aplicó el algoritmo Apriori para identificar asociaciones frecuentes entre productos. Para ello se transformó la información transaccional a formato binario mediante One-Hot Encoding.
Las reglas de asociación permiten identificar relaciones frecuentes entre elementos dentro de un conjunto de datos y son ampliamente utilizadas en análisis de consumo y ventas (Palanisamy, 2018). Se calcularon métricas como soporte, confianza y lift para identificar las relaciones más importantes entre productos.
Tabla 3
Reglas de asociación más relevantes
| Antecedente | Consecuente | Confianza | Lift |
|---|---|---|---|
| cake | coffee | 52.7% | 2.01 |
| medialuna | coffee | 56.9% | 1.89 |
| pastry | coffee | 55.2% | 1.88 |
| sandwich | coffee | 53.2% | 1.47 |
Nota. Reglas obtenidas mediante el algoritmo Apriori.
Interpretación de resultados
Los resultados permitieron identificar que el café es el producto con mayor presencia en las transacciones y que existe una relación frecuente entre café y productos de panadería como pasteles y hojaldres. Estas asociaciones pueden ser utilizadas para diseñar promociones combinadas y mejorar la organización de los productos dentro de la tienda.
Además, la segmentación mediante K-Means permitió identificar diferentes comportamientos de compra según el horario y la cantidad de productos adquiridos.
5. Conclusiones
La aplicación de los algoritmos K-Means y Apriori permitió identificar patrones de compra y asociaciones frecuentes entre productos dentro de la panadería.
También se evidenció la importancia de realizar una adecuada limpieza y preparación de los datos antes de aplicar técnicas de Machine Learning.
Finalmente, el desarrollo de la actividad permitió fortalecer los conocimientos sobre aprendizaje no supervisado y su aplicación en problemas reales relacionados con el análisis de datos.
6. Referencias
Bi, Q., Goodman, K. E., Kaminsky, J., & Lessler, J. (2019). What is machine learning? A primer for the epidemiologist. American Journal of Epidemiology, 188(12), 2222–2239.
Bonaccorso, G. (2018). Machine learning algorithms: Popular algorithms for data science and machine learning (2nd ed.). Packt Publishing.
Cabanelas, J. (2019). Inteligencia artificial ¿Dr. Jekyll o Mr. Hyde? Mercados y Negocios, (40), 5–22.
Luengo-Oroz, M. (2020). Perspectives on artificial intelligence. Springer.
Palanisamy, P. (2018). Introduction to intelligent agents and learning environments. Packt Publishing.