MlNoSupervisado_Asociacion_Semana3.docx
Machine Learning Avanzado · Semana 3 · 18 de mayo de 2026
← volver descargar
Lo entregué en Word con formato APA. Aquí lo puedes leer sin descargar nada, aunque los márgenes y la tipografía originales sólo están en el archivo.

Estudio de caso: análisis de la cesta de compra mediante algoritmos de agrupamiento (k-means) y reglas de asociación (apriori) en aprendizaje no supervisado

Machine Learning Avanzado - Semana 3

Integrantes del Grupo 10:
Alexander Oviedo Fadul

María Fernanda Ruiz Paipilla

Neheman Samir Jaller Cerchiaro

William David Obando López

Presentado al Docente:
Leonardo Valderrama García

Corporación Universitaria Minuto de Dios - UNIMINUTO
Maestría en Inteligencia Artificial
Bogotá D.C., Colombia
Mayo de 2026

Contenido

Pag.

Introducción 3

1. Objeto de Estudio 4

2. Actores y Contextos 5

3. Objetivos 6

3.1 Objetivo General 6

3.2 Objetivos Específicos 6

Desarrollo Taller semana 3, estudio de caso: análisis de la cesta de compra mediante algoritmos de agrupamiento (k-means) y reglas de asociación (apriori) en aprendizaje no supervisado 7

4. Informe Final y Desarrollo 7

4.1. Enlace Directo de Google Colab (Notebook Ejecutado): 7

4.2. Preparacion y limpieza de datos. 7

4.3. Análisis exploratorio de datos 7

4.4. Aplicación de K-Means 8

4.5. Aplicación del algoritmo A priori 9

4.6. Interpretación de resultados 9

5. Conclusiones 11

6. Referencias Bibliográficas 12

Introducción

El aprendizaje no supervisado permite encontrar patrones y relaciones en conjuntos de datos sin necesidad de contar con una variable objetivo definida (Bi et al., 2019). Dentro de estas técnicas se encuentran los algoritmos de agrupamiento y las reglas de asociación, los cuales son ampliamente utilizados para analizar hábitos de consumo y apoyar la toma de decisiones en diferentes sectores comerciales (Luengo-Oroz, 2020).

En este estudio de caso se trabajó con un conjunto de datos de una panadería comercial que contiene miles de registros de compras realizadas por los clientes. A partir de esta información se aplicaron dos técnicas de Machine Learning no supervisado: el algoritmo K-Means para segmentar las transacciones y el algoritmo Apriori para identificar productos que suelen comprarse juntos.

El desarrollo de la actividad se realizó en Google Colab utilizando Python y librerías especializadas para análisis de datos. Los resultados obtenidos permitieron identificar patrones de compra útiles para el diseño de promociones, organización de productos y mejora en las estrategias comerciales del negocio.

Objeto de Estudio

El caso seleccionado corresponde al análisis de compras realizadas en una panadería. El conjunto de datos contiene más de 21.000 registros asociados a facturas y productos adquiridos por los clientes.

El propósito principal fue identificar patrones de comportamiento en las transacciones utilizando técnicas de aprendizaje no supervisado (Bonaccorso, 2018). Para ello se aplicó el algoritmo K-Means con el fin de agrupar las compras según características similares, y posteriormente se utilizó Apriori para descubrir asociaciones frecuentes entre productos.

Con este análisis se buscó generar información útil para apoyar decisiones relacionadas con promociones, organización de productos y estrategias de venta cruzada.

Actores y Contextos

En el desarrollo del caso intervienen diferentes actores relacionados con el funcionamiento de la panadería:

• Clientes: son quienes realizan las compras y generan la información transaccional analizada.
• Administradores: utilizan los resultados del análisis para tomar decisiones comerciales y diseñar promociones.
• Personal operativo: puede apoyarse en los resultados para mejorar la producción y disponibilidad de productos.

Desde el contexto ético, es importante que el análisis de datos se realice respetando la privacidad de los consumidores y promoviendo un uso responsable de la información (Cabanelas, 2019). Por esta razón, la información utilizada no contiene datos personales y se trabaja únicamente con registros de compras de manera anónima.

Objetivos

3.1 Objetivo General

Aplicar técnicas de aprendizaje no supervisado mediante los algoritmos K-Means y Apriori para analizar el comportamiento de compra de los clientes de una panadería.

3.2 Objetivos Específicos

• Analizar las características principales del conjunto de datos.
• Agrupar las transacciones utilizando el algoritmo K-Means.
• Identificar relaciones frecuentes entre productos mediante Apriori.
• Interpretar los resultados obtenidos para apoyar decisiones comerciales.

Desarrollo Taller semana 3, estudio de caso: análisis de la cesta de compra mediante algoritmos de agrupamiento (k-means) y reglas de asociación (apriori) en aprendizaje no supervisado

  1. Informe Final y Desarrollo

    1. Enlace Directo de Google Colab (Notebook Ejecutado):

El desarrollo completo del taller y la ejecución de los algoritmos se realizaron en Google Colab utilizando Python: https://colab.research.google.com/drive/1BxCPo09szpaq5odvINE0CE3giQDK2nPH

Preparacion y limpieza de datos.

Inicialmente se realizó la carga del dataset Bread Basket en Google Colab utilizando Python. Durante esta etapa se identificaron registros vacíos representados como “NONE”, los cuales fueron eliminados. También se estandarizaron los nombres de los productos y se eliminaron registros duplicados dentro de una misma factura para mejorar la calidad de los datos.

La limpieza y preparación de los datos es una etapa fundamental dentro de cualquier proceso de Machine Learning, ya que influye directamente en la calidad de los resultados obtenidos (Bi et al., 2019).

Análisis exploratorio de datos

Posteriormente se desarrolló un análisis exploratorio de datos (EDA) para identificar los productos más vendidos y las características principales de las transacciones. Se encontró que el café y el pan eran los productos con mayor frecuencia dentro del conjunto de datos.

Tabla 1

Productos con mayor frecuencia de compra

Puesto Producto Porcentaje
1 Coffee 47.8%
2 Bread 32.7%
3 Tea 14.3%
4 Cake 10.4%
5 Pastry 8.6%

Nota. Elaboración propia con base en el análisis del dataset Bread Basket.

Aplicación de K-Means

Para aplicar el algoritmo K-Means se utilizaron variables relacionadas con la cantidad de productos comprados, la hora de compra y la presencia de café en la factura. Las variables fueron normalizadas mediante StandardScaler antes del entrenamiento.

Para determinar la cantidad adecuada de grupos se utilizó el método del codo (Elbow Method), seleccionando finalmente tres clústeres principales.

Para aplicar el algoritmo K-Means se utilizaron variables relacionadas con la cantidad de productos comprados, la hora de compra y la presencia de café en la factura. Las variables fueron normalizadas mediante StandardScaler antes del entrenamiento.

Tabla 2

Segmentación de transacciones mediante K-Means

Clúster Características Horario % Café
0 Compra rápida 8:00 - 11:00 40%
1 Compra compuesta Todo el día 60%
2 Compra vespertina 14:00 - 17:00 55%

Nota. Resultados obtenidos a partir del modelo K-Means.

Aplicación del algoritmo A priori

Posteriormente se aplicó el algoritmo Apriori para identificar asociaciones frecuentes entre productos. Para ello se transformó la información transaccional a formato binario mediante One-Hot Encoding.

Las reglas de asociación permiten identificar relaciones frecuentes entre elementos dentro de un conjunto de datos y son ampliamente utilizadas en análisis de consumo y ventas (Palanisamy, 2018). Se calcularon métricas como soporte, confianza y lift para identificar las relaciones más importantes entre productos.

Tabla 3

Reglas de asociación más relevantes

Antecedente Consecuente Confianza Lift
cake coffee 52.7% 2.01
medialuna coffee 56.9% 1.89
pastry coffee 55.2% 1.88
sandwich coffee 53.2% 1.47

Nota. Reglas obtenidas mediante el algoritmo Apriori.

Interpretación de resultados

Los resultados permitieron identificar que el café es el producto con mayor presencia en las transacciones y que existe una relación frecuente entre café y productos de panadería como pasteles y hojaldres. Estas asociaciones pueden ser utilizadas para diseñar promociones combinadas y mejorar la organización de los productos dentro de la tienda.

Además, la segmentación mediante K-Means permitió identificar diferentes comportamientos de compra según el horario y la cantidad de productos adquiridos.

5. Conclusiones

La aplicación de los algoritmos K-Means y Apriori permitió identificar patrones de compra y asociaciones frecuentes entre productos dentro de la panadería.

También se evidenció la importancia de realizar una adecuada limpieza y preparación de los datos antes de aplicar técnicas de Machine Learning.

Finalmente, el desarrollo de la actividad permitió fortalecer los conocimientos sobre aprendizaje no supervisado y su aplicación en problemas reales relacionados con el análisis de datos.

6. Referencias

  • Bi, Q., Goodman, K. E., Kaminsky, J., & Lessler, J. (2019). What is machine learning? A primer for the epidemiologist. American Journal of Epidemiology, 188(12), 2222–2239.

  • Bonaccorso, G. (2018). Machine learning algorithms: Popular algorithms for data science and machine learning (2nd ed.). Packt Publishing.

  • Cabanelas, J. (2019). Inteligencia artificial ¿Dr. Jekyll o Mr. Hyde? Mercados y Negocios, (40), 5–22.

  • Luengo-Oroz, M. (2020). Perspectives on artificial intelligence. Springer.

  • Palanisamy, P. (2018). Introduction to intelligent agents and learning environments. Packt Publishing.