Autoencoder para detección de fraude bancario

Deep Learning · Semana 8

6 de abril de 2026 · NRC-198 · 2 entregables

De qué iba

Cerramos el curso en equipo con el ejercicio de fraude. El archivo trae 594 643 transacciones y solo 7 200 son fraudulentas, así que el desbalance salta a la vista desde el primer conteo. Preparé los datos, entrené el autoencoder únicamente con transacciones normales para que aprendiera cómo se ve lo legítimo, y luego medí el error de reconstrucción sobre el conjunto de prueba, que sí traía los dos tipos. Cambié la arquitectura de 7-6-4-6-7 a 7-256-6-4-6-256-7, metí dropout, pasé a RMSprop y subí a 150 épocas.

  • Exploré fraude.csv con pandas: 594 643 filas, 10 columnas, sin valores faltantes, con 587 443 pagos normales frente a 7 200 fraudes
  • Quité zipcodeOri y zipMerchant porque cada una tenía un único valor, convertí las columnas categóricas a códigos numéricos y escalé amount con StandardScaler
  • Entrené el autoencoder solo con los registros no fraudulentos del 80 % de entrenamiento, con la arquitectura ampliada a 7-256-6-4-6-256-7, dropout de 0.2, RMSprop a 0.001, pérdida MSE, 150 épocas y lotes de 64
  • Escribimos con el grupo el informe en APA respondiendo las dos preguntas orientadoras y analizando la matriz de confusión y el papel del umbral de anomalía

Lo que costó. El resultado final fue incómodo de mirar: 98.8 % de exactitud y cero fraudes detectados. Los 1 417 casos fraudulentos del conjunto de prueba quedaron clasificados como normales, y sklearn me advirtió que la precisión de esa clase quedaba indefinida por dividir entre cero. Un número alto que no sirve para nada, y el propio notebook nos deja esa pregunta abierta: qué hacer con el desbalance y con el umbral fijo en 0.1.

Qué pedían

El enunciado y la rúbrica, tal cual los publicaron.

S8_DeepLearning.pdfdocumento · 637,7 KB

Qué entregué

Lo que salió de esa semana.

Deep learning_ejercicio fraude_S8_201021.ipynbcuaderno · 1,4 MB · 52 celdas
MA_Semana8_Deep_Learning_Autoencoder_Fraude.docxinforme · 37,4 KB · 1 507 palabras

Lo que usé por el camino

Notas sueltas, datos y código de apoyo.

Deep learning_autoencoder_imagen_ruido_S8_201021.jpgimagen · 25,9 KB
Deep_learning_fraude_S8_201021.rararchivo · 4,0 MB
fraude.csvconjunto de datos · 46,7 MB
modify_notebook.pyscript · 9,5 KB

Seguir leyendo

Esa misma semana, en las otras materias: