Caso de Estudio · Machine Learning

Predicción de Fuga
de Clientes Bancarios

Identificar clientes en riesgo de abandono antes de que se vayan, habilitando campañas de retención dirigidas que maximizan el valor de la cartera con un costo operativo mínimo.

~86% Recall en clientes de alto riesgo
~0.87 AUC-ROC del modelo final
~5x Menor costo retener vs. adquirir
~60% Del riesgo explicado por 3 variables

* Cifras referenciales del caso de estudio — no corresponden a datos de ninguna institución específica.

El problema de negocio

En banca minorista, la fuga de clientes (churn) no es solo un indicador operativo — es una señal directa de erosión del valor de cartera.

¿Por qué importa el churn?

Un banco minorista típico pierde entre el 10% y 20% de su base de clientes activos anualmente. Cada cliente perdido representa no solo el ingreso directo, sino también el cross-sell, las referencias y el valor del ciclo de vida completo.

La clave no es predecir quién se fue, sino quién está a punto de irse — con suficiente anticipación para intervenir.

Regla empírica: retener un cliente existente cuesta aproximadamente 5 a 7 veces menos que adquirir uno nuevo con perfil equivalente.

Impacto en el portafolio

Una mejora del 5% en la tasa de retención puede incrementar el valor del portafolio entre un 25% y 95%, según el segmento de cliente y el margen promedio — una relación no lineal que amplifica el retorno de cada acción de retención exitosa.

  • El decil superior de riesgo concentra típicamente el 40–50% del churn total.
  • Dirigir campañas solo a ese decil reduce el costo de campaña en 70–80% vs. campañas masivas.
  • El modelo convierte un problema difuso de "quién se va" en una lista de acción priorizada.

Calculadora de impacto de fuga

Cálculo ilustrativo basado en parámetros configurables. Portafolio hipotético de 100,000 clientes con ingreso promedio de $1,200 USD/año.

10%
~10,000 Clientes perdidos / año
~$12M Ingresos en riesgo / año
~$60M Costo equiv. de reposición (5×)

Metodología

Un pipeline reproducible desde datos crudos hasta modelo de producción, con énfasis en interpretabilidad y manejo correcto del desbalance de clases.

Dataset

Dataset de perfil bancario de estilo público (similar a Kaggle Bank Churn). Variables principales:

  • Demográficas: edad, género, país / región
  • Financieras: saldo de cuenta, saldo relativo al ingreso estimado
  • Relación con el banco: antigüedad, número de productos activos, tiene tarjeta de crédito
  • Comportamiento: actividad en los últimos 90 días, número de reclamos recientes
  • Variable objetivo: Exited — si el cliente cerró su cuenta en el período siguiente

La distribución natural muestra ~20% de churn, generando desbalance que se aborda explícitamente.

Feature Engineering y Desbalance

Variables derivadas que mejoraron el modelo:

  • Ratio saldo / ingreso estimado — captura tensión financiera
  • Interacción antigüedad × productos — clientes jóvenes con un solo producto son de alto riesgo
  • Flag de inactividad prolongada — sin transacciones en 90 días
  • Aceleración de reclamos — tendencia creciente en últimos 3 meses

Manejo de desbalance:

  • Línea base: class weights proporcionales al desbalance
  • Experimento: SMOTE solo en entrenamiento (nunca en validación / test)
  • Métrica principal: Recall de la clase positiva y AUC-ROC (no accuracy)

Comparación de modelos

Regresión Logística — Línea base interpretable

Modelo baseline de referencia. Sus coeficientes son directamente interpretables como log-odds, lo que facilita la comunicación con equipos de negocio y cumplimiento regulatorio. Limitado en la captura de interacciones no lineales entre variables.

Ventajas: velocidad de entrenamiento, explicabilidad directa, bajo riesgo de sobreajuste.
Limitaciones: asume linealidad, bajo recall en clase minoritaria sin ajuste extenso.

~79%Accuracy
~56%Precision
~58%Recall
~57%F1
~0.72AUC-ROC

Resultados

Evaluación completa del modelo sobre el conjunto de test independiente. Todas las métricas son aproximadas y de carácter referencial.

Curvas ROC — Comparativa de modelos

Ver datos en tabla
Valores AUC-ROC por modelo
Modelo AUC-ROC Interpretación
XGBoost ~0.87 Muy buena discriminación
Random Forest ~0.84 Buena discriminación
Regresión Logística ~0.72 Discriminación aceptable
Línea base (random) 0.50 Sin discriminación

Matriz de Confusión (XGBoost)

Hover o foco sobre cada celda para entender su significado de negocio.

Predicción del modelo
Pred. No Fuga
Pred. Fuga
Real No Fuga
TN Verdadero Neg. ~6,890
FP Falso Positivo ~420
Real Fuga
FN Falso Negativo ~280
TP Verdadero Pos. ~1,710
Ver datos en tabla
Valores de la matriz de confusión
Celda Abrev. Valor aprox. Significado
Verdadero NegativoTN~6,890No fugó, modelo correcto
Falso PositivoFP~420No fugó, modelo incorrecto
Falso NegativoFN~280Fugó, modelo no detectó
Verdadero PositivoTP~1,710Fugó, modelo correcto

Importancia de Variables (XGBoost)

Ver datos en tabla
Importancia de variables del modelo XGBoost
Variable Importancia Interpretación
Antigüedad~24%Clientes nuevos fugaron más
Número de productos~19%1 producto = mayor riesgo
Actividad reciente~17%Inactividad predice fuga
Saldo relativo~14%Saldo bajo o muy alto
Edad~10%Segmento 50–60 años
Reclamos recientes~9%Experiencia negativa
País / región~7%Variación por mercado

Simulador de riesgo de fuga

Configura el perfil de un cliente hipotético y observa cómo cambia su nivel de riesgo según las variables más importantes del modelo.

Nota importante: Simulador ilustrativo con coeficientes aproximados derivados del análisis descriptivo del caso de estudio. No representa ni contiene el modelo productivo real. Los resultados son orientativos.

Perfil del cliente

45 años
3 años
1
0

Nivel de riesgo estimado

✓ Riesgo Bajo
Acción recomendada

Sin acción urgente. Incluir en programa de fidelización pasivo. Revisión trimestral.

Simulador ilustrativo con coeficientes aproximados — no es el modelo productivo

Impacto de negocio

El verdadero valor del modelo no está en la precisión técnica, sino en la eficiencia que genera al dirigir los recursos de retención hacia donde realmente importa.

Estrategia de decil superior

El modelo ordena a todos los clientes por probabilidad de fuga. Concentrar las campañas en el decil superior (el 10% con mayor riesgo) captura entre el 40–55% de los churners reales, con una lista de contacto 10 veces más pequeña que una campaña masiva.

Este es el principio de lift: por cada cliente en el decil top, la probabilidad de que sea un futuro churner es ~4–5 veces mayor que en la población general.

Umbral de decisión ajustable

El umbral de clasificación no es fijo. Según el costo relativo de FP vs. FN en cada contexto bancario, el equipo de negocio puede moverlo:

  • Umbral bajo (0.3): más recall, más clientes contactados, costo de campaña mayor.
  • Umbral alto (0.6): más precision, menos contactos, solo clientes con riesgo muy alto.

El análisis costo-beneficio para ese ajuste es responsabilidad del equipo de producto y marketing, no del modelo.

Comparativa ilustrativa de ROI: campaña masiva vs. campaña dirigida por modelo

Parámetros hipotéticos para una cartera de 100,000 clientes. Valores en USD. Solo a modo ilustrativo.

Comparativa de ROI entre campaña masiva y campaña dirigida por modelo
Parámetro Campaña masiva Campaña dirigida (modelo)
Clientes contactados 100,000 ~10,000 (decil top)
Costo de campaña ($5 / contacto) $500,000 $50,000
Churners reales alcanzados ~2,000 (20%) ~900 (45% captura)
Tasa de conversión de retención (30%) ~600 clientes retenidos ~270 clientes retenidos
Ingreso recuperado ($1,200/cliente/año) $720,000 $324,000
ROI neto de campaña $220,000 (44%) $274,000 (548%)
Eficiencia por dólar invertido $1.44 $6.48
La campaña masiva retiene más clientes en valor absoluto, pero la campaña dirigida genera 4.5× más retorno por dólar invertido. En contextos de presupuesto limitado, el modelo es decisivo.

Arquitectura de productivización

Del notebook al servicio: cómo llevar el modelo a producción con monitoreo continuo, reentrenamiento automático y trazabilidad completa.

Diagrama interactivo de arquitectura. Haz clic o presiona Enter sobre cada componente para ver detalles.

Haz clic o toca cada componente para ver su función y tecnología

Arquitectura de productivización propuesta — referencial, no representa ninguna implementación específica.

Sobre el autor

Benjamin Ghiggo

AI Engineer especializado en GenAI, modelos de ML para predicción y productivización de soluciones de inteligencia artificial a escala. Experiencia en FastAPI, AWS y diseño de arquitecturas orientadas a datos.

GenAI Machine Learning FastAPI AWS MLOps XGBoost / Scikit-learn
Ver portafolio completo