Identificar clientes en riesgo de abandono antes de que se vayan, habilitando campañas de retención dirigidas que maximizan el valor de la cartera con un costo operativo mínimo.
~86%Recall en clientes de alto riesgo
~0.87AUC-ROC del modelo final
~5xMenor costo retener vs. adquirir
~60%Del riesgo explicado por 3 variables
* Cifras referenciales del caso de estudio — no corresponden a datos de ninguna institución específica.
01 — Contexto
El problema de negocio
En banca minorista, la fuga de clientes (churn) no es solo un indicador operativo — es una señal directa de erosión del valor de cartera.
¿Por qué importa el churn?
Un banco minorista típico pierde entre el 10% y 20% de su base de clientes activos anualmente. Cada cliente perdido representa no solo el ingreso directo, sino también el cross-sell, las referencias y el valor del ciclo de vida completo.
La clave no es predecir quién se fue, sino quién está a punto de irse — con suficiente anticipación para intervenir.
Regla empírica: retener un cliente existente cuesta aproximadamente 5 a 7 veces menos que adquirir uno nuevo con perfil equivalente.
Impacto en el portafolio
Una mejora del 5% en la tasa de retención puede incrementar el valor del portafolio entre un 25% y 95%, según el segmento de cliente y el margen promedio — una relación no lineal que amplifica el retorno de cada acción de retención exitosa.
El decil superior de riesgo concentra típicamente el 40–50% del churn total.
Dirigir campañas solo a ese decil reduce el costo de campaña en 70–80% vs. campañas masivas.
El modelo convierte un problema difuso de "quién se va" en una lista de acción priorizada.
Calculadora de impacto de fuga
Cálculo ilustrativo basado en parámetros configurables. Portafolio hipotético de 100,000 clientes con ingreso promedio de $1,200 USD/año.
10%
~10,000Clientes perdidos / año
~$12MIngresos en riesgo / año
~$60MCosto equiv. de reposición (5×)
02 — Proceso
Metodología
Un pipeline reproducible desde datos crudos hasta modelo de producción, con énfasis en interpretabilidad y manejo correcto del desbalance de clases.
Dataset
Dataset de perfil bancario de estilo público (similar a Kaggle Bank Churn). Variables principales:
Demográficas: edad, género, país / región
Financieras: saldo de cuenta, saldo relativo al ingreso estimado
Relación con el banco: antigüedad, número de productos activos, tiene tarjeta de crédito
Comportamiento: actividad en los últimos 90 días, número de reclamos recientes
Variable objetivo:Exited — si el cliente cerró su cuenta en el período siguiente
La distribución natural muestra ~20% de churn, generando desbalance que se aborda explícitamente.
Feature Engineering y Desbalance
Variables derivadas que mejoraron el modelo:
Ratio saldo / ingreso estimado — captura tensión financiera
Interacción antigüedad × productos — clientes jóvenes con un solo producto son de alto riesgo
Flag de inactividad prolongada — sin transacciones en 90 días
Aceleración de reclamos — tendencia creciente en últimos 3 meses
Manejo de desbalance:
Línea base: class weights proporcionales al desbalance
Experimento: SMOTE solo en entrenamiento (nunca en validación / test)
Métrica principal: Recall de la clase positiva y AUC-ROC (no accuracy)
Comparación de modelos
Regresión Logística — Línea base interpretable
Modelo baseline de referencia. Sus coeficientes son directamente interpretables como log-odds, lo que facilita la comunicación con equipos de negocio y cumplimiento regulatorio. Limitado en la captura de interacciones no lineales entre variables.
Ventajas: velocidad de entrenamiento, explicabilidad directa, bajo riesgo de sobreajuste. Limitaciones: asume linealidad, bajo recall en clase minoritaria sin ajuste extenso.
~79%Accuracy
~56%Precision
~58%Recall
~57%F1
~0.72AUC-ROC
Random Forest — Ensamble robusto
Mejora significativa sobre la línea base gracias a la captura de interacciones no lineales y el bagging que reduce la varianza. Menos sensible a outliers que el árbol individual. La importancia de variables (MDI) ofrece interpretabilidad razonable.
Ventajas: robusto a outliers, buena importancia de variables, bajo overfitting. Limitaciones: más lento en inferencia que XGBoost, menor performance en datasets tabulares con gradiente.
~84%Accuracy
~72%Precision
~74%Recall
~73%F1
~0.84AUC-ROC
XGBoost — Modelo final seleccionado
Gradient boosting optimizado para datos tabulares. Supera al Random Forest especialmente en recall de la clase positiva gracias al boosting secuencial que enfoca iteraciones sucesivas en los ejemplos difíciles. Configurado con scale_pos_weight para compensar el desbalance.
Ventajas: mejor AUC-ROC, mejor recall, rápida inferencia, compatible con SHAP para explicabilidad post-hoc. Limitaciones: más hiperparámetros para tunear, ligeramente menos interpretable directamente.
~87%Accuracy
~79%Precision
~86%Recall
~82%F1
~0.87AUC-ROC
03 — Evaluación
Resultados
Evaluación completa del modelo sobre el conjunto de test independiente. Todas las métricas son aproximadas y de carácter referencial.
Curvas ROC — Comparativa de modelos
Ver datos en tabla
Valores AUC-ROC por modelo
Modelo
AUC-ROC
Interpretación
XGBoost
~0.87
Muy buena discriminación
Random Forest
~0.84
Buena discriminación
Regresión Logística
~0.72
Discriminación aceptable
Línea base (random)
0.50
Sin discriminación
Matriz de Confusión (XGBoost)
Hover o foco sobre cada celda para entender su significado de negocio.
Predicción del modelo
Realidad
Pred. No Fuga
Pred. Fuga
Real No Fuga
TNVerdadero Neg.~6,890
FPFalso Positivo~420
Real Fuga
FNFalso Negativo~280
TPVerdadero Pos.~1,710
Ver datos en tabla
Valores de la matriz de confusión
Celda
Abrev.
Valor aprox.
Significado
Verdadero Negativo
TN
~6,890
No fugó, modelo correcto
Falso Positivo
FP
~420
No fugó, modelo incorrecto
Falso Negativo
FN
~280
Fugó, modelo no detectó
Verdadero Positivo
TP
~1,710
Fugó, modelo correcto
Importancia de Variables (XGBoost)
Ver datos en tabla
Importancia de variables del modelo XGBoost
Variable
Importancia
Interpretación
Antigüedad
~24%
Clientes nuevos fugaron más
Número de productos
~19%
1 producto = mayor riesgo
Actividad reciente
~17%
Inactividad predice fuga
Saldo relativo
~14%
Saldo bajo o muy alto
Edad
~10%
Segmento 50–60 años
Reclamos recientes
~9%
Experiencia negativa
País / región
~7%
Variación por mercado
04 — Interactivo
Simulador de riesgo de fuga
Configura el perfil de un cliente hipotético y observa cómo cambia su nivel de riesgo según las variables más importantes del modelo.
Nota importante: Simulador ilustrativo con coeficientes aproximados derivados del análisis descriptivo del caso de estudio. No representa ni contiene el modelo productivo real. Los resultados son orientativos.
Perfil del cliente
45 años
3 años
1
0
Nivel de riesgo estimado
✓ Riesgo Bajo
Acción recomendada
Sin acción urgente. Incluir en programa de fidelización pasivo. Revisión trimestral.
Simulador ilustrativo con coeficientes aproximados — no es el modelo productivo
05 — ROI
Impacto de negocio
El verdadero valor del modelo no está en la precisión técnica, sino en la eficiencia que genera al dirigir los recursos de retención hacia donde realmente importa.
Estrategia de decil superior
El modelo ordena a todos los clientes por probabilidad de fuga. Concentrar las campañas en el decil superior (el 10% con mayor riesgo) captura entre el 40–55% de los churners reales, con una lista de contacto 10 veces más pequeña que una campaña masiva.
Este es el principio de lift: por cada cliente en el decil top, la probabilidad de que sea un futuro churner es ~4–5 veces mayor que en la población general.
Umbral de decisión ajustable
El umbral de clasificación no es fijo. Según el costo relativo de FP vs. FN en cada contexto bancario, el equipo de negocio puede moverlo:
Umbral bajo (0.3): más recall, más clientes contactados, costo de campaña mayor.
Umbral alto (0.6): más precision, menos contactos, solo clientes con riesgo muy alto.
El análisis costo-beneficio para ese ajuste es responsabilidad del equipo de producto y marketing, no del modelo.
Comparativa ilustrativa de ROI: campaña masiva vs. campaña dirigida por modelo
Parámetros hipotéticos para una cartera de 100,000 clientes. Valores en USD. Solo a modo ilustrativo.
Comparativa de ROI entre campaña masiva y campaña dirigida por modelo
Parámetro
Campaña masiva
Campaña dirigida (modelo)
Clientes contactados
100,000
~10,000 (decil top)
Costo de campaña ($5 / contacto)
$500,000
$50,000
Churners reales alcanzados
~2,000 (20%)
~900 (45% captura)
Tasa de conversión de retención (30%)
~600 clientes retenidos
~270 clientes retenidos
Ingreso recuperado ($1,200/cliente/año)
$720,000
$324,000
ROI neto de campaña
$220,000 (44%)
$274,000 (548%)
Eficiencia por dólar invertido
$1.44
$6.48
La campaña masiva retiene más clientes en valor absoluto, pero la campaña dirigida genera 4.5× más retorno por dólar invertido. En contextos de presupuesto limitado, el modelo es decisivo.
06 — Ingeniería
Arquitectura de productivización
Del notebook al servicio: cómo llevar el modelo a producción con monitoreo continuo, reentrenamiento automático y trazabilidad completa.
Diagrama interactivo de arquitectura. Haz clic o presiona Enter sobre cada componente para ver detalles.
Haz clic o toca cada componente para ver su función y tecnología
Arquitectura de productivización propuesta — referencial, no representa ninguna implementación específica.
07 — Autor
Sobre el autor
BG
Benjamin Ghiggo
AI Engineer especializado en GenAI, modelos de ML para predicción y productivización de soluciones de inteligencia artificial a escala. Experiencia en FastAPI, AWS y diseño de arquitecturas orientadas a datos.