Este projeto tem como objetivo construir uma solução end-to-end de dados para análise e predição de churn de clientes, utilizando uma arquitetura moderna e escalável baseada no padrão Medallion (RAW → BRONZE → SILVER → GOLD).
O projeto foi dividido em três grandes frentes, que se conectam entre si:
- Engenharia de Dados (Databricks + Spark SQL)
- Análise de Dados (Power BI)
- Ciência de Dados (Machine Learning + MLflow)
A base de dados utilizada é o Olist (e-commerce brasileiro), permitindo trabalhar com dados reais, relacionais e de grande volume, adequados para uso com Spark SQL.
- Databricks (Free Edition)
- Apache Spark (Spark SQL)
- Unity Catalog (camada lógica de metadados)
- Git (versionamento via Git folder)
- Power BI
- DAX
- SQL analítico
- Python
- PySpark
- Scikit-learn
- MLflow (experimentos e tracking)
- Streamlit (deploy conceitual do modelo)
O projeto segue a Medallion Architecture, amplamente utilizada em ambientes de dados modernos.
- Representa os dados conforme ingeridos da fonte
- No Databricks Free Edition, os dados são carregados diretamente como tabelas tabulares no schema
workspace.default
- Camada de exploração:
- Tipos das colunas
- Valores nulos
- Valores iconsistentes
Schema:
workspace.olist_bronze
- Camada de correção e pré-processamento:
- Correção dos tipos dos dados
- Tratando valores nulos
- Correção de dados inconsistentes
Schema:
workspace.olist_silver
- Camada de consumo analítico e modelagem:
- Dados limpos e organizados
- Criação RFV
- Fonte única para Power BI e Machine Leaning
Schema:
workspace.olist_gold
Objetivo: Criar uma base confiável, reprocessável e escalável para suportar análises e modelos de churn.
Principais atividades:
- Ingestão dos dados do Olist
- Exploração na camada BRONZE
- Pré-processamento e tratamento na camada SILVER
- Geração de tabelas analíticas e features na camada GOLD
Toda a lógica é implementada utilizando Spark SQL, organizada em notebooks versionados via Git.
Objetivo: Analisar o comportamento de churn dos clientes e identificar os principais fatores associados.
Atividades:
-
Conexão do Power BI à camada GOLD
-
Construção de KPIs de churn
-
Análise por:
- tempo
- estado
- frequência de compra
- valor gasto
-
Criação de dashboard interativo
Objetivo: Construir um modelo preditivo capaz de estimar a probabilidade de churn de um cliente.
Atividades:
- Feature engineering a partir da camada GOLD
- Treinamento de modelos de Machine Learning
- Comparação entre algoritmos tradicionais e redes neurais simples
- Tracking de experimentos com MLflow
- Deploy conceitual do modelo utilizando Streamlit
olist-churn-project/
│
├── databricks/
│ ├── 01_raw/
│ ├── 02_bronze/
│ ├── 03_silver/
│ └── 04_gold/
├── powerbi/
├── ml/
└── README.md
- Implementar checks de qualidade de dados
- Criar snapshots temporais para churn
- Simular orquestração com múltiplos notebooks
- Evoluir o deploy do modelo para API
Vitor Nobre Silva
Projeto desenvolvido para fins de estudo, portfólio e aprofundamento em engenharia de dados, análise e ciência de dados.