Este repositório reúne projetos práticos de Data Cleaning e ETL em SQL, com foco em bases de dados reais e inconsistentes, simulando desafios próximos a ambientes produtivos.
O objetivo principal é praticar SQL avançado e trabalhar em ambiente cloud (Snowflake), aplicando técnicas de limpeza, padronização e preparação de dados para análises e BI.
Os projetos exploram:
- Padronização de dados e tipos de coluna
- Tratamento de valores nulos e inconsistentes
- Aplicação de regras de negócio
- Deduplicação inteligente e scoring
- Preparação de datasets para consumo analítico
📌 Status: Concluído
📌 Plataforma: Snowflake
📌 Objetivo: Transformar uma tabela de vendas bruta, cheia de inconsistências e placeholders, em um dataset confiável, aplicando limpeza de dados, padronização de tipos, normalização de unidades e verificação de duplicatas via hash.
📌 Status: Concluído
📌 Plataforma: Snowflake
📌 Objetivo: Elevar a complexidade do dataset, lidando com múltiplos formatos de datas, preços e pesos, duplicatas parciais e placeholders inválidos. Implementação de Scoring e funções de janela (ROW_NUMBER) para manter a linha mais completa.
- Praticar SQL avançado, incluindo
COALESCE,REGEXP,TRY_TO_NUMBER,TRY_TO_DATE,WINDOW FUNCTIONSeROW_NUMBER. - Trabalhar em ambiente cloud Snowflake, criando pipelines seguros, escaláveis e rastreáveis.
- Consolidar boas práticas de data cleaning, preparando datasets para BI, análises e dashboards.
- Aprender a lidar com datasets reais, simulando problemas comuns em produção: nulos, duplicatas, inconsistências de formatos e unidades.
Novos desafios de Data Cleaning e ETL serão adicionados periodicamente, aumentando a complexidade dos datasets e explorando técnicas avançadas de SQL.