ETL de Exemplo com PySpark e SQLAlchemy
Engenharia de DadosVer no GitHub
Este é um exemplo de um aplicativo ETL (Extract, Transform, Load) desenvolvido com PySpark e SQLAlchemy, onde foram aplicados conceitos de SOLID, Hexagonal Architecture, Clean Architecture, DDD, TDD e design patterns.
Objetivo
O objetivo deste projeto é demonstrar uma estrutura robusta e modular para a construção de um aplicativo ETL em Python, utilizando ferramentas populares como PySpark para processamento de big data e SQLAlchemy para interação com banco de dados.
Tecnologias Utilizadas
- PySpark: biblioteca Python para processamento de big data, construída sobre o Apache Spark. Utilizada para realizar a extração, transformação e carregamento de grandes volumes de dados.
- SQLAlchemy: biblioteca Python para mapeamento objeto-relacional (ORM) e interação com banco de dados SQL.
Como Executar o Projeto
- Clone este repositório para o seu ambiente local.
- Instale as dependências do projeto.
- Execute os testes do projeto.
- Execute o aplicativo ETL.
Contribuição
Contribuições são bem-vindas! Sinta-se à vontade para abrir uma issue ou enviar um pull request com sugestões, correções ou novas funcionalidades.