FS

Felipe Silva

Engenheiro backend por profissão, pesquisador por curiosidade e construtor de soluções movidas por Python, dados e inteligência artificial.

ETL de Exemplo com PySpark e SQLAlchemy

Engenharia de DadosVer no GitHub

Este é um exemplo de um aplicativo ETL (Extract, Transform, Load) desenvolvido com PySpark e SQLAlchemy, onde foram aplicados conceitos de SOLID, Hexagonal Architecture, Clean Architecture, DDD, TDD e design patterns.

Objetivo

O objetivo deste projeto é demonstrar uma estrutura robusta e modular para a construção de um aplicativo ETL em Python, utilizando ferramentas populares como PySpark para processamento de big data e SQLAlchemy para interação com banco de dados.

Tecnologias Utilizadas

  • PySpark: biblioteca Python para processamento de big data, construída sobre o Apache Spark. Utilizada para realizar a extração, transformação e carregamento de grandes volumes de dados.
  • SQLAlchemy: biblioteca Python para mapeamento objeto-relacional (ORM) e interação com banco de dados SQL.

Como Executar o Projeto

  1. Clone este repositório para o seu ambiente local.
  2. Instale as dependências do projeto.
  3. Execute os testes do projeto.
  4. Execute o aplicativo ETL.

Contribuição

Contribuições são bem-vindas! Sinta-se à vontade para abrir uma issue ou enviar um pull request com sugestões, correções ou novas funcionalidades.