Estagiária De Engenharia De Dados
Current1. Atribuições• Manipulação e análise de dados: Consulta e manipulação de bancos de dados utilizando SQL e operações em ambiente distribuído com Apache Spark;• Desenvolvimento de pipelines: Criação de pipelines de dados escaláveis e eficientes utilizando Scala com Spark para processamento distribuído de grandes volumes de dados;• Versionamento e deploy: Utilização de Git para controle de versão e desenvolvimento de pipelines CI/CD com Jenkins para automação e deploy de artefatos de software em ambientes produtivos;• Ambiente Linux: Realização de operações e scripts básicos em linha de comando para gerenciamento e configuração de ambientes;• Extração e integração de metadados: Extração, transformação e carga de metadados provenientes de diversos ambientes (Oracle, Big Data, MongoDB, AWS Glue e RDS Aurora) para áreas de staging, assegurando autenticidade e integridade dos dados.2. Ferramentas• Big Data e processamento de dados: Apache Hadoop, Spark, Hive, Impala, NiFi;• Desenvolvimento e automação: Scala, IntelliJ, GitLab, Jenkins;• Bancos de dados e armazenamento: Oracle, MongoDB, AWS (Glue, RDS Aurora, S3);• Outras ferramentas: MobaXterm, Excel, Word, PowerPoint.3. Contribuições• Atuação no projeto Catálogo de Dados AD, com foco na criação de uma visão abrangente e precisa dos metadados para otimizar o controle e a supervisão dos objetos em ambientes produtivos da organização. Minha contribuição envolve a extração de metadados de diversos ambientes, como Oracle, Big Data (Impala), MongoDB e AWS (Glue e RDS Aurora), aplicar transformações necessárias e realizar o carregamento dos dados em áreas de staging. Utilizo técnicas de programação em Scala com Spark para implementar métodos de coleta, integração e transformação de metadados, assegurando sua autenticidade e integridade, com o objetivo de contribuir para uma gestão mais eficiente e proporcionar uma melhor compreensão dos recursos de dados na organização.