Azure Data Engineer
CurrentDesigned end-to-end scalable architecture to address business challenges using Azure Components.Utilized Azure Data Factory, SQL API, and MongoDB API to integrate data from multiple sources.Developed Spark applications for data extraction, transformation, and aggregation from various file formats.Designed SSIS packages to transfer data from flat files to SQL Server & checks to ensure data quality.Authored pipelines in Azure Data Factory (ADF) to extract, transform, and load data from diverse sources like Azure SQL, Blob Storage, and more.Integrated data from sources such as MongoDB, MS SQL, and Cloud DB using Azure Data Factory, SQL API, and MongoDB API.Utilized Azure Synapse Analytics for data processing and migration initiatives.Designed and developed real-time stream processing applications with Spark, Kafka, Scala, and Hive for Streaming ETL/ELT and machine learning.Partitioned and bucketed Hive tables in Parquet format with Snappy compression, loading data from Avro Hive tables.Architected scalable data processing and analytics solutions for Azure HDInsight, addressing technical feasibility, integration, and development.Utilized Azure Kubernetes Service and Docker containers for deployment, scaling, and load balancing.Implemented strategies for optimizing continuous integration, release, and deployment processes using container and virtualization techniques.Collected JSON data from HTTP sources and developed Spark APIs for data insertion and updates in Hive tables.Facilitated analytical reporting and data insights for PowerBI dashboards.Employed Git for version control and Jira for project management, efficiently tracking and resolving issues and bugs.Environment: Azure (Data Lake, Data Factory, Synapse Analytics, HDInsight, SQL Server, ML studio), PowerBI, Hive, Spark, Databricks, Python, PySpark, Scala, SQL, Sqoop, Kafka, Airflow, Oozie, HBase, Oracle, Teradata, Cassandra, MLlib, Tableau, Git, Jira.