Big Data Engineer
Nantes, Pays De La Loire, France
Projet pour la SNCF.L'objectif étant d'estimer le plus précisément possible, grâce à toutes les données collectées, structurées et traitées, le coût de chaque trajet effectué sur les lignes par les trains circulants. Mise en place d'un traitement périodique d'ingestion de données dans un Datalake. Mon rôle a été de faire le traitement d'ingestion, en Scala, des certaines sources de données mises à disposition sur Azure par le client et de les structurer, enrichir ou encore typer ces données pour les rendre utilisable dans le processus d'estimation. Les données ainsi traités sont mises à disposition dans une zone dite gold. L'enchainement de ces traitements se met en place grâce à un ordonnanceur Maven via des jobs Oozie.Chaine CI/CD grâce à Jenkins et Git.Reporting des résultats via PowerBI lors des réunions de fin d'itération.Durant ce projet, j'ai développé des compétences dans les différentes technologies du Big Data telles que Hadoop/Hive/Hql, Scala, Spark, Oozie ou encore Microsoft Azure, et également des compétences organisationnelles et relationnelles, respectivement avec la méthode Agile (Scrum) et son système d'itération et le travail en équipe avec la communication avec l'équipe de développement, PPO, BA et Scrum master ainsi qu'au client.