大数据工程师
项目描述:NRG新零售用户画像项目旨在通过使用ES从数仓获取离线业务数据,并通过Flume -> Kafka -> Structured Streaming -> Mysql获取实时业务数据。在Spark标签计算平台上,使用Mysql中的标签规则为数据打上相应的标签。通过Spark ML API进行数据挖掘,为用户打上挖掘类标签。使用Spark-yarn模式通过DataStage进行调度,将打好标签的数据提交到ES,以供BI绘制报表和满足其他业务需求。责任描述:1. 负责Hive外部表的方式将HDFS中的数据导入到ES,确保数据的准确性和一致性。2. 负责使用Datax的方式将Mysql中的数据导入到ES,编写Json的自动生成python脚本3. 使用Spark DSL和SQL的格式,根据4级标签规则查询ES中的数据,并根据5级标签规则为数据打上标签ID,实现标签的关联和匹配。4. 使用Spark DSL风格的代码开发性别、年龄段等规则类标签和消费周期、支付方式等统计类标签的计算逻辑,确保标签的准确性和完整性。5. 使用Spark DSL风格的代码和Spark ML的Kmeans算法及决策树等算法实现用户类型如高净值等挖掘类标签的开发,通过数据挖掘算法识别和分类用户类型。6. 协助团队使用BI进行报表的绘制和数据可视化展示,满足业务部门和管理层的需求。