Staff Site Reliability Engineer
Sunnyvale, Ca, Us
Ensure the reliability, scalability, and efficiency of our data pipeline infrastructure. My responsibilities include:Monitoring and Alerting: Implementing and maintaining monitoring systems, integrating with metadata, and setting up dashboards and alerts.Incident Management: Participating in on-call rotations, handling incidents, performing root cause analysis, and implementing permanent fixes.Automation and Toil Reduction: Developing automation tools to minimize manual intervention, improving MTTR, and enhancing availability.Performance and Capacity Planning: Conducting performance analysis and capacity planning to handle increasing loads.Collaboration: Working with Software Engineers in design reviews, code reviews, and developing new features.Operational Excellence: Ensuring regular builds, up-to-date dependencies, testing, and improving deployment processes.Code Contributions: Writing and reviewing code to improve pipeline reliability and scalability.