Jobs / Tes***
Sr. Site Reliability Engineer, Observability
Tes*** · Fremont, CA, United States
Visa sponsorship details are locked. Unlock company name and apply link with .
Fremont, CA, United States120,000-396,000 USD/yearlyRemote
Remuneration
120,000-396,000 USD/yearly
Location
Fremont, CA, United States
Visa sponsorship
Sponsors visa
Job summary
This role focuses on designing and operating enterprise-grade observability solutions to provide comprehensive visibility across digital, manufacturing, fleet, and Autopilot platforms. Key responsibilities include managing a multi-tenant Grafana Mimir estate, operating a Splunk platform that ingests over 700 TB of logs daily, and utilizing AI to enhance operational efficiency while collaborating with SREs and application teams.
Qualifications
- Strong hands-on experience with observability stacks including Grafana Mimir, Prometheus, cortex, Thanos
- Deep expertise in Linux system internals and large-scale performance tuning
- Solid experience with Kubernetes configuration and multi-cluster HA architectures
- Advanced proficiency in PromQL and SQL
- Strong knowledge of monitoring and observability practices including OpenTelemetry
- Experience with distributed systems architecture and high-availability cluster design
- Familiarity with S3-compatible object storage
- Knowledge of configuring and managing authentication mechanisms
- Proven troubleshooting expertise in large-scale distributed metrics and logs platforms
- Strong scripting and automation skills (Python, Ansible, GitHub Actions)
Responsibilities
- Design, build, and operate a multi-tenant Grafana Mimir estate processing 1B+ active series
- Operate Splunk as a multi-site clustered platform ingesting 700+ TB of logs per day
- Build and tune Cribl pipelines for routing, filtering, and enrichment of metrics and logs
- Run Kubernetes for the observability stack
- Participate in on-call rotations and lead incident response
- Apply AI to enhance operational efficiency
- Collaborate with SREs, architects, and application teams
Skills
AnsibleCortexGitHubGitHub ActionsGrafanaKafkaKubernetesLinuxMimirOpenTelemetryPrometheusPythonS3SplunkThanos
Relocation
No