Jobs / Tes***

Sr. Site Reliability Engineer, Observability

Tes*** · Fremont, CA, United States
Visa sponsorship details are locked. Unlock company name and apply link with .
Fremont, CA, United States120,000-396,000 USD/yearlyRemote
Remuneration
120,000-396,000 USD/yearly
Location
Fremont, CA, United States
Visa sponsorship
Sponsors visa

Job summary

This role focuses on designing and operating enterprise-grade observability solutions to provide comprehensive visibility across digital, manufacturing, fleet, and Autopilot platforms. Key responsibilities include managing a multi-tenant Grafana Mimir estate, operating a Splunk platform that ingests over 700 TB of logs daily, and utilizing AI to enhance operational efficiency while collaborating with SREs and application teams.

Qualifications

  • Strong hands-on experience with observability stacks including Grafana Mimir, Prometheus, cortex, Thanos
  • Deep expertise in Linux system internals and large-scale performance tuning
  • Solid experience with Kubernetes configuration and multi-cluster HA architectures
  • Advanced proficiency in PromQL and SQL
  • Strong knowledge of monitoring and observability practices including OpenTelemetry
  • Experience with distributed systems architecture and high-availability cluster design
  • Familiarity with S3-compatible object storage
  • Knowledge of configuring and managing authentication mechanisms
  • Proven troubleshooting expertise in large-scale distributed metrics and logs platforms
  • Strong scripting and automation skills (Python, Ansible, GitHub Actions)

Responsibilities

  • Design, build, and operate a multi-tenant Grafana Mimir estate processing 1B+ active series
  • Operate Splunk as a multi-site clustered platform ingesting 700+ TB of logs per day
  • Build and tune Cribl pipelines for routing, filtering, and enrichment of metrics and logs
  • Run Kubernetes for the observability stack
  • Participate in on-call rotations and lead incident response
  • Apply AI to enhance operational efficiency
  • Collaborate with SREs, architects, and application teams

Skills

AnsibleCortexGitHubGitHub ActionsGrafanaKafkaKubernetesLinuxMimirOpenTelemetryPrometheusPythonS3SplunkThanos

Relocation

No