Jobs / Showtime Consulting

Platform Reliability Engineer (Zabbix)

Showtime Consulting · Sydney, NSW, Australia
Sydney, NSW, AustraliaOnsite
Remuneration
Not specified
Location
Sydney, NSW, Australia
Visa sponsorship
Not specified

Job summary

Seeking an experienced Platform Reliability Engineer to enhance reliability and operational efficiency of monitoring platforms, migrating SNMP monitoring to Zabbix and developing full-stack tools.

Qualifications

  • Experience with Zabbix monitoring and SNMP polling
  • Experience with NOC platforms or network monitoring
  • Experience migrating or consolidating monitoring capabilities
  • Experience with Linux systems and networking concepts
  • Experience with open-source observability and telemetry
  • Experience with Go, Python, FastAPI, JavaScript, React
  • Experience with NGINX and REST APIs
  • Hands-on experience with Docker, Podman, Kubernetes
  • Experience with Kafka, Grafana, Airflow
  • Database experience with MySQL, Postgres, MongoDB
  • Understanding of cloud-native application design
  • Strong troubleshooting and problem-solving skills
  • Ability to work with engineering and operations teams
  • Experience standardizing monitoring templates and alerts
  • Strong communication skills for technical documentation

Responsibilities

  • Migrate SNMP performance monitoring from NOC to Zabbix
  • Design and maintain Zabbix monitoring templates and alerting models
  • Ensure visibility of network devices through SNMP polling
  • Improve monitoring coverage and operational observability
  • Consolidate monitoring tools to reduce complexity
  • Develop full-stack platform tooling using modern technologies
  • Build backend services using Go, Python, FastAPI
  • Develop frontend components using React, HTML, JavaScript
  • Support containerized environments with Docker, Podman, Kubernetes
  • Work with monitoring and data platforms like Grafana, Kafka, Airflow
  • Support Linux systems and basic networking
  • Troubleshoot monitoring and infrastructure issues
  • Collaborate with teams to improve service reliability
  • Produce technical documentation and operational procedures

Skills

AirflowClickHouseDockerGoGrafanaJavaScriptKafkaKubernetesLinuxMongoDBMySQLNGINXPodmanPostgreSQLPythonRESTVictoriaMetrics

Relocation

No