Jobs / Amaris Consulting

Ingénieur(e) Site Reliability (SRE)

Amaris Consulting · Toronto, ON, Canada
Toronto, ON, CanadaExp: 10+ yrsRemote
Remuneration
Not specified
Location
Toronto, ON, Canada
Visa sponsorship
Not specified

Job summary

Amaris Consulting is seeking an experienced Site Reliability Engineer (SRE) to support cybersecurity, data risk, and resilience platforms by ensuring their reliability, availability, performance, and operational visibility. The role involves maintaining production stability, enhancing observability, supporting incident response, and delivering dashboards and operational insights for various stakeholders.

Qualifications

  • 10 ans ou plus d’expérience en Site Reliability Engineering, DevOps, ingénierie systèmes, ingénierie d’infrastructure, développement logiciel ou exploitation de production.
  • Solide expérience du support de plateformes hautement disponibles, distribuées, cloud ou critiques pour l’entreprise.
  • Expertise pratique des domaines de la surveillance, des alertes, de la journalisation, des métriques, du traçage, des tableaux de bord et de l’observabilité.
  • Expérience dans l’instrumentation d’applications, de services, d’API, de bases de données, d’infrastructures et de composants cloud.
  • Bonne compréhension des concepts de SLI, SLO, SLA, budgets d’erreur, gestion des incidents, gestion de capacité et préparation opérationnelle.
  • Expérience démontrée dans la conception d’alertes exploitables et dans le soutien à la détection et à la résolution rapides des incidents.
  • Expérience de la création de tableaux de bord opérationnels pour des équipes techniques et des parties prenantes exécutives.
  • Excellentes compétences en programmation ou scripting avec Python, Bash, PowerShell, Java ou des langages similaires.
  • Expérience avec AWS, Azure ou GCP.
  • Expérience avec les outils Infrastructure as Code tels que Terraform ou équivalent.
  • Bonne connaissance des pipelines CI/CD, des pratiques DevOps, des processus de mise en production et des modèles de support de production.
  • Solides compétences en résolution de problèmes dans des environnements distribués, avec des API REST, des plateformes de messagerie et des intégrations de services.
  • Connaissance de PostgreSQL, MSSQL, MongoDB ou d’autres bases de données relationnelles et non relationnelles.
  • Excellentes compétences en communication écrite et orale, avec la capacité d’expliquer des sujets techniques à des publics non techniques et exécutifs.

Responsibilities

  • Maintenir et améliorer la fiabilité, la disponibilité, l’évolutivité et la performance des plateformes de cybersécurité et de l’infrastructure associée.
  • Surveiller l’état de santé des systèmes, identifier les risques opérationnels, répondre aux incidents et assurer une résolution rapide des problèmes ayant un impact sur les services.
  • Instrumenter l’infrastructure, les applications, les API, les pipelines de données, les bases de données et les services cloud afin d’assurer une visibilité opérationnelle de bout en bout.
  • Concevoir, mettre en œuvre et améliorer les solutions de surveillance, d’alerting, de journalisation, de traçage et d’observabilité dans des environnements distribués et cloud natifs.
  • Développer des alertes pertinentes et exploitables afin de réduire le bruit et d’améliorer la qualité du signal pour une détection et une réponse plus rapides.
  • Définir et suivre les indicateurs de fiabilité, notamment les SLI, SLO, SLA, budgets d’erreur, la latence, le débit, les taux d’erreur et les métriques de saturation.
  • Créer et maintenir des tableaux de bord pour les équipes d’ingénierie, d’exploitation, produit, gestion des risques et pour les parties prenantes exécutives.
  • Améliorer continuellement les tableaux de bord exécutifs afin de soutenir les revues de direction sur la santé des services, les tendances d’incidents, les risques opérationnels et les performances de fiabilité.
  • Collaborer avec les équipes d’ingénierie, d’infrastructure, cloud et cybersécurité pour identifier les lacunes de fiabilité et mettre en œuvre des améliorations durables.
  • Participer à la réponse aux incidents, à l’analyse des causes racines, aux revues post-incident et aux activités de gestion des problèmes.
  • Automatiser les tâches opérationnelles, les vérifications de santé, la validation des déploiements, les rapports et les procédures de reprise.
  • Soutenir les processus CI/CD, DevOps et de gestion des mises en production en validant la préparation opérationnelle, la couverture de surveillance, les plans de retour arrière et les exigences de support de production.
  • Contribuer aux initiatives d’ingénierie de résilience, notamment la planification de capacité, l’optimisation des performances, les tests de bascule, la préparation à la reprise après sinistre et les tests de résilience.
  • Veiller à ce que les processus opérationnels et les pratiques d’observabilité soient conformes aux normes de sécurité, de gestion des risques, de conformité et de gouvernance de l’entreprise.

Skills

AWSAzureAzure MonitorBashCloudWatchDatadogDockerDynatraceGCPGrafanaJavaKafkaKubernetesLinuxMongoDBNew RelicOpenTelemetryPostgreSQLPowerShellPrometheusPythonRESTSplunkTerraformWindows

Relocation

No