IT & Software

DevOps & Site reliability Engineer

TMC Canada

Montreal (Administrative Region) · Qc · Canada

**Note: French version below / La version française se trouve ci-dessous**

À propos du poste

Rejoignez l'équipe Operations Technology pour concevoir, automatiser, déployer et soutenir des plateformes applicatives fiables ainsi que des capacités CI/CD. Vous collaborerez étroitement avec les équipes de développement, d'infrastructure, de réseau, de sécurité et de soutien à la production afin d'améliorer la livraison logicielle, la stabilité des plateformes et la résilience opérationnelle. Le rôle exige une solide expérience pratique avec Kubernetes, Docker/Podman, Linux, les pipelines CI/CD, GitHub, Python et le scripting shell, ainsi qu'une bonne compréhension des pratiques DevOps et SRE modernes. Le/la candidat(e) idéal(e) est passionné(e) par l'automatisation et la fiabilité, et aime résoudre des problèmes complexes tout en favorisant l'amélioration continue.

Principales responsabilités

  • Concevoir, construire et maintenir les pipelines CI/CD et l'infrastructure de déploiement
  • Développer des solutions de déploiement automatisées pour Kubernetes et les environnements conteneurisés, incluant les Helm charts et configurations YAML
  • Collaborer avec les équipes de développement pour améliorer les processus de build, test et livraison
  • Soutenir les déploiements, changements de configuration et mises à niveau de plateforme
  • Développer de l'automatisation avec Python et le scripting shell Linux
  • Gérer les dépôts GitHub, les stratégies de branchement et les flux de pull requests
  • Intégrer les tests automatisés, l'analyse de sécurité et les contrôles de qualité de code dans les pipelines CI/CD
  • Dépanner les problèmes applicatifs, de conteneurs, Kubernetes et réseau; investiguer les incidents de production et mettre en œuvre des solutions correctives
  • Appliquer les principes SRE pour améliorer la fiabilité, la disponibilité et l'observabilité
  • Définir la surveillance, les alertes et les métriques opérationnelles
  • Collaborer avec les équipes d'infrastructure, réseau, base de données, sécurité et applications
  • Maintenir la documentation technique, les runbooks et les guides de dépannage
  • Participer aux revues de conception, revues d'incidents et à la rotation de garde après les heures, au besoin

Compétences requises

  • 5 ans et plus d'expérience pertinente en DevOps, SRE, ingénierie de plateforme ou d'infrastructure
  • Solide expérience pratique avec Kubernetes (déploiement, mise à l'échelle, services, ingress, secrets)
  • Solide expérience avec Docker/Podman et les environnements conteneurisés
  • Solides compétences en administration Linux/UNIX et en scripting shell (Bash ou KornShell)
  • Expérience pratique en automatisation avec Python
  • Solide compréhension des concepts CI/CD et des stratégies de déploiement, avec expérience pratique d'outils comme Jenkins et Artifactory
  • Expérience avec Git/GitHub, incluant les stratégies de branchement et de livraison
  • Expérience avec YAML, Ansible ou frameworks d'automatisation équivalents
  • Solides connaissances réseau (DNS, TCP/IP, HTTP/HTTPS, TLS, proxys, équilibrage de charge)
  • Compréhension des pratiques SRE : surveillance, réponse aux incidents, analyse des causes profondes
  • Expérience en environnement Agile avec des outils comme Jira
  • Solides compétences en communication et capacité à collaborer avec des équipes réparties mondialement
  • Capacité à gérer plusieurs priorités avec supervision limitée et à participer à la rotation de garde

#J-18808-Ljbffr

Reference: WJ-3875_13066063

Apply now

Continue on the employer's official application - the same link they use for every candidate.

More jobs

Find more on GigBlows

This role is listed on GigBlows for discovery and search. Hiring decisions and applications are handled by the employer or their chosen application system.