DevOps / Site Reliability Engineer – Linux
Akkodis
Titre du poste : Ingénieur DevOps / Ingénieur en fiabilité des sites (SRE) – Linux
Niveau d’expérience : Niveau intermédiaire à senior
Nombre de postes : 1
Niveau du poste : FTC / Contrat
Lieu : Montréal, Québec – Mode hybride, 3 jours sur site par semaine
À propos du mandat
Une importante organisation de services financiers recherche un(e) ingénieur(e) DevOps / SRE expérimenté(e) pour soutenir la fiabilité, l’évolutivité, l’automatisation et l’excellence opérationnelle de ses plateformes technologiques d’entreprise.
Le rôle exige une solide expérience pratique de l’administration Linux, des pratiques DevOps, de l’automatisation, de la surveillance, de la gestion des incidents et des technologies infonuagiques dans un environnement hautement réglementé et à haute disponibilité.
Le candidat travaillera en étroite collaboration avec les équipes de développement logiciel, d’infrastructure, de soutien applicatif, de cybersécurité et d’autres équipes technologiques afin de créer des services fiables, d’automatiser les processus opérationnels, d’améliorer les performances des systèmes et d’assurer la stabilité des environnements de production.
Services à fournir
- Concevoir, mettre en œuvre, maintenir et soutenir des systèmes et applications basés sur Linux à haute disponibilité.
- Automatiser les processus de provisionnement, de configuration, de déploiement, de surveillance et d’exploitation à l’aide de scripts et d’outils DevOps.
- Soutenir les pipelines CI/CD et intégrer des pratiques de test et de déploiement automatisés.
- Surveiller la disponibilité, les performances, la capacité et la fiabilité des systèmes dans les environnements de production.
- Résoudre des problèmes complexes liés à l’infrastructure, aux applications, aux réseaux et aux systèmes.
- Participer à la gestion des incidents, à la gestion des problèmes, à l’analyse des causes fondamentales et au rétablissement des services.
- Collaborer avec les équipes de développement et d’infrastructure afin d’améliorer la fiabilité des applications et l’efficacité opérationnelle.
- Mettre en œuvre des pratiques d’Infrastructure as Code et de gestion de configuration.
- Soutenir les environnements infonuagiques et sur site et contribuer aux initiatives de modernisation.
- Participer aux déploiements en production, aux activités de mise en production et aux processus de gestion des changements.
- Développer et maintenir la documentation technique, les procédures opérationnelles et les guides d’exploitation.
- Participer à une rotation de garde et fournir du soutien en production au besoin.
- Identifier les possibilités de réduire les activités opérationnelles manuelles grâce à l’automatisation et aux capacités libre-service.
- Plus de 5 ans d’expérience en DevOps, SRE, ingénierie des systèmes, ingénierie de l’infrastructure ou dans un domaine connexe.
- Solide expérience pratique avec les systèmes d’exploitation Linux/Unix, leur administration, leur dépannage et leur optimisation des performances.
- Solide expérience en scripting avec Python, Bash ou Shell.
- Expérience avec Git et les pratiques modernes de gestion de versions.
- Expérience pratique des outils et méthodologies CI/CD.
- Expérience avec Docker et/ou Kubernetes.
- Expérience avec les outils d’Infrastructure as Code tels que Terraform ou Ansible.
- Solide compréhension des concepts réseau, notamment TCP/IP, DNS, HTTP/HTTPS, équilibrage de charge, pare-feu et dépannage de connectivité.
- Expérience avec les solutions d’entreprise de surveillance, de journalisation, d’alerte et d’observabilité.
- Expérience avec des plateformes infonuagiques telles qu’AWS, Azure ou GCP.
- Solide compréhension des concepts de disponibilité, d’évolutivité, de résilience, de capacité et de reprise après sinistre.
- Expérience du soutien d’applications et d’infrastructures dans des environnements de production.
- Excellentes capacités d’analyse, de dépannage et de résolution de problèmes.
- Excellentes aptitudes en communication et en collaboration.
À propos du poste
- Administrer et soutenir les serveurs Linux et les applications d’entreprise dans les environnements de développement, de test et de production.
- Développer des automatisations pour le provisionnement, la configuration, les déploiements, la surveillance et les tâches opérationnelles.
- Développer et maintenir des pipelines CI/CD afin de permettre une livraison logicielle fiable et répétable.
- Collaborer avec les équipes applicatives afin d’identifier les risques liés à la fiabilité et de mettre en œuvre les mesures correctives appropriées.
- Analyser les incidents de production et effectuer des analyses détaillées des causes fondamentales.
- Développer des solutions de surveillance, d’alerte, des tableaux de bord et des indicateurs opérationnels afin d’améliorer l’observabilité des systèmes.
- Identifier les goulots d’étranglement et effectuer des analyses de performance et de capacité.
- Soutenir les mises en production et les changements d’infrastructure conformément aux processus établis de gestion des changements.
- Participer aux activités de reprise après sinistre, de résilience et de continuité des activités.
- Maintenir la documentation opérationnelle, les articles de connaissances et les guides d’exploitation.
- Collaborer avec des équipes technologiques mondiales et participer aux pratiques de livraison Agile.
Reference: WJ-291_10991314