DevOps & Site reliability Engineer
TMC Canada
Full Job Description
• *Note: French version below / La version française se trouve ci-dessous**
About the Role
Join the Operations Technology team to design, automate, deploy, and support reliable application platforms and CI/CD capabilities. You'll work closely with development, infrastructure, network, security, and production support teams to improve software delivery, platform stability, and operational resilience. The role requires strong hands-on experience with Kubernetes, Docker/Podman, Linux, CI/CD pipelines, GitHub, Python, and shell scripting, along with a solid grasp of modern DevOps and SRE practices. The ideal candidate is passionate about automation and reliability, and thrives on troubleshooting complex issues and driving continuous improvement.
Key Responsibilities
• Design, build, and maintain CI/CD pipelines and supporting deployment infrastructure
• Develop automated deployment solutions for Kubernetes and containerized environments, including Helm charts and YAML configurations
• Partner with development teams to improve build, test, and release processes
• Support deployments, configuration changes, and platform upgrades across environments
• Develop automation using Python and Linux shell scripting
• Manage GitHub repositories, branching strategies, and pull-request workflows
• Integrate automated testing, security scanning, and code-quality checks into CI/CD pipelines
• Troubleshoot application, container, Kubernetes, and network issues; investigate production incidents and implement corrective solutions
• Apply SRE principles to improve reliability, availability, and observability
• Define monitoring, alerting, and operational metrics
• Collaborate with infrastructure, network, database, security, and application teams
• Maintain technical documentation, runbooks, and troubleshooting guides
• Participate in design reviews, incident reviews, and an after-hours on-call rotation when required
Required Skills
• 5+ years of relevant experience in DevOps, SRE, platform, or infrastructure engineering
• Strong hands-on experience with Kubernetes (deployment, scaling, services, ingress, secrets)
• Strong experience with Docker/Podman and containerized environments
• Strong Linux/UNIX administration and shell scripting (Bash or KornShell)
• Hands-on automation experience with Python
• Strong understanding of CI/CD concepts and deployment strategies, with hands-on experience using tools like Jenkins and Artifactory
• Experience with Git/GitHub, including branching and release workflows
• Experience with YAML, Ansible, or equivalent automation frameworks
• Strong networking knowledge (DNS, TCP/IP, HTTP/HTTPS, TLS, proxies, load balancing)
• Understanding of SRE practices: monitoring, incident response, root-cause analysis
• Experience in Agile environments using tools like Jira
• Strong communication skills and ability to collaborate with globally distributed teams
• Ability to manage multiple priorities with limited supervision and participate in on-call rotation
_________________________
Ingénieur(e) DevOps, Kubernetes et fiabilité des systèmes (SRE)
À propos du poste
Rejoignez l'équipe Operations Technology pour concevoir, automatiser, déployer et soutenir des plateformes applicatives fiables ainsi que des capacités CI/CD. Vous collaborerez étroitement avec les équipes de développement, d'infrastructure, de réseau, de sécurité et de soutien à la production afin d'améliorer la livraison logicielle, la stabilité des plateformes et la résilience opérationnelle. Le rôle exige une solide expérience pratique avec Kubernetes, Docker/Podman, Linux, les pipelines CI/CD, GitHub, Python et le scripting shell, ainsi qu'une bonne compréhension des pratiques DevOps et SRE modernes. Le/la candidat(e) idéal(e) est passionné(e) par l'automatisation et la fiabilité, et aime résoudre des problèmes complexes tout en favorisant l'amélioration continue.
Principales responsabilités
• Concevoir, construire et maintenir les pipelines CI/CD et l'infrastructure de déploiement
• Développer des solutions de déploiement automatisées pour Kubernetes et les environnements conteneurisés, incluant les Helm charts et configurations YAML
• Collaborer avec les équipes de développement pour améliorer les processus de build, test et livraison
• Soutenir les déploiements, changements de configuration et mises à niveau de plateforme
• Développer de l'automatisation avec Python et le scripting shell Linux
• Gérer les dépôts GitHub, les stratégies de branchement et les flux de pull requests
• Intégrer les tests automatisés, l'analyse de sécurité et les contrôles de qualité de code dans les pipelines CI/CD
• Dépanner les problèmes applicatifs, de conteneurs, Kubernetes et réseau; investiguer les incidents de production et mettre en œuvre des solutions correctives
• Appliquer les principes SRE pour améliorer la fiabilité, la disponibilité et l'observabilité
• Définir la surveillance, les alertes et les métriques opérationnelles
• Collaborer avec les équipes d'infrastructure, réseau, base de données, sécurité et applications
• Maintenir la documentation technique, les runbooks et les guides de dépannage
• Participer aux revues de conception, revues d'incidents et à la rotation de garde après les heures, au besoin
Compétences requises
• 5 ans et plus d'expérience pertinente en DevOps, SRE, ingénierie de plateforme ou d'infrastructure
• Solide expérience pratique avec Kubernetes (déploiement, mise à l'échelle, services, ingress, secrets)
• Solide expérience avec Docker/Podman et les environnements conteneurisés
• Solides compétences en administration Linux/UNIX et en scripting shell (Bash ou KornShell)
• Expérience pratique en automatisation avec Python
• Solide compréhension des concepts CI/CD et des stratégies de déploiement, avec expérience pratique d'outils comme Jenkins et Artifactory
• Expérience avec Git/GitHub, incluant les stratégies de branchement et de livraison
• Expérience avec YAML, Ansible ou frameworks d'automatisation équivalents
• Solides connaissances réseau (DNS, TCP/IP, HTTP/HTTPS, TLS, proxys, équilibrage de charge)
• Compréhension des pratiques SRE : surveillance, réponse aux incidents, analyse des causes profondes
• Expérience en environnement Agile avec des outils comme Jira
• Solides compétences en communication et capacité à collaborer avec des équipes réparties mondialement
• Capacité à gérer plusieurs priorités avec supervision limitée et à participer à la rotation de garde


