NeverHard

Manager, Platform & Site Reliability at CIRA — NeverHard

Manager, Platform & Site Reliability at CIRA in Ottawa, Ottawa region. Skills: Cybersecurity, Leadership, Operational Excellence, Platform Engineering, Reliability. Apply on NeverHard.

Company
CIRA
Location
Ottawa, Ottawa region
Type
full_time

Required skills:

Job DescriptionJob Description:\n\nJoin the team that is building a trusted internet for Canadians! CIRA may be best known for managing the .CA domain but our impact reaches far beyond that. We’re at the forefront of advancing cybersecurity technologies and leading projects that improve the digital experience for users across Canada and the world. Our broad scope of activities is driven by one central goal: to strengthen and secure Canada’s digital landscape. \n\nBy working with the CIRA registry team, you’ll play a part in advancing the CIRA Registry Platform, which supports a wide range of domains globally. Help us drive innovation and maintain the high standards of stability and security that our platform is known for. Join us in advancing digital identity and technology in Canada and beyond. \n\nWho you are: \n\nYou are a people-first technology leader who thrives at the intersection of reliability, platform engineering, and operational excellence. You enjoy building high-performing teams, creating clarity in complex environments, and empowering engineers to do their best work. You balance strategic thinking with technical depth, helping teams deliver resilient, scalable services while continuously improving processes, tooling, and ways of working. Most importantly, you're motivated by solving meaningful challenges and contributing to infrastructure that Canadians and organizations around the world rely on every day. \n\nWhat you'll do: \n\nLead, coach, and develop a high-performing team of SRE and Platform Specialists responsible for the reliability, scalability, security, and operational excellence of CIRA's registry platforms and supporting technology services.\nDefine and execute the platform and site reliability strategy, aligning priorities and investments with organizational objectives and customer needs.\nDefine and mature SRE practices, including Service Level Objectives (SLOs), Service Level Indicators (SLIs), error budgets, production readiness standards, and operational acceptance criteria for mission-critical registry services.\nDrive the design, operation, and continuous improvement of scalable, resilient, cloud-native platforms using public cloud technologies such as AWS.\nChampion automation, infrastructure as code, GitOps, CI/CD, and self-service platform capabilities to reduce manual effort, operational toil, and engineering bottlenecks.\nEstablish and continuously improve observability, monitoring, alerting, and dashboarding practices to provide clear visibility into platform health, service reliability, and customer-impacting issues.\nLead incident management for high-severity events, providing incident command, stakeholder communication, root cause analysis, and driving follow-up actions that strengthen long-term platform resilience.\nCollaborate with engineering, security, support, compliance, and business stakeholders to establish priorities, balance risk, and deliver platform improvements that support registry operations and organizational goals.\nDrive performance engineering, capacity planning, disaster recovery testing, and resilience validation to ensure the ongoing reliability and availability of critical registry platforms and related services.\nFoster a culture of ownership, accountability, continuous learning, operational excellence, and psychological safety that empowers the team to innovate and perform at their best. \n\n \nWhat you bring: \n \n\n7+ years of progressive experience in Site Reliability Engineering (SRE), platform engineering, DevOps, infrastructure, or cloud operations, including hands-on experience with public cloud platforms such as AWS.\n3+ years of experience leading, coaching, and developing technical teams in SRE, platform engineering, DevOps, infrastructure, or cloud operations.\nDemonstrated success building and developing high-performing engineering teams through mentoring, coaching, performance management, and fostering a culture of continuous learning and accountability.\nExperience defining technical strategy, influencing cross-functional stakeholders, and balancing reliability, security, operational excellence, and business priorities.\nStrong hands-on background with public cloud platforms, preferably AWS, including cloud-native architecture, networking, security, resilience, scalability, and cost-aware operations.\nExperience leading teams that implement and operate infrastructure as code (IaC), GitOps, and automation practices to manage cloud infrastructure, platform services, and deployment workflows.\nStrong understanding of CI/CD principles, release automation, and modern software delivery practices.\nExperience with containerization and orchestration technologies such as Docker and Kubernetes.\nExperience with observability platforms, monitoring frameworks, incident management practices, and operational analytics tools.\nDemonstrated experience defining and implementing SLOs, SLIs, error budgets, production readiness standards, and incident response processes.\nStrong understanding of disaster recovery, business continuity, backup and recovery strategies, and resilience testing.\nExperience supporting highly available, mission-critical, or regulated technology platforms where reliability, security, and operational discipline are essential.\nExceptional communication, collaboration, and stakeholder management skills, with the ability to translate complex technical concepts into clear business outcomes for both technical and non-technical audiences. \n\n \nWho we are: \n\nAt CIRA, we’re driven by a passion to make a positive impact on Canada’s digital future. We’re not just asking, ‘What more can we do?’—we’re actively exploring new frontiers to enhance and secure the internet for all Canadians. Our recognition as one of the National Capital Region’s Top Employers for ten years is a testament to our vibrant culture. We believe in fostering an environment where collaboration and candour are second nature and where diverse perspectives are integral to our success, because we know that great ideas come from everywhere. If you’re passionate about innovation and ready to make a difference in a dynamic field, join us and help shape the future of the internet! \n\nCIRA embraces a blend of remote and IRL in-office work to keep our team connected and engaged. Our Ottawa headquarters is a hub for regular events and social activities that bring our team together, encouraging a strong sense of community within our organization. No matter where you work from, you'll always feel part of our vibrant team and our shared mission. \n At CIRA, people remain at the centre of our recruitment process. While CIRA uses recruitment platforms that include artificial intelligence-enabled features, which may be used to support administrative processes or skills-based assessments, these features are intended to assist our recruitment activities and do not replace human judgment. All applicant screenings, interviews, evaluations and selection decisions are conducted by our staff. Artificial intelligence is not used to make autonomous or final hiring decisions. \n\nThis posting is for an existing vacancy. CIRA is committed to fair, inclusive and accessible recruitment practices. Accommodations are available upon request throughout the recruitment, assessment and selection process. If you require any assistance or accommodation, please contact us at peopleandculture@cira.ca.\n\n*******************\n\nJoignez-vous à l’équipe qui bâtit un Internet fiable pour la population canadienne! CIRA est peut-être mieux connue pour sa gestion du domaine .CA, mais son impact ne s’arrête pas là. Nous sommes à l’avant-garde des technologies de cybersécurité et des projets de pointe qui améliorent l’expérience numérique pour les utilisateur·rices partout au Canada et à travers le monde. Notre large éventail d’activités est guidé par un objectif central : renforcer et sécuriser le paysage numérique du Canada.\n\nEn travaillant avec l’équipe du registre de CIRA, vous contribuerez à faire progresser la plateforme de registre de CIRA, qui appuie une vaste gamme de domaines à l’échelle mondiale. Aidez-nous à favoriser l’innovation et à maintenir les normes élevées de stabilité et de sécurité qui font la réputation de notre plateforme. Joignez-vous à nous pour faire progresser l’identité et la technologie numériques au Canada et au-delà de nos frontières.\n\nVotre profil : \n\nVous êtes un·e chef·fe de file du domaine des technologies pour qui les personnes passent avant tout, et qui s’épanouit là où convergent la fiabilité, l’ingénierie des plateformes et l’excellence opérationnelle. Vous aimez construire des équipes hautement performantes, apporter de la clarté aux environnements complexes et donner aux ingénieur·es les moyens de travailler au meilleur de leurs capacités. Vous savez trouver le juste équilibre entre la réflexion stratégique et la profondeur technique. Vous aidez les équipes à fournir des services résilients et évolutifs tout en améliorant continuellement les processus, l’outillage et les méthodes de travail. Et surtout, vous êtes motivé à résoudre des défis significatifs et à contribuer à l’infrastructure sur laquelle la population canadienne et des organisations du monde entier comptent chaque jour.\n\nVos tâches :\n\nDiriger, encadrer et développer une équipe hautement performante de spécialistes de l’ingénierie de la fiabilité des sites et de spécialistes des plateformes, responsables de la fiabilité, de l’évolutivité, de la sécurité et de l’excellence opérationnelle des plateformes de registre de CIRA et des services technologiques qui les soutiennent.\nDéfinir et mettre en œuvre la stratégie de fiabilité de la plateforme et des sites, en alignant les priorités et les investissements sur les objectifs organisationnels et les besoins des client·es.\nDéfinir et faire évoluer les pratiques d’ingénierie de la fiabilité des sites, y compris les objectifs de niveau de service (ONS), les indicateurs de niveau de service, la pondération des erreurs, les normes de préparation à la production et les critères d’acceptation opérationnelle pour la plateforme d’enregistrement essentielle à la mission.\nDiriger la conception, l’exploitation et l’amélioration continue des plateformes évolutives, résilientes et infonuagiques natives en faisant appel à des technologies infonuagiques publiques comme AWS.\nPromouvoir l’automatisation, l’infrastructure en tant que code, GitOps, l’intégration continue/le déploiement continu et les capacités de plateforme libre-service afin de réduire les efforts manuels, la charge opérationnelle et les goulots d’étranglement d’ingénierie.\nÉtablir et améliorer continuellement les pratiques d’observabilité, de surveillance, d’alerte et de compilation des informations sous forme de tableau de bord afin de fournir une visibilité claire sur la santé de la plateforme, la fiabilité du service et les problèmes ayant une incidence sur la clientèle.\nDiriger la gestion des incidents pour les événements de gravité élevée, en assurant le commandement d’incident, les communications avec les parties prenantes et l’analyse des causes profondes, ainsi qu’en pilotant des mesures de suivi qui renforcent la résilience à long terme de la plateforme.\nCollaborer avec les parties prenantes en matière d’ingénierie, de sécurité, d’assistance, de conformité et d’exploitation afin de définir les priorités, d’équilibrer les risques et d’apporter des améliorations à la plateforme de façon à soutenir les activités du registre et les objectifs organisationnels.\nFavoriser l’ingénierie du rendement, la planification de la capacité, les essais de reprise après sinistre et la validation de la résilience pour assurer la fiabilité et la disponibilité continues des plateformes de registre critiques et des services connexes.\nFavoriser une culture d’engagement, de responsabilité, d’apprentissage continu, d’excellence opérationnelle et de sécurité psychologique qui permet à l’équipe d’innover et de donner le meilleur d’elle-même.\n\n \nVos antécédents :\n\nAu moins sept ans d’expérience progressive en ingénierie de la fiabilité des sites, en ingénierie de plateforme, en développement et exploitation, en infrastructure ou en exploitation infonuagique, y compris une expérience pratique de plateformes infonuagiques publiques comme AWS.\nAu moins trois ans d’expérience à diriger, encadrer et développer des équipes techniques en ingénierie de la fiabilité des sites, en ingénierie des plateformes, en développement et exploitation, en infrastructure ou en exploitation infonuagique.\nSuccès avéré dans la création et le développement d’équipes d’ingénierie hautement performantes grâce au mentorat, à l’encadrement, à la gestion du rendement et à la promotion d’une culture de l’apprentissage et de la responsabilité continus.\nExpérience dans la définition de stratégies techniques, à influencer les intervenant·es interfonctionnel·les et à équilibrer la fiabilité, la sécurité, l’excellence opérationnelle et les priorités commerciales.\nSolide expérience pratique des plateformes infonuagiques publiques, de préférence AWS, y compris l’architecture infonuagique native, le réseautage, la sécurité, la résilience, l’évolutivité et les opérations sensibles aux coûts.\nExpérience en gestion d’équipes qui mettent en œuvre et exploitent l’infrastructure en tant que code (IaC), GitOps et des pratiques d’automatisation pour gérer l’infrastructure infonuagique, les services de plateforme et les flux de travail de déploiement.\nSolide compréhension des principes d’intégration continue/de déploiement continu, de l’automatisation des versions et des pratiques modernes de livraison de logiciels.\nExpérience des technologies de conteneurisation et d’orchestration comme Docker et Kubernetes.\nExpérience des plateformes d’observabilité, des cadres de surveillance, des pratiques de gestion des incidents et des outils d’analyse opérationnelle.\nExpérience avérée dans la définition et la mise en œuvre d’objectifs de niveau de service, d’indicateurs de niveau de service, de la pondération des erreurs, de normes de préparation à la production et de processus d’intervention en cas d’incident.\nSolide compréhension de la reprise après sinistre, de la continuité des activités, des stratégies de sauvegarde et de reprise et des essais de résilience.\nExpérience en soutien de plateformes technologiques hautement disponibles, essentielles à la mission ou réglementées où la fiabilité, la sécurité et la discipline opérationnelle sont essentielles.\nAptitudes exceptionnelles pour la communication, la collaboration et la gestion des intervenants, et capacité de traduire des concepts techniques complexes en résultats commerciaux compréhensibles pour les auditoires techniques et non techniques.\n\nÀ propos de nous :\n\nChez CIRA, nous sommes motivé·es par la passion d’avoir un impact positif sur l’avenir numérique du Canada. Nous ne nous contentons pas de demander : « Que pouvons-nous faire de plus? » Nous explorons activement de nouvelles fron