Monitoring & Observability Operator
Enregistrez cette offre et organisez votre recherche
Créez un compte gratuit pour enregistrer des offres d'emploi, créer des alertes et revenir à cette liste depuis votre tableau de bord.
En continuant, vous acceptez nos Conditions d’utilisation & Politique de confidentialité.
Ce que vous ferez
Vous rejoindrez l'équipe monitoring et CMDB d'une organisation publique belge qui fournit des services IT aux administrations publiques. Votre rôle consiste à administrer, opérer et faire évoluer l'outillage de monitoring et d'observabilité, en assurant la visibilité sur l'infrastructure, les applications et les services métier.
Administration et opérations Zabbix
- Maîtriser l'environnement Zabbix : créer et maintenir les dashboards, network maps, triggers, items et templates
- Configurer et ajuster les seuils d'alerte (triggers) selon les besoins métier et techniques, y compris les user macros et dependent triggers pour réduire le bruit
- Créer et maintenir des templates de supervision réutilisables (items, macros, low-level discovery)
- Concevoir des items de type Zabbix Agent, SNMP, JMX, HTTP Agent et External Checks selon le cas d'usage
- Développer des scripts de découverte personnalisés (LLD) pour l'auto-découverte d'équipements et de services
- Diagnostiquer les faux positifs, alertes bruyantes et anomalies de collecte (proxy, pollers, timeouts) en collaboration avec les équipes techniques
- Assurer le suivi quotidien des alertes actives et leur qualification (incident réel versus bruit)
- Configurer et maintenir les intégrations Zabbix avec ServiceNow (création automatique d'incidents) et les outils de notification
- Administrer l'architecture Zabbix distribuée (proxies, serveurs, haute disponibilité) et assurer la performance
- Participer à l'évolution de l'architecture de supervision (proxies, intégrations SNMP v2/v3, VMware API, NetFlow, etc.)
- Réaliser des analyses de cause racine (RCA) sur des incidents complexes multi-couches (réseau, système, application, stockage) à la demande des équipes techniques
- Maîtriser le module Zabbix Services (Business Service Monitoring) : construire des arbres de services hiérarchiques, agréger les états (SLA/SLO) à partir des triggers, calculer et suivre les taux de disponibilité par service métier
- Modéliser les services applicatifs end-to-end en liant les composants techniques (hosts, triggers) aux services métier pertinents, pour une vue orientée utilisateur/métier plutôt que purement infrastructure
- Configurer les problem tags et les règles de propagation d'état pour un mapping précis entre incidents techniques et impact sur les services
- Utiliser les rapports SLA générés par le module Services pour alimenter le reporting mensuel et les revues de disponibilité
Surveillance web avec Oh Dear
- Mettre en place et maintenir la surveillance technique des sites web sur Oh Dear (disponibilité, certificats SSL, performance, uptime, broken links, mixed content)
- Configurer les alertes (email, webhooks, intégrations tierces) et vérifier quotidiennement le statut des sites surveillés
- Utiliser l'API REST Oh Dear pour l'extraction de données et l'intégration avec les outils de reporting (Power BI est un plus)
- Suivre les incidents détectés et les escalader vers les équipes concernées, avec analyse d'impact
Gestion des incidents et tickets ServiceNow
- Vérifier quotidiennement les incidents créés dans ServiceNow liés au monitoring et assurer leur qualification technique
- Traiter toutes les demandes des équipes IT arrivant via le catalogue de demandes ServiceNow et par email
- Qualifier, prioriser (selon impact/urgence) et traiter les demandes liées au monitoring reçues via ServiceNow ou email
- Contribuer à la fiabilité de la CMDB en lien avec les processus de découverte (VMware, réseau) et la résolution des conflits d'identification
- Assurer un suivi rigoureux jusqu'à la clôture des tickets, avec documentation des actions menées
Observabilité
- Participer à l'amélioration continue de l'observabilité des services IT en combinant les informations issues du monitoring, des logs, des événements et des outils de supervision
- Contribuer à la définition et à l'évolution des indicateurs de santé, disponibilité et performance des services métier
- Corréler alertes, métriques, événements et données techniques pour faciliter l'identification rapide des causes d'incidents
- Participer à la réduction du bruit opérationnel en améliorant les règles de supervision, les seuils d'alerte et les mécanismes de corrélation
- Collaborer avec les équipes infrastructure, réseau, application et intégration pour améliorer la visibilité end-to-end des services critiques
Reporting
- Identifier les incidents récurrents et les tendances observées via les outils de monitoring et les rapports opérationnels
- Produire un rapport de monitoring mensuel (disponibilité, incidents, tendances, actions correctives, KPI/SLA) pour les parties prenantes et la dir