Monitoring & Observability Operator

Il y a 3 jours

Brussel Hoofdstad, Belgique HumanInTech Temps plein 61 000 € - 100 000 € Contrat

Ce que vous ferez

Vous rejoindrez l'équipe monitoring et CMDB d'une organisation publique belge qui fournit des services IT aux administrations publiques. Votre rôle consiste à administrer, opérer et faire évoluer l'outillage de monitoring et d'observabilité, en assurant la visibilité sur l'infrastructure, les applications et les services métier.

Administration et opérations Zabbix

  • Maîtriser l'environnement Zabbix : créer et maintenir les dashboards, network maps, triggers, items et templates
  • Configurer et ajuster les seuils d'alerte (triggers) selon les besoins métier et techniques, y compris les user macros et dependent triggers pour réduire le bruit
  • Créer et maintenir des templates de supervision réutilisables (items, macros, low-level discovery)
  • Concevoir des items de type Zabbix Agent, SNMP, JMX, HTTP Agent et External Checks selon le cas d'usage
  • Développer des scripts de découverte personnalisés (LLD) pour l'auto-découverte d'équipements et de services
  • Diagnostiquer les faux positifs, alertes bruyantes et anomalies de collecte (proxy, pollers, timeouts) en collaboration avec les équipes techniques
  • Assurer le suivi quotidien des alertes actives et leur qualification (incident réel versus bruit)
  • Configurer et maintenir les intégrations Zabbix avec ServiceNow (création automatique d'incidents) et les outils de notification
  • Administrer l'architecture Zabbix distribuée (proxies, serveurs, haute disponibilité) et assurer la performance
  • Participer à l'évolution de l'architecture de supervision (proxies, intégrations SNMP v2/v3, VMware API, NetFlow, etc.)
  • Réaliser des analyses de cause racine (RCA) sur des incidents complexes multi-couches (réseau, système, application, stockage) à la demande des équipes techniques
  • Maîtriser le module Zabbix Services (Business Service Monitoring) : construire des arbres de services hiérarchiques, agréger les états (SLA/SLO) à partir des triggers, calculer et suivre les taux de disponibilité par service métier
  • Modéliser les services applicatifs end-to-end en liant les composants techniques (hosts, triggers) aux services métier pertinents, pour une vue orientée utilisateur/métier plutôt que purement infrastructure
  • Configurer les problem tags et les règles de propagation d'état pour un mapping précis entre incidents techniques et impact sur les services
  • Utiliser les rapports SLA générés par le module Services pour alimenter le reporting mensuel et les revues de disponibilité

Surveillance web avec Oh Dear

  • Mettre en place et maintenir la surveillance technique des sites web sur Oh Dear (disponibilité, certificats SSL, performance, uptime, broken links, mixed content)
  • Configurer les alertes (email, webhooks, intégrations tierces) et vérifier quotidiennement le statut des sites surveillés
  • Utiliser l'API REST Oh Dear pour l'extraction de données et l'intégration avec les outils de reporting (Power BI est un plus)
  • Suivre les incidents détectés et les escalader vers les équipes concernées, avec analyse d'impact

Gestion des incidents et tickets ServiceNow

  • Vérifier quotidiennement les incidents créés dans ServiceNow liés au monitoring et assurer leur qualification technique
  • Traiter toutes les demandes des équipes IT arrivant via le catalogue de demandes ServiceNow et par email
  • Qualifier, prioriser (selon impact/urgence) et traiter les demandes liées au monitoring reçues via ServiceNow ou email
  • Contribuer à la fiabilité de la CMDB en lien avec les processus de découverte (VMware, réseau) et la résolution des conflits d'identification
  • Assurer un suivi rigoureux jusqu'à la clôture des tickets, avec documentation des actions menées

Observabilité

  • Participer à l'amélioration continue de l'observabilité des services IT en combinant les informations issues du monitoring, des logs, des événements et des outils de supervision
  • Contribuer à la définition et à l'évolution des indicateurs de santé, disponibilité et performance des services métier
  • Corréler alertes, métriques, événements et données techniques pour faciliter l'identification rapide des causes d'incidents
  • Participer à la réduction du bruit opérationnel en améliorant les règles de supervision, les seuils d'alerte et les mécanismes de corrélation
  • Collaborer avec les équipes infrastructure, réseau, application et intégration pour améliorer la visibilité end-to-end des services critiques

Reporting

  • Identifier les incidents récurrents et les tendances observées via les outils de monitoring et les rapports opérationnels
  • Produire un rapport de monitoring mensuel (disponibilité, incidents, tendances, actions correctives, KPI/SLA) pour les parties prenantes et la dir