Spécialiste Monitoring

Il y a 6 jours

Brussel, Brussel-Hoofdstad, Belgique EngiFlex Temps plein 60 000 € - 90 000 € Contrat

Présentation

Cette fonction s’inscrit dans un environnement IT orienté infrastructures, applications, cybersécurité, support aux utilisateurs et transformation digitale. Le rôle vise à assurer l’administration, l’exploitation et l’évolution des outils de monitoring et d’observabilité, dans un cadre structuré et collaboratif.

Mission

Vous prenez en charge l’exploitation quotidienne de la supervision et contribuez à l’amélioration continue de l’observabilité des services IT. Vous intervenez sur les outils, les intégrations, l’automatisation, le traitement des alertes ainsi que le reporting opérationnel.

Responsabilités

Zabbix - Administration et exploitation

  • Administrer l’environnement Zabbix dans son ensemble : dashboards, cartes réseau, triggers, items, macros et templates.
  • Configurer et ajuster les seuils d’alerte selon les besoins métier et techniques, y compris via macros utilisateur et triggers dépendants afin de réduire le bruit.
  • Créer et maintenir des templates de supervision réutilisables, incluant items, macros et mécanismes de low-level discovery.
  • Concevoir et maintenir des items de type Zabbix Agent, SNMP, JMX, HTTP Agent et External Checks selon les cas d’usage.
  • Développer des scripts de discovery personnalisés pour l’auto-découverte d’équipements et de services.
  • Diagnostiquer les faux positifs, les alertes bruyantes et les anomalies de collecte liées notamment aux proxies, pollers et timeouts.
  • Assurer le suivi quotidien des alertes actives et leur qualification.
  • Configurer et maintenir les intégrations entre Zabbix, ServiceNow et les outils de notification.
  • Administrer une architecture Zabbix distribuée, incluant proxies, serveurs et mécanismes de haute disponibilité, et en garantir la performance.
  • Participer à l’évolution de l’architecture de supervision, notamment autour de SNMP v2/v3, des API VMware et de NetFlow.
  • Réaliser des analyses de causes racines sur des incidents complexes touchant plusieurs couches techniques.
  • Exploiter le module Services de Zabbix pour construire des arbres de services hiérarchiques, agréger les états SLA/SLO et suivre la disponibilité des services métier.
  • Modéliser les services applicatifs de bout en bout en reliant les composants techniques aux services métier pour une vision orientée utilisateur.
  • Configurer les problem tags et les règles de propagation d’état afin de refléter fidèlement l’impact des incidents techniques sur les services.
  • Utiliser les rapports SLA du module Services pour alimenter le reporting mensuel et les revues de disponibilité.

Surveillance web

  • Mettre en place et maintenir la supervision technique des sites web avec Oh Dear ou un outil équivalent.
  • Surveiller la disponibilité, les certificats SSL, la performance, l’uptime, les liens brisés et le mixed content.
  • Configurer les alertes par e-mail, webhooks ou intégrations tierces et contrôler quotidiennement l’état des sites supervisés.
  • Exploiter l’API REST de l’outil pour l’extraction des données et l’intégration avec des solutions de reporting.
  • Assurer le suivi des incidents détectés, leur escalade vers les équipes concernées et l’analyse de leur impact.

ServiceNow - Incidents et demandes

  • Vérifier chaque jour les incidents liés au monitoring créés dans ServiceNow et en assurer la qualification technique.
  • Prendre en charge les demandes des équipes IT reçues via le catalogue de services ou par e-mail.
  • Qualifier, prioriser et traiter les demandes de monitoring selon leur impact et leur urgence.
  • Contribuer à la fiabilité de la CMDB en lien avec les processus de découverte et la résolution des conflits d’identification.
  • Assurer un suivi rigoureux jusqu’à la clôture des tickets et documenter les actions réalisées.

Observabilité et amélioration continue

  • Améliorer l’observabilité des services IT en croisant les données de monitoring, logs, métriques et événements.
  • Contribuer à la définition et à l’évolution des indicateurs de santé, de disponibilité et de performance.
  • Corréler alertes, métriques, événements et données techniques pour accélérer l’identification des causes d’incidents.
  • Réduire le bruit opérationnel en optimisant les règles de supervision, les seuils d’alerte et les mécanismes de corrélation.
  • Collaborer avec les équipes infrastructure, réseau, applications et intégration pour renforcer la visibilité de bout en bout des services critiques.
  • Exploiter Elasticsearch pour l’indexation, les requêtes et l’analyse des logs et métriques.

Reporting, API et automatisation

  • Identifier les incidents récurrents et les tendances observées à travers les outils de monitoring et les rapports