Spécialiste Monitoring
Enregistrez cette offre et organisez votre recherche
Créez un compte gratuit pour enregistrer des offres d'emploi, créer des alertes et revenir à cette liste depuis votre tableau de bord.
En continuant, vous acceptez nos Conditions d’utilisation & Politique de confidentialité.
Présentation
Cette fonction s’inscrit dans un environnement IT orienté infrastructures, applications, cybersécurité, support aux utilisateurs et transformation digitale. Le rôle vise à assurer l’administration, l’exploitation et l’évolution des outils de monitoring et d’observabilité, dans un cadre structuré et collaboratif.
Mission
Vous prenez en charge l’exploitation quotidienne de la supervision et contribuez à l’amélioration continue de l’observabilité des services IT. Vous intervenez sur les outils, les intégrations, l’automatisation, le traitement des alertes ainsi que le reporting opérationnel.
Responsabilités
Zabbix - Administration et exploitation
- Administrer l’environnement Zabbix dans son ensemble : dashboards, cartes réseau, triggers, items, macros et templates.
- Configurer et ajuster les seuils d’alerte selon les besoins métier et techniques, y compris via macros utilisateur et triggers dépendants afin de réduire le bruit.
- Créer et maintenir des templates de supervision réutilisables, incluant items, macros et mécanismes de low-level discovery.
- Concevoir et maintenir des items de type Zabbix Agent, SNMP, JMX, HTTP Agent et External Checks selon les cas d’usage.
- Développer des scripts de discovery personnalisés pour l’auto-découverte d’équipements et de services.
- Diagnostiquer les faux positifs, les alertes bruyantes et les anomalies de collecte liées notamment aux proxies, pollers et timeouts.
- Assurer le suivi quotidien des alertes actives et leur qualification.
- Configurer et maintenir les intégrations entre Zabbix, ServiceNow et les outils de notification.
- Administrer une architecture Zabbix distribuée, incluant proxies, serveurs et mécanismes de haute disponibilité, et en garantir la performance.
- Participer à l’évolution de l’architecture de supervision, notamment autour de SNMP v2/v3, des API VMware et de NetFlow.
- Réaliser des analyses de causes racines sur des incidents complexes touchant plusieurs couches techniques.
- Exploiter le module Services de Zabbix pour construire des arbres de services hiérarchiques, agréger les états SLA/SLO et suivre la disponibilité des services métier.
- Modéliser les services applicatifs de bout en bout en reliant les composants techniques aux services métier pour une vision orientée utilisateur.
- Configurer les problem tags et les règles de propagation d’état afin de refléter fidèlement l’impact des incidents techniques sur les services.
- Utiliser les rapports SLA du module Services pour alimenter le reporting mensuel et les revues de disponibilité.
Surveillance web
- Mettre en place et maintenir la supervision technique des sites web avec Oh Dear ou un outil équivalent.
- Surveiller la disponibilité, les certificats SSL, la performance, l’uptime, les liens brisés et le mixed content.
- Configurer les alertes par e-mail, webhooks ou intégrations tierces et contrôler quotidiennement l’état des sites supervisés.
- Exploiter l’API REST de l’outil pour l’extraction des données et l’intégration avec des solutions de reporting.
- Assurer le suivi des incidents détectés, leur escalade vers les équipes concernées et l’analyse de leur impact.
ServiceNow - Incidents et demandes
- Vérifier chaque jour les incidents liés au monitoring créés dans ServiceNow et en assurer la qualification technique.
- Prendre en charge les demandes des équipes IT reçues via le catalogue de services ou par e-mail.
- Qualifier, prioriser et traiter les demandes de monitoring selon leur impact et leur urgence.
- Contribuer à la fiabilité de la CMDB en lien avec les processus de découverte et la résolution des conflits d’identification.
- Assurer un suivi rigoureux jusqu’à la clôture des tickets et documenter les actions réalisées.
Observabilité et amélioration continue
- Améliorer l’observabilité des services IT en croisant les données de monitoring, logs, métriques et événements.
- Contribuer à la définition et à l’évolution des indicateurs de santé, de disponibilité et de performance.
- Corréler alertes, métriques, événements et données techniques pour accélérer l’identification des causes d’incidents.
- Réduire le bruit opérationnel en optimisant les règles de supervision, les seuils d’alerte et les mécanismes de corrélation.
- Collaborer avec les équipes infrastructure, réseau, applications et intégration pour renforcer la visibilité de bout en bout des services critiques.
- Exploiter Elasticsearch pour l’indexation, les requêtes et l’analyse des logs et métriques.
Reporting, API et automatisation
- Identifier les incidents récurrents et les tendances observées à travers les outils de monitoring et les rapports d’explo