Job Openings Spécialiste Monitoring & Observabilité Zabbix (Employed or freelance)

About the job Spécialiste Monitoring & Observabilité Zabbix (Employed or freelance)

Présentation

Cette fonction s’inscrit dans un environnement IT orienté infrastructures, applications, cybersécurité, support aux utilisateurs et transformation digitale. Le rôle vise à assurer l’administration, l’exploitation et l’évolution des outils de monitoring et d’observabilité, dans un cadre structuré et collaboratif.

Mission

Vous prenez en charge l’exploitation quotidienne de la supervision et contribuez à l’amélioration continue de l’observabilité des services IT. Vous intervenez sur les outils, les intégrations, l’automatisation, le traitement des alertes ainsi que le reporting opérationnel.

Responsabilités

Zabbix - Administration et exploitation

  • Administrer l’environnement Zabbix dans son ensemble : dashboards, cartes réseau, triggers, items, macros et templates.
  • Configurer et ajuster les seuils d’alerte selon les besoins métier et techniques, y compris via macros utilisateur et triggers dépendants afin de réduire le bruit.
  • Créer et maintenir des templates de supervision réutilisables, incluant items, macros et mécanismes de low-level discovery.
  • Concevoir et maintenir des items de type Zabbix Agent, SNMP, JMX, HTTP Agent et External Checks selon les cas d’usage.
  • Développer des scripts de discovery personnalisés pour l’auto-découverte d’équipements et de services.
  • Diagnostiquer les faux positifs, les alertes bruyantes et les anomalies de collecte liées notamment aux proxies, pollers et timeouts.
  • Assurer le suivi quotidien des alertes actives et leur qualification.
  • Configurer et maintenir les intégrations entre Zabbix, ServiceNow et les outils de notification.
  • Administrer une architecture Zabbix distribuée, incluant proxies, serveurs et mécanismes de haute disponibilité, et en garantir la performance.
  • Participer à l’évolution de l’architecture de supervision, notamment autour de SNMP v2/v3, des API VMware et de NetFlow.
  • Réaliser des analyses de causes racines sur des incidents complexes touchant plusieurs couches techniques.
  • Exploiter le module Services de Zabbix pour construire des arbres de services hiérarchiques, agréger les états SLA/SLO et suivre la disponibilité des services métier.
  • Modéliser les services applicatifs de bout en bout en reliant les composants techniques aux services métier pour une vision orientée utilisateur.
  • Configurer les problem tags et les règles de propagation d’état afin de refléter fidèlement l’impact des incidents techniques sur les services.
  • Utiliser les rapports SLA du module Services pour alimenter le reporting mensuel et les revues de disponibilité.

Surveillance web

  • Mettre en place et maintenir la supervision technique des sites web avec Oh Dear ou un outil équivalent.
  • Surveiller la disponibilité, les certificats SSL, la performance, l’uptime, les liens brisés et le mixed content.
  • Configurer les alertes par e-mail, webhooks ou intégrations tierces et contrôler quotidiennement l’état des sites supervisés.
  • Exploiter l’API REST de l’outil pour l’extraction des données et l’intégration avec des solutions de reporting.
  • Assurer le suivi des incidents détectés, leur escalade vers les équipes concernées et l’analyse de leur impact.

ServiceNow - Incidents et demandes

  • Vérifier chaque jour les incidents liés au monitoring créés dans ServiceNow et en assurer la qualification technique.
  • Prendre en charge les demandes des équipes IT reçues via le catalogue de services ou par e-mail.
  • Qualifier, prioriser et traiter les demandes de monitoring selon leur impact et leur urgence.
  • Contribuer à la fiabilité de la CMDB en lien avec les processus de découverte et la résolution des conflits d’identification.
  • Assurer un suivi rigoureux jusqu’à la clôture des tickets et documenter les actions réalisées.

Observabilité et amélioration continue

  • Améliorer l’observabilité des services IT en croisant les données de monitoring, logs, métriques et événements.
  • Contribuer à la définition et à l’évolution des indicateurs de santé, de disponibilité et de performance.
  • Corréler alertes, métriques, événements et données techniques pour accélérer l’identification des causes d’incidents.
  • Réduire le bruit opérationnel en optimisant les règles de supervision, les seuils d’alerte et les mécanismes de corrélation.
  • Collaborer avec les équipes infrastructure, réseau, applications et intégration pour renforcer la visibilité de bout en bout des services critiques.
  • Exploiter Elasticsearch pour l’indexation, les requêtes et l’analyse des logs et métriques.

Reporting, API et automatisation

  • Identifier les incidents récurrents et les tendances observées à travers les outils de monitoring et les rapports d’exploitation.
  • Produire des rapports mensuels de disponibilité, d’incidents, de tendances, d’actions correctives et de KPI/SLA.
  • Automatiser la production des rapports au moyen de scripts et d’API telles que Zabbix API, ServiceNow API et l’API de l’outil de surveillance web.
  • Construire et maintenir des tableaux de bord de pilotage, notamment avec Power BI ou un outil équivalent.
  • Diagnostiquer les incidents de connectivité et de collecte liés à SNMP, syslog, NetFlow, TCP/IP, routage, ACL, VLAN, pare-feu, ACI, SD-WAN ou VPN.
  • Développer et maintenir des scripts Python et/ou Bash pour les checks de supervision, les scripts LLD, les diagnostics et le traitement de données, y compris CSV ou Excel.
  • Consommer et intégrer des API REST avec authentification, tokens/Bearer, pagination et webhooks entre les différents outils de l’écosystème.
  • Contribuer à l’intégration applicative entre systèmes via des échanges JSON/XML et une bonne compréhension des architectures orientées services et bus d’intégration.
  • Automatiser les workflows de supervision, y compris l’auto-remédiation, les intégrations entre outils et la génération automatique de rapports.
  • Documenter les procédures techniques, diagnostics, schémas et guides opérationnels.

Culture DevOps

  • Appliquer les bonnes pratiques CI/CD pour le versioning et le déploiement des configurations de supervision.
  • Utiliser Git pour la gestion de versions des scripts et configurations.
  • Contribuer à l’automatisation de l’infrastructure de supervision via des approches Infrastructure as Code telles qu’Ansible ou Terraform.
  • Participer, si nécessaire, à la conteneurisation d’outils de supervision avec Docker.
  • Maintenir la documentation technique et opérationnelle ainsi que la base de connaissances.
  • Assurer le transfert de connaissances vers les équipes support et exploitation.

📝 Votre profile

  • Expérience confirmée en administration système IT, avec une forte orientation monitoring et observabilité.
  • Excellente maîtrise de Zabbix, considéré comme une compétence centrale pour la fonction.
  • Bonne connaissance de ServiceNow pour la gestion des incidents et, idéalement, de la CMDB.
  • Expérience avec Oh Dear ou un outil équivalent de surveillance web.
  • Solide maîtrise des réseaux et protocoles associés : SNMP v2/v3, syslog, NetFlow, TCP/IP, routage, VLAN et pare-feu.
  • Capacité à diagnostiquer des problèmes de connectivité et de collecte dans des environnements complexes.
  • Maîtrise de Python et/ou Bash pour l’automatisation, les checks, les rapports et les scripts de diagnostic.
  • Expérience dans la consommation et l’intégration d’API REST, y compris l’authentification, les tokens/Bearer, la pagination et les webhooks.
  • Bonne compréhension de l’intégration applicative et des échanges de données en JSON/XML dans des architectures orientées services.
  • Maîtrise d’Elasticsearch pour l’exploitation des logs et métriques.
  • La connaissance de Power BI constitue un atout.
  • La fonction requiert le français. Le néerlandais et l’anglais font également partie des langues attendues.

Mode de travail hybride avec une présence minimale de 50 % sur site.

💼 Offre

Vous ferez partie d'une PME belge en pleine croissance, où l’initiative et le développement personnel sont encouragés. Nous vous offrirons un environnement de travail agréable, entouré(e) de collègues sympathiques. Ensemble, nous élaborerons un plan de carrière, avec une attention particulière et un budget dédié à la formation ou à la certification complémentaire. Vous pouvez compter sur un salaire attractif, complété par des avantages extra-légaux, y compris une voiture de société.
(Freelance est également possible)