About the job Operateur Monitoring & Observabilité
1. Présentation de l’ETNIC
L’ETNIC (Entreprise pour les Technologies de l’Information et de la Communication) est l’opérateur informatique de la Fédération Wallonie-Bruxelles. Organisme d’intérêt public, l’ETNIC a pour mission de concevoir, développer, maintenir et faire évoluer les systèmes d’information et les infrastructures technologiques au service des administrations et établissements de la FWB.
Acteur central de la transformation numérique du secteur public francophone belge, l’ETNIC intervient dans des domaines variés tels que :
- La gestion des infrastructures IT (réseaux, sécurité, data centers, cloud),
- Le développement d’applications métiers sur mesure,
- L’accompagnement des projets digitaux (analyse fonctionnelle, UX/UI, gestion de projet),
- La cybersécurité et la protection des données,
- Le support utilisateurs et la formation.
Dans un souci constant d’innovation, de performance et de service public, l’ETNIC collabore régulièrement avec des partenaires externes pour renforcer ses équipes à travers des missions de consultance IT. Ces collaborations s’inscrivent dans un cadre éthique, professionnel et orienté vers la qualité et l’impact concret des solutions livrées.
2. Mission
Zabbix - Administration et exploitation
- Maîtriser l'ensemble de l'environnement Zabbix : création et maintenance de dashboards, maps réseau, triggers, items et templates● Configurer et ajuster les seuils d'alerte (triggers) selon les besoins métier et techniques, y compris via macros utilisateur et triggers dépendants pour limiter le bruit
- Créer et maintenir des templates de supervision réutilisables (items, macros, LLD, low-level discovery)
- Concevoir et maintenir des items de type Zabbix Agent, SNMP, JMX, HTTP Agent et External Checks selon les cas d'usage
- Développer des scripts de discovery personnalisés (LLD) pour l'auto-découverte d'équipements et de services
- Diagnostiquer les faux positifs, alertes bruyantes et anomalies de collecte (proxy, pollers, timeouts) en encore avec les équipes techniques sous la supervision du responsable
- Assurer le suivi quotidien des alertes actives et leur qualification (incident réel vs bruit)
- Configurer et maintenir les intégrations Zabbix ↔ ServiceNow (remontée automatique d'incidents) et Zabbix ↔ outils de notification
- Administrer l'architecture Zabbix distribuée (proxies, serveurs, haute disponibilité) et en assurer la performance
- Participer à l'évolution de l'architecture de supervision (proxies, intégrations SNMP v2/v3, API VMware, NetFlow, etc.)
- Réaliser des analyses de causes racines (RCA) sur des incidents complexes multi-couches (réseau, système, application, stockage) à la demande des équipes techniques
- Maîtriser le module Services de Zabbix (Business Service Monitoring) : construction d'arbres de services hiérarchiques, agrégation d'états (SLA/SLO) à partir des triggers, calcul et suivi du taux de disponibilité par service métier
- Modéliser des services applicatifs de bout en bout en associant les composants techniques (hosts, triggers) aux services métier concernés, pour une vision orientée utilisateur/business plutôt que purement infrastructure
- Configurer les problem tags et les règles de propagation d'état pour un mapping fidèle entre incidents techniques et impact sur les services
- Exploiter les rapports de SLA générés par le module Services pour alimenter le reporting mensuel et les revues de disponibilité
Oh Dear - Surveillance des sites web
- Mettre en place et maintenir la surveillance technique des sites web sur Oh Dear (disponibilité, certificats SSL, performance, uptime, broken links, mixed content)
- Configurer les alertes (email, webhooks, intégrations tierces) et vérifier quotidiennement l'état des sites supervisés
- Exploiter l'API REST d'Oh Dear pour l'extraction de données et l'intégration avec les outils de reporting (Power BI, un plus)
- Assurer le suivi des incidents détectés et leur remontée aux équipes concernées, avec analyse d'impact
ServiceNow - Gestion des tickets et incidents
- Vérifier quotidiennement les incidents créés dans ServiceNow liés au monitoring et en assurer la qualification technique
- Prendre en charge l'ensemble des demandes des équipes IT arrivant via notre catalogue de demande dans ServiceNow et par email
- Qualifier, prioriser (selon impact/urgence) et traiter les demandes liées au monitoring reçues via ServiceNow ou par email
- Contribuer à la fiabilité de la CMDB en lien avec les processus de découverte (VMware, réseau) et la résolution des conflits d'identification
- Assurer un suivi rigoureux jusqu'à la clôture des tickets, avec documentation des actions menées
Observabilité
- Participer à l'amélioration continue de l'observabilité des services IT en combinant les informations issues du monitoring, des logs, des événements et des outils de supervision.
- Contribuer à la définition et à l'évolution des indicateurs de santé, de disponibilité et de performance des services métiers.
- Corréler les alertes, métriques, événements et données techniques afin de faciliter l'identification rapide des causes d'incidents.
- Participer à la réduction du bruit opérationnel par l'amélioration des règles de supervision, des seuils d'alerte et des mécanismes de corrélation.
- Collaborer avec les équipes infrastructure, réseau, applications et intégration afin d'améliorer la visibilité de bout en bout des services critiques.
Reporting
- Identifier les incidents récurrents et tendances observées au travers des outils de monitoring et des rapports d'exploitation.
- Produire un rapport mensuel de monitoring (disponibilité, incidents, tendances, actions correctives, KPI/SLA) pour les bénéficiaires et le management et à la demande
- Automatiser la production des rapports via scripts et API (Zabbix API, Oh Dear API, ServiceNow API) pour fiabiliser et accélérer le reporting
- Construire et maintenir des tableaux de bord de pilotage (Power BI, un plus, ou équivalent) pour le management et les équipes techniques si besoin.
Réseau, API & Automatisation
- Diagnostiquer les incidents de connectivité et de collecte (SNMP, syslog, NetFlow, routage, ACL, VLAN, pare-feu)
- Développer et maintenir des scripts d'automatisation (Python/Bash) pour les checks de supervision, les LLD discovery scripts et le traitement de données (ex.
export/traitement CSV/Excel)
- Consommer et intégrer des API REST entre les différents outils de l'écosystème (Zabbix, ServiceNow, Oh Dear, Power BI si nécessaire)
- Contribuer à l'intégration applicative entre les systèmes (flux de données, formats JSON/XML) pour fiabiliser la chaîne de supervision de bout en bout
- Documenter les procédures techniques et diagnostics (schémas, guides opérationnels)
Culture DevOps
- Appliquer les bonnes pratiques CI/CD pour le versioning et le déploiement des configurations de supervision (templates, dashboards)
- Utiliser Git pour la gestion de versions des scripts et configurations
- Contribuer à l'automatisation de l'infrastructure de supervision via des approches Infrastructure as Code (Ansible, Terraform)
- Participer à la conteneurisation d'outils de supervision (Docker) le cas échéant
- Maintenir la documentation technique et opérationnelle (wiki) ainsi que les articles de la knowledge base (KB).
- Assurer le transfert de connaissances vers les équipes support et exploitation.
En tant que consultant, vous êtes soumis aux mêmes conditions de travail que notre personnel interne, soit un mode hybride alliant présentiel et télétravail, avec un minimum obligatoire de 50 % de présence dans nos bureaux.
La mission est en français exclusivement.
3. Activités
Assurer l’administration, l’exploitation et l’évolution des outils de monitoring et d’observabilité, sous la supervision du responsable Monitoring & CMDB. Les activités comprennent :
- Administrer Zabbix : création et maintenance des dashboards, maps réseau, items, triggers et templates, automatisation de la découverte et optimisation de l’architecture de supervision.
- Modéliser et superviser les services métier et applicatifs de bout en bout, notamment via le module Services de Zabbix, afin d’évaluer l’impact des incidents et de suivre la disponibilité et les engagements SLA/SLO.
- Assurer la surveillance des sites web avec Oh Dear : disponibilité, certificats SSL, performance et anomalies.
- Qualifier et traiter les alertes, incidents et demandes de monitoring dans ServiceNow, assurer leur suivi jusqu’à la clôture et contribuer à la fiabilité de la CMDB.
- Améliorer l’observabilité en corrélant métriques, logs et événements, en réduisant les alertes inutiles et en contribuant au diagnostic des incidents avec les équipes techniques.
- Développer les intégrations entre outils et automatiser les contrôles, la collecte de données et le reporting à l’aide d’API REST et de scripts Python/Bash.
- Produire les rapports de disponibilité et de performance, analyser les incidents récurrents et maintenir les tableaux de bord de pilotage.
- Appliquer les pratiques Git, CI/CD et Infrastructure as Code, maintenir la documentation technique et assurer le transfert de connaissances aux équipes support et exploitation.
Duration: 15/10/2026 - 13/12/2028 26 months • (full time)
Skills required:
- API : consommation et intégration d'API REST (authentification, tokens/Bearer, pagination, webhooks) pour interconnecter les outils de supervision - Level: Confirmed - Most recent: 1 to 3 years ago
- Automatisation des workflows de supervision (auto-remédiation, génération automatique de rapports, intégrations API entre outils) - Level: Nice to have - Most recent: Any time
- Elasticsearch (maîtrise requise, indexation, requêtes, exploitation des données de logs/métriques) - Level: Confirmed - Most recent: 1 to 3 years ago
- ESB / intégration applicative : bonne compréhension des architectures d'intégration orientées services et des mécanismes d'échange de données (API REST, webhooks, JSON/XML, bus d'intégration). - Level: Confirmed - Most recent: 1 to 3 years ago
- Oh Dear ou outil de surveillance web équivalent - Level: Nice to have - Most recent: Any time
- réseau : solide maîtrise des protocoles et architectures (SNMP v2/v3, syslog, NetFlow, TCP/IP, routage, VLAN, pare-feu) ; capacité à diagnostiquer des problèmes de connectivité et de collecte (ACL, ACI, SD-WAN, VPN) - Level: Confirmed - Most recent: 1 to 3 years ago
- Scripting & Automation : maîtrise de Python et/ou Bash pour l'automatisation de checks, de rapports et de tâches récurrentes ; capacité à écrire des scripts de diagnostic et des LLD discovery scripts - Level: Confirmed - Most recent: 1 to 3 years ago
- ServiceNow (gestion de tickets/incidents, idéalement notion de CMDB) - Level: Confirmed - Most recent: 1 to 3 years ago
- Zabbix (dashboards, maps, triggers, templates, LLD, macros, items) - Level: Expert - Most recent: More than 3 years ago
Language requirements:
Dutch
Level Passive knowledge
English
Level Nice to have
French
Level Native