Pré-requis : Maîtriser Kubernetes et ses ressources courantes - Savoir utiliser PromQL, Grafana et des règles d'alerte - Comprendre les métriques, logs, traces et le rôle d'OpenTelemetry - Disposer d'une expérience d'exploitation de workloads Kubernetes - Pratiquer Linux, kubectl, YAML et un gestionnaire de versions
Objectifs : Concevoir une architecture d'observabilité Kubernetes adaptée à la production - Justifier les choix de disponibilité, stockage, rétention et domaines de panne - Maîtriser la cardinalité, la capacité, les coûts, le filtrage et l'échantillonnage - Sécuriser les accès et les flux de télémétrie - Industrialiser les dashboards, règles et configurations sous forme de code - Construire un alerting actionnable avec routage, inhibition et silences - Définir des SLI, des SLO et un budget d'erreur - Rédiger un runbook et conduire un diagnostic d'incident - Identifier les défaillances de la plateforme d'observabilité elle-même
Sanction : Attestation de fin de formation mentionnant le résultat des acquis
Référence : OUT103079-F
Accessibilité : Si vous êtes en situation de handicap, nous sommes en mesure de vous accueillir, n'hésitez pas à nous contacter à referenthandicap@dawan.fr, nous étudierons ensemble vos besoins
Contact : commercial@dawan.fr
2 475,00 € HT
1 980,00 € HT
Cartographier les composants, les flux et les dépendances de la plateforme
Définir les exigences de disponibilité, de rétention et de restauration
Identifier les domaines de panne et les points uniques de défaillance
Arbitrer entre simplicité, résilience, performance et coût
Atelier fil rouge : analyser une architecture existante et formaliser les exigences d'une cible de production
Mesurer les volumes de métriques, logs et traces
Repérer la cardinalité excessive et ses principales sources
Choisir les politiques de filtrage, d'agrégation et de rétention
Définir une stratégie d'échantillonnage des traces
Estimer les besoins de capacité et suivre les coûts
Atelier fil rouge : mesurer l'empreinte de la stack et proposer un plan de réduction des volumes sans perdre les signaux critiques
Comparer Prometheus en haute disponibilité, Thanos et Grafana Mimir
Évaluer les besoins multi-cluster et multi-tenant
Exploiter remote_write et le stockage objet
Prévoir la réplication, la restauration et les tests de reprise
Surveiller la plateforme d'observabilité elle-même
Atelier fil rouge : sélectionner une architecture cible et justifier les choix de stockage et de résilience
Définir les rôles et les périmètres d'accès
Protéger les flux par authentification et chiffrement
Gérer les secrets nécessaires aux collecteurs et aux backends
Cloisonner les équipes, namespaces et tenants
Limiter l'exposition de données sensibles dans la télémétrie
Atelier fil rouge : appliquer un modèle d'accès et vérifier le cloisonnement d'une stack partagée
Versionner les dashboards, règles, alertes et configurations
Structurer les dépôts et les responsabilités de validation
Tester les règles et les configurations avant déploiement
Déployer les changements de manière contrôlée avec GitOps ou une chaîne CI/CD
Tracer les versions et organiser le retour arrière
Atelier fil rouge : modifier, tester et déployer une règle et un dashboard depuis un dépôt versionné
Transformer Golden Signals, RED et USE en signaux opérationnels
Configurer regroupement, routage, inhibition et silences dans Alertmanager
Réduire les faux positifs et le bruit d'alerte
Relier chaque alerte à un propriétaire et à une procédure d'action
Évaluer régulièrement l'efficacité des règles
Atelier fil rouge : traiter une tempête d'alertes et rendre le dispositif exploitable par l'équipe d'astreinte
Choisir des SLI centrés sur l'expérience du service
Définir des objectifs mesurables et leurs fenêtres d'observation
Calculer et interpréter un budget d'erreur
Utiliser le burn rate pour anticiper la violation d'un SLO
Relier les résultats aux décisions de changement et de capacité
Atelier fil rouge : définir le SLO du service, calculer son budget d'erreur et créer une alerte de consommation
Identifier une panne de collecte, de stockage, de requêtage ou de visualisation
Rédiger un runbook clair et testable
Conduire le diagnostic sans dépendre uniquement de la stack défaillante
Capitaliser les enseignements dans une feuille de route d'amélioration
Atelier fil rouge : résoudre un incident injecté, exécuter le runbook et défendre les priorités d'amélioration
Le délai d’accès à la formation certifiante est de 7 jours après validation du dossier. Pour un financement CPF, la validation doit être faite 11 jours ouvrés avant le début. Hors CPF, délai de 1 à 3 semaines selon les sessions.
Les évaluations en cours de formations sont réalisées par les ateliers de mise en pratique et les échanges avec les formateurs.
Pour suivre une session à distance depuis l'un de nos centres, contactez-nous.
Aucune date n’est actuellement planifiée pour cette formation. Nous pouvons toutefois organiser cette formation à la demande dans un format adapté à votre besoin, y compris dans votre entreprise.
Contactez-nous pour prévoir une session avec notre formulaire de contact ou par téléphone au 02/318.50.01