Vous êtes déjà client NinjaOne ? Connectez-vous pour consulter d'autres guides et les dernières nouvelles.

Endpoint Monitoring and Alerting Playbook

Rubrique

Ce guide fournit des recommandations pour élaborer votre stratégie de surveillance et d’alerte des terminaux, ainsi que des instructions étape par étape pour créer plus de 30 conditions personnalisées de surveillance des terminaux dans NinjaOne.

Cet article est une copie du guide des meilleures pratiques NinjaOne depuis notreCentre de ressources NinjaOne. Les données peuvent être téléchargées au format PDF au bas de cette page. 

Environnement

Plateforme NinjaOne

Indexer

Alertes des appareils sur le tableau de bord du système

Accédez aux données d'alertes sur le tableau de bord du système, sous l'onglet « Appareils ». 

system dashboard_devices_alerts.png
Figure 1 : Accéder aux alertes sur le tableau de bord du système

Ce tableau de bord vous permet également de filtrer rapidement ces activités à l'aide des options suivantes :

ColonnesPropriétés
Plage de datesChoisissez une plage de dates (dernier jour, dernière semaine, mois dernier ou trois derniers mois) correspondant à la date à laquelle l'alerte a été initialement déclenchée.
Types d’appareilsSélectionnez un ou plusieurs types d’appareils spécifiques pour filtrer la liste.
Conditions Recherchez des conditions spécifiques actuellement déclenchées.
OrganisationsSélectionnez une ou plusieurs organisations spécifiques pour filtrer la liste.
EmplacementsRecherchez un ou plusieurs emplacements spécifiques pour filtrer la liste (si vous avez sélectionné des filtres d’organisation, la liste des emplacements disponibles s’actualisera pour n’afficher que les emplacements appartenant à la ou aux organisations spécifiées).
AppareilsFiltrez la liste après avoir spécifié les appareils.
  1. Chaque colonne peut être triée. Par défaut, toutes les colonnes disponibles s’affichent dans le tableau ; utilisez l’icône en forme d’engrenage située sous les menus déroulants des filtres pour gérer la visibilité des colonnes. Vous pouvez actualiser la liste des alertes à tout moment en cliquant sur « Actualiser » en haut de la liste.
  2. Les noms des appareils, des organisations et des emplacements sont des liens hypertextes qui vous redirigent vers les tableaux de bord correspondants.
  3. Cliquez sur les données de la colonne « Alerte » pour afficher les détails dans une fenêtre contextuelle. Les détails d’alerte contiennent également le nom de l’appareil ainsi que la date et l’heure de création de l’alerte.
  4. Activer la case à cocher correspondante à une ou plusieurs alertes pour afficher l’option de réinitialisation. 

Introduction

À quoi ressemble une bonne surveillance ?

La surveillance et les alertes sont essentielles à l’utilisation efficace d’un outil RMM. De bonnes pratiques de surveillance vous permettent d’identifier les problèmes de manière proactive, de les résoudre plus rapidement et d’être plus efficace. Une meilleure surveillance peut également jouer un rôle clé dans la génération de revenus supplémentaires et l’amélioration de la satisfaction de vos clients.

Le défi consiste à savoir ce qu’il faut surveiller, ce qui nécessite une alerte, quels problèmes peuvent être résolus automatiquement et lesquels nécessitent une intervention humaine. L’acquisition de ces connaissances peut prendre des années, et même alors, les meilleures équipes peuvent encore avoir du mal à réduire la fatigue liée aux alertes et le bruit des tickets sur les appareils des clients.

Pour aider les débutants à condenser cette phase de mise en route et à mieux cibler leurs efforts, nous avons dressé cette liste de plus de 25 conditions à surveiller. Ces recommandations s’appuient sur les suggestions de nos partenaires et sur l’expérience de NinjaOne, qui aide les MSP à mettre en place une surveillance efficace et exploitable.

Pour chaque condition, nous décrivons ce qui est surveillé, comment configurer la surveillance dans NinjaOne et quelles actions doivent être entreprises si la condition est déclenchée. Certaines suggestions de surveillance sont concrètes, tandis que d’autres peuvent nécessiter un léger ajustement pour s’adapter à votre cas d’utilisation.

Ces idées de surveillance ne sont évidemment pas exhaustives et peuvent ne pas s’appliquer à toutes les situations ou circonstances. Une fois que vous aurez commencé à mettre en place votre système de surveillance en vous appuyant sur ces suggestions, vous devrez personnaliser et renforcer votre stratégie de surveillance, spécifique à vos clients et à leurs besoins. Nous finissons ce guide par des recommandations supplémentaires pour vous aider dans cette démarche et faire de la surveillance, des alertes et de la gestion des tickets un avantage concurrentiel pour votre MSP.

Surveillance de l’état de l’appareil

Surveillez en continu les événements critiques
  • Condition : événements critiques
  • Seuil : 80 événements critiques en 5 minutes
  • Action : Créer un ticket et mener une enquête
Identifier les redémarrages involontaires d’un appareil
  • Condition : Événement Windows
  • Source de l'événement : Microsoft-Windows-Kernel-Power
  • ID de l’événement : 41
  • Remarque : cette condition s'applique davantage aux serveurs, car les postes de travail et les ordinateurs portables peuvent générer cette erreur suite à une intervention de l'utilisateur
  • Action : Créer un ticket et mener une enquête
Identifier les appareils nécessitant un redémarrage
  • Condition : Disponibilité du système
  • Seuil recommandé : 30 ou 60 jours
  • Action : redémarrer l'appareil pendant une plage horaire appropriée. Une correction automatisée peut fonctionner pour les postes de travail.
Surveiller les points de terminaison hors ligne
  • Condition : Appareil hors-ligne
  • Seuil recommandé :
    • 10 minutes ou moins (Serveurs)
    • 5 jours ou plus (postes de travail)
  • Action:
    • Créer un ticket et enquêter
    • Wake-on-LAN (serveurs uniquement)
Surveiller les modifications du matériel
  • Activité : Système
  • Nom : Adaptateur ajouté / remplacé, UCT ajoutée / retirée, Disque dur ajouté / retiré, mémoire ajoutée / retirée
  • Action : Créer un ticket et mener une enquête
Surveillance d’une utilisation élevée et prolongée du processeur
  • Condition : UCT • Seuils : 90 % ou plus pour réduire le bruit, 95 % ou plus étant également communs sur une période de 15 minutes ou plus
  • Action : Créer un ticket et mener une enquête

Surveillance des disques

Surveiller les défaillances potentielles des disques
  • Condition : Le statut SMART de Windows s’est dégradé
  • Condition : Événement Windows
  • Type d'authentification de l'événement : Disque
  • ID d’événement : 7, 11, 29, 41, 51, 153
  • Action : Créer un ticket et mener une enquête
Identifier lorsque l'espace disque approche de sa capacité maximale
  • Condition : Espace libre sur le disque
  • Seuil : 20 %, et à nouveau à 10 %
  • Action : Nettoyer le disque et supprimer les fichiers temporaires
Surveiller les défaillances RAID potentielles
  • Condition : statut de l’intégrité RAID
  • Seuils : critique et non critique pour tous les attributs
  • Action : Créer un ticket et mener une enquête
Surveiller une utilisation élevée et prolongée du disque
  • Condition : Utilisation du disque
  • Seuils : 90 % ou plus pour réduire le bruit, 95 % ou plus étant également communs sur des périodes de 30 ou 60 minutes
  • Action : Créer un ticket et mener une enquête
Surveiller un taux d’activité du disque élevé
  • Condition : temps d’activité du disque
  • Seuils : supérieur à 90 % pendant 15 minutes
  • Action : créer un ticket et mener une enquête
Surveiller une utilisation élevée de la mémoire
  • Condition : temps d’activité du disque
  • Seuils : supérieur à 90 % pendant 15 minutes
  • Action : Créer un ticket et mener une enquête

Surveillance des applications

Vérifier si les applications obligatoires existent sur un point de terminaison
  • Condition : Logiciel
  • Utilisation:
    • Applications métier côté client (Exemples : AutoCAD, SAP, Photoshop)
    • Solutions de productivité client (exemples : Zoom, Microsoft Teams, DropBox, Slack, Office, Acrobat)
    • Outils d’assistance client (Exemples : Teamviewer, CCleaner, AutoElevate,
    • BleachBit)
  • Action : installer automatiquement l'application si elle est manquante et obligatoire
Surveiller si les applications critiques sont en cours d'exécution (en particulier pour les Serveurs)
  • Condition : Processus / Service
  • Seuil : en panne depuis au moins 3 Minutes
  • Exemples de processus :
    • Pour les postes de travail : TeamViewer, RDP, DLP
    • Pour un serveur Exchange : MSExchangeServiceHost, MSExchangeIMAP4, MSExchangePOP3, etc.
    • Pour un serveur Active Directory : Netlogon, dnscache, rpcss, etc.
    • Pour un serveur SQL : mssqlserver, sqlbrowser, sqlwriter, etc.
  • Action : redémarrez le service ou le processus
Surveillez l'utilisation des ressources par les applications connues pour causerdes problèmes de performance d'
  • Condition : Ressource de processus
  • Seuil : 90 % ou plus pendant au moins 5 minutes
  • Exemples de processus : Outlook, Chrome et TeamViewer
  • Action:
    • Créer un ticket et mener une enquête
    • Désactiver au démarrage
Surveiller les plantages de l'application
  • Condition : Événement Windows
  • Type d'authentification : Blocage de l'application
  • ID de l’événement : 1002
  • Action : Créer un ticket et mener une enquête

Surveillance du réseau

Surveiller toute utilisation inattendue de la bande passante
  • Condition : Utilisation du réseau
  • Direction : Sortante
  • Seuil : les seuils seront déterminés en fonction du type de terminal et de la capacité du réseau
    • Chaque serveur doit disposer de son propre seuil en fonction de son cas d'utilisation
    • Les seuils de surveillance du réseau des postes de travail doivent être suffisamment élevés pour ne se déclencher que lorsque le réseau d’un client est en danger
  • Action : Créer un ticket et mener une enquête
S'assurer que les périphériques réseau sont en ligne
  • Condition : Appareil hors-ligne
  • Durée : 3 Minutes
Surveiller quels ports sont ouverts
  • Condition : Moniteur du Cloud
  • Ports : 80 (HTTP), 443 (HTTPS), 25 (SMTP), 21 (FTP)
Surveillerla disponibilité du site Internet
  • Surveillance : Test ping
  • Cible : Site Internet du client
  • Condition : Échec (5 fois)
  • Action : Créer un ticket et mener une enquête

Surveillance de la sécurité

Vérifier si le pare-feu Windows a été désactivé
  • Condition : Événement Windows
  • Source de l'événement : Système
  • ID de l’événement : 5025
  • Action : Allumer le pare-feu Windows
Vérifier si des antivirus et des outils de sécurité sont installés et/ou en cours d’exécution sur un terminal
  • Condition : Logiciel
  • Présence : n’existe pas
  • Logiciels (exemples) : Huntress, Cylance, Threatlocker, Sophos
  • Action : automatiser l’installation des logiciels de sécurité manquants

    ET
  • Condition : Processus / Service
  • État : Hors connexion
  • Processus (exemples) : threatlockerservice.exe, EPUpdateService.exe
  • Action : redémarrer le processus
Surveiller la détection de menaces non intégrées par l'antivirus ou l'EDR
  • Condition : Événement Windows
  • Exemple (Sophos)
    • Source de l'événement : Sophos Antivirus
    • ID d’événement : 6, 16, 32, 42
Surveiller les tentatives de connexion utilisateur ayant échoué
  • Condition : erreur Windows
  • Source de l'événement : Microsoft-Windows-Security-Auditing
  • ID d’événement : 4625, 4740, 644 (comptes locaux) ; 4777 (connexion au domaine)
  • Action : Créer un ticket et mener une enquête
Surveiller la création, l’élévation de privilèges ou la suppression d’utilisateurs
sur un point de terminaison
  • Condition : Erreur Windows
  • Type d'authentification : Microsoft-Windows-Security-Auditing
  • ID de l’événement : 4720, 4732, 4729
  • Action : Créer un ticket et mener une enquête
Déterminer si les disques d'un point de terminaison sontchiffrés ou non par
  • Condition : Résultat du script
  • Script (personnalisé) : Vérifier l'état du chiffrement
  • Action : Créer un ticket et enquêter
Surveiller les échecs de sauvegarde (NinjaOne Backup)
  • Activité : NinjaOne Backup
  • Nom : La tâche de sauvegarde a échoué
Surveiller les échecs de sauvegarde (autres fournisseurs de sauvegarde)
  • Condition : Événement Windows
  • Exemple de type d'authentification / ID (Veeam) :
    • Type d'authentification pour l'événement : Veeam Agent
    • ID d’événement : 190
  • Texte contenant : Échec
  • Exemple de type d'authentification / ID (Acronis) :
    • Source de l’événement : Système de sauvegarde en ligne
    • ID de l’événement : 1
    • Texte contenant : Échec

4 clés pour améliorer votre surveillance

  1. Créez un modèle de base pour la surveillance de l'état de l'appareil.
  2. Discutez avec vos clients de leurs priorités.
    • Quels sont les serveurs et postes de travail importants ?
    • Quelles sont leurs applications critiques pour leur activité ou leurs
      de productivité ?
    • Où sont les points faibles en matière d’informatique ?
  3. Surveillez votre système PSA / de création de ticket pour détecter les problèmes récurrents.
    • Ajustez les alertes pour éviter les faux positifs.
  4. Surveillez les journaux des événements des clients pour détecter les problèmes récurrents.

Bonnes pratiques en matière de création de ticket et d’alertes

  1. Ne générez des alertes que pour les informations exploitables : si vous n’avez pas de réponse spécifique associée à un indicateur, ne le surveillez pas.
  2. Classez vos alertes par catégorie afin qu’elles soient transmises aux différents tableaux de bord de votre PSA.
  3. Organisez régulièrement des réunions de gestion des alertes pour en discuter.
    • Quelles sont les alertes qui génèrent le plus de bruit ? Peuvent-elles être supprimées ou leur périmètre réduit ?
    • Qu'est-ce qui n'est pas surveillé ou qui ne crée pas de Notifications alors que cela devrait l'être ?
    • Quelles alertes communes peuvent être résolues automatiquement ?
    • Y ont-ils des projets à venir susceptibles de générer des alertes ?
  4. Nettoyez vos tickets et vos alertes une fois qu’ils sont résolus. 
    • Dans NinjaOne, de nombreuses conditions disposent d’une option « Réinitialisation lorsque ce n’est plus vrai » ou « Réinitialisation lorsque ce n’est pas vrai pendant x périodes » pour vous aider à résoudre et à nettoyer les notifications susceptibles de se résoudre d’elles-mêmes.

FAQ

Pour aller plus loin