Sie sind bereits NinjaOne-Kunde? Melden Sie sich an, um weitere Leitfäden und die neuesten Updates zu sehen.

Endpoint Monitoring and Alerting Playbook

Thema

Dieser Leitfaden enthält Empfehlungen zur Erstellung Ihrer Strategie für die Endpunktüberwachung und Alarmierung sowie eine Schritt-für-Schritt-Anleitung zur Erstellung von über 30 benutzerdefinierten Endpunktüberwachungsbedingungen in NinjaOne.

Dieser Artikel ist eine Kopie des NinjaOne-Leitfadens zu Best Practices aus unseremNinjaOne-Ressourcencenter unter. Die Daten können am Ende dieser Seite als PDF heruntergeladen werden. 

Umgebung

NinjaOne-Plattform

Inhaltsverzeichnis

Gerätewarnungen auf dem System-Dashboard

Rufen Sie die Alarmdaten auf dem System-Dashboard unter der Registerkarte „Geräte“ auf. 

system dashboard_devices_alerts.png
Abbildung 1: Zugriff auf Warnmeldungen auf dem System-Dashboard

Über dieses Dashboard können Sie diese Aktivitäten außerdem schnell anhand der folgenden Optionen filtern:

SpalteEigenschaften
DatumsbereichWählen Sie einen Datumsbereich (letzter Tag, letzte Woche, letzter Monat oder letzte drei Monate) aus, in dem die Warnmeldung ursprünglich ausgelöst wurde.
GerätetypenWählen Sie einen bestimmten Gerätetyp oder mehrere Gerätetypen aus, nach denen die Liste gefiltert werden soll.
Bedingungen Suchen Sie nach bestimmten Bedingungen, die derzeit ausgelöst sind.
OrganisationenWählen Sie eine bestimmte Organisation oder mehrere Organisationen aus, nach denen die Liste gefiltert werden soll.
StandorteSuchen Sie nach einem bestimmten Standort oder bestimmten Standorten, um die Liste danach zu filtern (wenn Sie Organisationsfilter ausgewählt haben, wird die Liste der verfügbaren Standorte aktualisiert, sodass nur die Standorte der ausgewählten Organisation(en) angezeigt werden).
GeräteFiltern Sie die Liste nach bestimmten Geräten.
  1. Jede Spalte kann sortiert werden. Standardmäßig werden alle verfügbaren Spalten in der Tabelle angezeigt; verwenden Sie das Zahnrad-Symbol unter den Filter-Dropdown-Menüs, um die Sichtbarkeit der Spalten zu verwalten. Sie können die Alarmliste jederzeit aktualisieren, indem Sie oben in der Liste auf „Aktualisieren“ klicken.
  2. Die Namen der Geräte, Organisationen und Standorte sind Hyperlinks, über die Sie zu den Dashboards für diese Geräte, Organisationen oder Standorte gelangen.
  3. Klicken Sie auf die Daten in der Spalte „Warnung“, um die Details in einem Popup-Fenster anzuzeigen. Die Warnungsdetails enthalten außerdem den Gerätenamen sowie Datum und Uhrzeit der Erstellung der Warnung.
  4. Aktivieren Sie das Kontrollkästchen für eine oder mehrere Warnmeldungen, um die Option „Zurücksetzen“ anzuzeigen. 

Einführung

Wie sieht eine gute Überwachung aus?

Überwachung und Warnmeldungen sind für den effektiven Einsatz eines RMM von zentraler Bedeutung. Gute Überwachungspraktiken ermöglichen es Ihnen, Probleme proaktiv zu erkennen, sie schneller zu beheben und effektiver zu arbeiten. Eine bessere Überwachung kann zudem eine Schlüsselrolle dabei spielen, zusätzliche Einnahmen zu generieren und die Zufriedenheit Ihrer Kunden zu steigern.

Die Herausforderung besteht darin, zu wissen, was überwacht werden muss, was eine Warnmeldung erfordert, welche Probleme automatisch gelöst werden können und welche einen persönlichen Eingriff erfordern. Der Aufbau dieses Wissens kann Jahre dauern, und selbst dann haben selbst die besten Teams oft noch Schwierigkeiten, die „Alarm-Müdigkeit“ und die Flut von Support-Tickets auf den Kundengeräten zu reduzieren.

Um Einsteigern dabei zu helfen, diese Einarbeitungszeit zu verkürzen und ihren Fokus einzugrenzen, haben wir diese Liste mit Ideen für über 25 zu überwachende Zustände zusammengestellt. Diese Empfehlungen basieren auf Vorschlägen unserer Partner sowie auf den Erfahrungen von NinjaOne bei der Unterstützung von MSPs beim Aufbau einer effektiven, umsetzbaren Überwachung.

Für jede Bedingung beschreiben wir, was überwacht wird, wie der Monitor in NinjaOne eingerichtet wird und welche Maßnahmen ergriffen werden sollten, wenn die Bedingung ausgelöst wird. Einige Überwachungsvorschläge sind konkret, während andere möglicherweise eine geringfügige Anpassung erfordern, um sie an Ihren Anwendungsfall anzupassen.

Diese Überwachungsideen sind natürlich nicht erschöpfend und lassen sich möglicherweise nicht auf jede Situation oder jeden Umstand anwenden. Sobald Sie damit begonnen haben, Ihre Überwachung anhand dieser Vorschläge aufzubauen, müssen Sie eine individuellere und robustere Überwachungsstrategie entwickeln, die speziell auf Ihre Kunden und deren Bedürfnisse zugeschnitten ist. Wir schließen diesen Leitfaden mit weiteren Empfehlungen ab, die Sie dabei unterstützen sollen und die Überwachung, Alarmierung und Ticketverwaltung zu einem Wettbewerbsvorteil für Ihren MSP machen.

Überwachung des Gerätezustands

Überwachung auf fortlaufende kritische Ereignisse

  • Bedingung: Kritische Ereignisse
  • Schwellenwert: 80 kritische Ereignisse innerhalb von 5 Minuten
  • Maßnahme: Ticket erstellen und untersuchen

Erkennen, wenn ein Gerät unbeabsichtigt neu gestartet wird

  • Bedingung: Windows-Ereignis
  • Ereignisquelle: Microsoft-Windows-Kernel-Power
  • Ereignis-ID: 41
  • Hinweis: Diese Bedingung eignet sich besser für Server, da dieser Fehler bei Workstations und Laptops durch Benutzereingriffe verursacht werden kann
  • Maßnahme: Ticket erstellen und untersuchen

Geräte identifizieren, die einen Neustart benötigen

  • Bedingung: Systemlaufzeit
  • Empfohlener Schwellenwert: 30 oder 60 Tage
  • Maßnahme: Starten Sie das Gerät in einem geeigneten Zeitfenster neu. Bei Workstations kann eine automatisierte Behebung funktionieren.

Auf Offline-Endpunkte überwachen

  • Bedingung: Gerät ausgefallen
  • Empfohlener Schwellenwert:
    • 10 Minuten oder weniger (Server)
    • 5 Tage oder länger (Arbeitsstationen)
  • Maßnahme:
    • Ticket erstellen und untersuchen
    • Wake-on-LAN (nur Server)

Auf Hardware-Änderungen überwachen

  • Aktivität: System
  • Name: Adapter hinzugefügt/geändert, CPU hinzugefügt/entfernt, Festplatte hinzugefügt/entfernt, Arbeitsspeicher hinzugefügt/entfernt
  • Maßnahme: Ticket erstellen und untersuchen

Überwachung auf anhaltend hohe CPU-Auslastung

  • Bedingung: CPU• Schwellenwerte: 90 % oder mehr, um Fehlalarme zu reduzieren; Werte von 95 % oder mehr sind über einen Zeitraum von 15 Minuten oder länger ebenfalls häufig
  • Maßnahme: Ticket erstellen und untersuchen

Festplattenüberwachung

Auf potenziellen Festplattenausfall überwachen
  • Bedingung: Windows-SMART-Status „Degraded“
  • Bedingung: Windows-Ereignis
  • Ereignisquelle: Festplatte
  • Ereignis-IDs: 7, 11, 29, 41, 51, 153
  • Maßnahme: Ticket erstellen und untersuchen
Erkennen, wenn sich der Festplattenspeicher der Kapazitätsgrenze nähert
  • Bedingung: Freier Speicherplatz auf der Festplatte
  • Schwellenwert: 20 % und erneut bei 10 %
  • Maßnahme: Festplattenbereinigung durchführen und temporäre Dateien löschen
Auf potenzielle RAID-Ausfälle überwachen
  • Bedingung: RAID-Zustand
  • Schwellenwerte: Kritisch und Nicht kritisch für alle Attribute
  • Maßnahme: Ticket erstellen und untersuchen
Überwachen Sie eine anhaltend hohe Festplattenauslastung
  • Bedingung: Festplattenauslastung
  • Schwellenwerte: 90 % oder mehr, um Fehlalarme zu reduzieren; Werte von 95 % oder mehr sind über Zeiträume von 30 oder 60 Minuten ebenfalls häufig
  • Maßnahme: Ticket erstellen und untersuchen
Überwachung auf hohe Festplattenaktivitätsrate
  • Bedingung: Festplattenaktivitätszeit
  • Schwellenwerte: Mehr als 90 % über einen Zeitraum von 15 Minuten
  • Maßnahme: Ticket erstellen und untersuchen
Überwachung auf hohe Speicherauslastung
  • Bedingung: Festplatten-Aktivitätszeit
  • Schwellenwerte: Mehr als 90 % für 15 Minuten
  • Maßnahme: Ticket erstellen und untersuchen

Anwendungsüberwachung

Feststellen, ob erforderliche Anwendungen auf einem Endpunkt vorhanden sind
  • Bedingung: Software
  • Verwendung:
    • Kunden-Branchenanwendungen (Beispiele: AutoCAD, SAP, Photoshop)
    • Client-Produktivitätslösungen (Beispiele: Zoom, Microsoft Teams, Dropbox, Slack, Office, Acrobat)
    • Client-Support-Tools (Beispiele: TeamViewer, CCleaner, AutoElevate,
    • BleachBit)
  • Maßnahme: Die Anwendung automatisch installieren, falls sie fehlt und benötigt wird
Überwachen, ob kritische Anwendungen ausgeführt werden (insbesondere bei Servern)
  • Bedingung: Prozess / Dienst
  • Schwellenwert: Seit mindestens 3 Minuten nicht verfügbar
  • Beispielprozesse:
    • Für Workstations: TeamViewer, RDP, DLP
    • Für einen Exchange-Server: MSExchangeServiceHost, MSExchangeIMAP4, MSExchangePOP3 usw.
    • Für einen Active-Directory-Server: Netlogon, dnscache, rpcss usw.
    • Für einen SQL-Server: mssqlserver, sqlbrowser, sqlwriter usw.
  • Maßnahme: Starten Sie den Dienst oder Prozess neu
Überwachen Sie die Ressourcenauslastung von Anwendungen, von denen bekannt ist, dass sieLeistungsprobleme bei „
verursachen
  • Bedingung: Prozessressource
  • Schwellenwert: 90 %+ für mindestens 5 Minuten
  • Beispielprozesse: Outlook, Chrome und TeamViewer
  • Maßnahme:
    • Ticket erstellen und untersuchen
    • Beim Systemstart deaktivieren
Auf Anwendungsabstürze überwachen
  • Bedingung: Windows-Ereignis
  • Quelle: Anwendungsstillstand
  • Ereignis-ID: 1002
  • Aktion: Ticket erstellen und untersuchen

Netzwerküberwachung

Auf unerwartete Bandbreitennutzung überwachen
  • Bedingung: Netzwerkauslastung
  • Richtung: Ausgehend
  • Schwellenwert: Die Schwellenwerte werden anhand des Endpunkt-Typs und der Netzwerkkapazität festgelegt
    • Jeder Server sollte je nach Anwendungsfall einen eigenen Schwellenwert haben
    • Die Schwellenwerte für die Netzwerküberwachung von Arbeitsplätzen sollten hoch genug sein, damit sie nur ausgelöst werden, wenn das Netzwerk eines Clients gefährdet ist
  • Maßnahme: Ticket erstellen und untersuchen
Sicherstellen, dass Netzwerkgeräte betriebsbereit sind
  • Zustand: Gerät ausgefallen
  • Dauer: 3 Minuten
Überwachen, welche Ports offen sind
  • Bedingung: Cloud-Monitor
  • Ports: 80 (HTTP), 443 (HTTPS), 25 (SMTP), 21 (FTP)
Verfügbarkeit derClient-
-Websiteüberwachen
  • Überwachung: Ping
  • Ziel: Kunden-Website
  • Bedingung: Fehler (5 Mal)
  • Aktion: Ticket erstellen und untersuchen

Sicherheitsüberwachung

Feststellen, ob die Windows-Firewall deaktiviert wurde
  • Bedingung: Windows-Ereignis
  • Ereignisquelle: System
  • Ereignis-ID: 5025
  • Aktion: Windows-Firewall aktivieren
Prüfen, ob Antiviren- und Sicherheitstools auf einem Endgerät installiert sind und/oder ausgeführt werden
  • Bedingung: Software
  • Vorhandensein: Nicht vorhanden
  • Software (Beispiele): Huntress, Cylance, Threatlocker, Sophos
  • Aktion: Die Installation der fehlenden Sicherheitssoftware automatisieren

    UND

  • Bedingung: Prozess / Dienst
  • Status: Nicht verfügbar
  • Prozess (Beispiele): threatlockerservice.exe, EPUpdateService.exe
  • Aktion: Den Prozess neu starten
Auf erkannte Bedrohungen durch nicht integrierte AV-/EDR-Lösungen überwachen
  • Bedingung: Windows-Ereignis
  • Beispiel (Sophos)
    • Ereignisquelle: Sophos Anti-Virus
    • Ereignis-IDs: 6, 16, 32, 42
Überwachung auf fehlgeschlagene Anmeldeversuche von Benutzern
  • Bedingung: Windows-Fehler
  • Ereignisquelle: Microsoft-Windows-Security-Auditing
  • Ereignis-ID: 4625, 4740, 644 (lokale Konten); 4777 (Domänenanmeldung)
  • Aktion: Ticket erstellen und untersuchen
Überwachung der Erstellung, Erhöh
en oder Entfernung von Benutzeren auf einem Endpunkt
  • Bedingung: Windows-Fehler
  • Ereignisquelle: Microsoft-Windows-Security-Auditing
  • Ereignis-ID: 4720, 4732, 4729
  • Maßnahme: Ticket erstellen und untersuchen
Ermitteln, ob die Laufwerke auf einem Endpunkt
verschlüsselt oder unverschlüsseltsind
  • Bedingung: Skript-Ergebnis
  • Skript (benutzerdefiniert): Verschlüsselungsstatus prüfen
  • Aktion: Ticket erstellen und untersuchen
Überwachen Sie Backup-Fehler (NinjaOne Backup)
  • Aktivität: NinjaOne Backup
  • Name: Backup-Auftrag fehlgeschlagen
Überwachung von Backup-Fehlern (andere Backup-Anbieter)
  • Bedingung: Windows-Ereignis
  • Beispielquelle / IDs (Veeam):
    • Ereignisquelle: Veeam Agent
    • Ereignis-IDs: 190
  • Text enthält: Fehlgeschlagen
  • Beispielquelle / IDs (Acronis):
    • Ereignisquelle: Online-Backup-System
    • Ereignis-ID: 1
    • Text enthält: Fehlgeschlagen

4 Tipps zur Optimierung Ihrer Überwachung

  1. Erstellen Sie eine Vorlage für die Basisüberwachung des Gerätezustands.
  2. Sprechen Sie mit Ihren Kunden über deren Prioritäten.
    • Welche Server und Workstations sind wichtig?
    • Was sind ihre geschäftskritischen Anwendungen oder Anwendungen zur Produktivitäts
      ?
    • Wo liegen ihre IT-Schwachstellen?
  3. Überwachen Sie Ihr PSA-/Ticketingsystem auf wiederkehrende Probleme.
    • Passen Sie die Benachrichtigungen an, um unnötige Tickets zu vermeiden.
  4. Überwachen Sie die Ereignisprotokolle Ihrer Kunden auf wiederkehrende Probleme.

Best Practices für Ticketing und Benachrichtigungen

  1. Lösen Sie Benachrichtigungen nur bei handlungsrelevanten Informationen aus – wenn Sie keine konkrete Maßnahme für einen Überwachungsparameter festgelegt haben, sollten Sie diesen nicht überwachen.
  2. Kategorisieren Sie Ihre Benachrichtigungen, damit sie an verschiedene Service-Boards in Ihrem PSA weitergeleitet werden.
  3. Führen Sie regelmäßig Besprechungen zur Benachrichtigungsoptimierung durch, um diese Themen zu erörtern.
    • Welche Benachrichtigungen verursachen die meisten Störsignale? Können sie entfernt oder in ihrem Umfang eingeschränkt werden?
    • Was wird nicht überwacht oder erzeugt Benachrichtigungen, obwohl dies eigentlich der Fall sein sollte?
    • Welche häufigen Warnmeldungen lassen sich automatisch beheben?
    • Gibt es anstehende Projekte, die möglicherweise Warnmeldungen auslösen könnten?
  4. Bereinigen Sie Ihre Tickets und Warnmeldungen, sobald sie behoben sind. 
    • In NinjaOne verfügen viele Bedingungen über die Optionen „Zurücksetzen, wenn nicht mehr zutreffend“ oder „Zurücksetzen, wenn x Zeiträume lang nicht zutreffend“, um Ihnen dabei zu helfen, Benachrichtigungen zu lösen und zu bereinigen, die sich möglicherweise von selbst auflösen.

FAQ

Nächste Schritte