¿Ya eres cliente de NinjaOne? Inicia sesión para ver más guías y las últimas actualizaciones.

Endpoint Monitoring and Alerting Playbook

Tema

Esta guía ofrece recomendaciones para diseñar su estrategia de supervisión y alertas de terminales, así como instrucciones paso a paso para crear más de 30 condiciones personalizadas de supervisión de terminales en NinjaOne.

Este artículo es una copia de la guía de buenas prácticas de NinjaOne de nuestroCentro de recursos de NinjaOne. Los datos se pueden descargar en formato PDF al final de esta página. 

Entorno

Plataforma NinjaOne

Índice

Alertas de dispositivos en el Panel de control del sistema

Accede a los datos de alertas en el panel de control del sistema, en la pestaña «Dispositivos ». 

system dashboard_devices_alerts.png
Figura 1: Acceder a las alertas en el panel de control del sistema

Este panel de control también te permite filtrar rápidamente estas actividades por las siguientes opciones:

ColumnaPropiedades
Rango de fechaSelecciona un rango de fechas (último día, última semana, último mes o últimos tres meses) en el que se activó inicialmente la alerta.
Tipos de dispositivosSelecciona uno o varios tipos de dispositivos específicos para filtrar la lista.
Condiciones Busca condiciones específicas que se hayan activado actualmente.
OrganizacionesSelecciona una organización o varias para filtrar la lista.
UbicacionesBusca una o varias ubicaciones específicas para filtrar la lista (si tienes algún filtro de organización seleccionado, la lista de ubicaciones disponibles se actualizará para mostrar únicamente las ubicaciones pertenecientes a la(s) organización(es) especificada(s)).
DispositivosFiltra la lista por los dispositivos especificados.
  1. Cada columna se puede ordenar. De forma predeterminada, todas las columnas disponibles se muestran en la tabla; utiliza el icono de engranaje situado debajo de los menús desplegables de los filtros para gestionar la visibilidad de las columnas. Puedes actualizar la lista de alertas en cualquier momento haciendo clic en «Actualizar» en la parte superior de la lista.
  2. Los nombres de los dispositivos, las organizaciones y las ubicaciones son hiperenlaces que le llevan a los paneles de control de dichos dispositivos, organizaciones o ubicaciones.
  3. Haz clic en los datos de la columna «Alerta» para ver los detalles en una ventana emergente. Los detalles de la alerta también contienen el nombre del dispositivo y la fecha y hora en que se creó la alerta.
  4. Activa la casilla de verificación para una o varias alertas para ver la opción de restablecimiento. 

Introducción

¿Cómo es una buena supervisión?

La supervisión y las alertas son fundamentales para el uso eficaz de un RMM. Las buenas prácticas de supervisión te permiten identificar problemas de forma proactiva, resolverlos más rápido y ser más eficaz. Una mejor supervisión también puede desempeñar un papel clave a la hora de generar ingresos adicionales y mantener a tus clientes más satisfechos.

El reto consiste en saber qué hay que supervisar, qué requiere una alerta, qué problemas se pueden resolver de forma automática y cuáles necesitan un toque personal. Adquirir esos conocimientos puede llevar años y, aun así, incluso los mejores equipos pueden seguir teniendo dificultades para reducir la fatiga por alertas y el ruido de los tickets en los dispositivos de los clientes.

Para ayudar a quienes acaban de empezar a reducir ese tiempo de puesta en marcha y a centrar mejor su atención, hemos elaborado esta lista de ideas con más de 25 condiciones que se deben supervisar. Estas recomendaciones se basan en sugerencias de nuestros socios y en la experiencia de NinjaOne ayudando a los MSP a crear un sistema de supervisión eficaz y práctico.

Para cada condición, describimos qué se supervisa, cómo configurar la supervisión en NinjaOne y qué medidas deben tomarse si se activa la condición. Algunas sugerencias de supervisión son concretas, mientras que otras pueden requerir una pequeña personalización para adaptarlas a tu caso de uso.

Obviamente, estas ideas de supervisión no son exhaustivas y puede que no sean aplicables a todas las situaciones o circunstancias. Una vez que hayas empezado a desarrollar tu sistema de supervisión basándote en estas sugerencias, tendrás que elaborar una estrategia de supervisión más personalizada y sólida, específica para tus clientes y sus necesidades. Concluimos esta guía con recomendaciones adicionales para ayudarte en esa tarea y hacer que la supervisión, las alertas y la gestión de incidencias se conviertan en una ventaja competitiva para tu MSP.

Supervisión del estado del dispositivo

Supervisar eventos críticos de forma continua
  • Condición: Eventos críticos
  • Límite: 80 eventos críticos en 5 minutos
  • Acción: Abrir un ticket e investigar
Identificar cuándo un dispositivo se reinicia de forma involuntaria
  • Condición: Evento de Windows
  • Tipo de autenticación: Microsoft-Windows-Kernel-Power
  • Id. de evento: 41
  • Nota: Esta condición es más adecuada para servidores, ya que las estaciones de trabajo y los portátiles pueden generar este error debido a la intervención del usuario
  • Acción: Abrir un ticket y investigar
Identificar los dispositivos que necesitan reiniciarse
  • Condición: Tiempo de actividad del sistema
  • Límite recomendado: 30 o 60 días
  • Acción: Reiniciar el dispositivo durante un intervalo de tiempo adecuado. La corrección automatizada puede funcionar para las estaciones de trabajo.
Supervisar los terminales desconectados
  • Condición: Dispositivo caído
  • Límite recomendado:
    • 10 minutos o menos (Servidores)
    • 5 días o más (estaciones de trabajo)
  • Acción:
    • Crear un ticket y investigar
    • Activación de LAN (solo servidores)
Supervisar los cambios de hardware
  • Actividad: Sistema
  • Nombre: Adaptador añadido/modificado, CPU agregada/eliminada, Unidad de disco agregada/eliminada, memoria agregada/eliminada
  • Acción: Abrir un ticket y investigar
Supervisar el uso elevado y prolongado de la CPU
  • Condición: CPU• Límites: 90 % o más para reducir el ruido, siendo también común un 95 % o más durante un período de 15 minutos o más
  • Acción: Abrir un ticket e investigar

Supervisión de unidades

Supervisar posibles fallos de disco
  • Condición: Estado de Windows SMART degradado
  • Condición: Evento de Windows
  • Tipo de autenticación del evento: Disco
  • ID de eventos: 7, 11, 29, 41, 51, 153
  • Acción: Abrir un ticket e investigar
Identificar cuándo el espacio en disco se está acercando a su capacidad máxima
  • Condición: Espacio libre en el disco
  • Límite: 20 % y nuevamente en 10 %
  • Acción: Realizar limpieza del disco y eliminar los archivos temporales
Supervisar posibles fallos del RAID
  • Condición: Estado de salud de RAID
  • Límites: Críticos(s) y no críticos(s) para todos los atributos
  • Acción: Abrir un ticket e investigar
Supervisar un uso elevado y prolongado del disco
  • Condición: Uso del disco
  • Límites: 90 % o más para reducir el ruido, con un 95 % o más también común en períodos de 30 o 60 minutos
  • Acción: Abrir un ticket e investigar
Supervisar una tasa elevada de actividad del disco
  • Condición: Tiempo activo del disco
  • Límites: Mayor que el 90 % durante 15 minutos
  • Acción: Abrir un ticket y investigar
Supervisar el uso elevado de la memoria
  • Condición: Tiempo activo del disco
  • Límites: mayor que el 90 % durante 15 minutos
  • Acción: Abrir un ticket y investigar

Supervisión de aplicaciones

Identificar si existen aplicaciones requeridas en un terminal
  • Condición: Software
  • Uso:
    • Aplicaciones de línea de negocio del cliente (Ejemplos: AutoCAD, SAP, Photoshop)
    • Soluciones de productividad para clientes (Ejemplos: Zoom, Microsoft Teams, Dropbox, Slack, Office, Acrobat)
    • Herramientas de soporte para clientes (Ejemplos: Teamviewer, CCleaner, AutoElevate,
    • BleachBit)
  • Acción: Instalar automáticamente la aplicación si falta y es requerida
Supervisar si las aplicaciones críticas están en ejecución (especialmente en el caso de los servidores)
  • Condición: Proceso / Servicio
  • Límite: Inactivo durante al menos 3 minutos
  • Ejemplos de procesos:
    • Para estaciones de trabajo: Teamviewer, RDP, DLP
    • Para un servidor Exchange: MSExchangeServiceHost, MSExchangeIMAP4, MSExchangePOP3, etc.
    • Para un servidor de Active Directory: Netlogon, dnscache, rpcss, etc.
    • Para un servidor SQL: mssqlserver, sqlbrowser, sqlwriter, etc.
  • Acción: Reinicia el servicio o el proceso
Supervisa el uso de recursos de las aplicaciones que se sabe que causanproblemas de rendimiento en
  • Condición: Recurso de proceso
  • Límite: 90 % o más por al menos 5 minutos
  • Ejemplos de procesos: Outlook, Chrome y Teamviewer
  • Acción:
    • Crear un ticket e investigar
    • Deshabilitar al iniciar el sistema
Supervisar si la aplicación se bloquea
  • Condición: Evento de Windows
  • Tipo de autenticación: Bloqueo de la aplicación
  • Id. de evento: 1002
  • Acción: Abrir un ticket y investigar

Supervisión de la red

Supervisar el uso inesperado del ancho de banda
  • Condición: Utilización de la red
  • Dirección: Fuera
  • Umbral: los límites se determinarán por el tipo de terminal y la capacidad de la red
    • Cada servidor debe tener su propio límite en función de su caso de uso
    • Los límites de supervisión de la red de las estaciones de trabajo deben ser lo suficientemente altos como para activarse solo cuando la red de un cliente esté en peligro
  • Acción: Abrir un ticket e investigar
Asegurarse de que los dispositivos de red estén operativos
  • Condición: Dispositivo caído
  • Duración: 3 minutos
Supervisar qué puertos están abiertos
  • Condición: Monitor de nube
  • Puertos: 80 (HTTP), 443 (HTTPS), 25 (SMTP), 21 (FTP)
Supervisarla disponibilidad del sitio web
del cliente
  • Supervisión: Ping
  • Objetivo: Sitio web del cliente
  • Condición: Falla (5 veces)
  • Acción: Abrir un ticket y investigar

Supervisión de seguridad

Identificar si el Cortafuegos de Windows se ha desactivado
  • Condición: Evento de Windows
  • Tipo de autenticación: Sistema
  • Id. de evento: 5025
  • Acción: Encender el cortafuegos de Windows
Determina si hay herramientas antivirus y de seguridad instaladas y/o en ejecución en un terminal
  • Condición: Software
  • Presencia: No existe
  • Software (ejemplos): Huntress, Cylance, Threatlocker, Sophos
  • Acción: Automatizar la instalación del software de seguridad que falta

    Y
  • Condición: Proceso / Servicio
  • Estado: Inactivo
  • Proceso (ejemplos): threatlockerservice.exe, EPUpdateService.exe
  • Acción: Reiniciar el proceso
Supervisar la detección de amenazas no integradas por el antivirus o el EDR
  • Condición: Evento de Windows
  • Ejemplo (Sophos)
    • Tipo de autenticación del evento: Sophos Antivirus
    • Id. de eventos: 6, 16, 32, 42
Supervisar los intentos fallidos de inicio de sesión de usuario
  • Condición: Error de Windows
  • Tipo de evento: Microsoft-Windows-Security-Auditing
  • Id. de evento: 4625, 4740, 644 (cuentas locales); 4777 (inicio de sesión en el dominio)
  • Acción: Abrir un ticket y investigar
Supervisar la creación, elevación de privilegios o eliminación de usuarios
en un terminal
  • Condición: Error de Windows
  • Origen del evento: Microsoft-Windows-Security-Auditing
  • Id. de evento: 4720, 4732, 4729
  • Acción: Abrir un ticket y investigar
Identificar si los discos de un terminal sonencriptados o no encriptados
  • Condición: Resultado del script
  • Script (personalizado): Comprobar el estado del cifrado
  • Acción: Abrir ticket y investigar
Supervisar los fallos de respaldo (NinjaOne Backup)
  • Actividad: NinjaOne Respaldo
  • Nombre: Error al crear respaldo
Supervisar fallos en los respaldos (otros proveedores de respaldos)
  • Condición: Evento de Windows
  • Ejemplo de fuente/ID (Veeam):
    • Tipo de autenticación: Veeam Agent
    • ID de eventos: 190
  • El texto contiene: Error
  • Ejemplo de tipo de autenticación/ID (Acronis):
    • Origen del evento: Sistema de copia de seguridad en línea
    • Id. de evento: 1
    • El texto contiene: Error

4 claves para mejorar tu supervisión

  1. Crea una plantilla de referencia para la supervisión del estado del dispositivo.
  2. Hable con los clientes acerca de sus prioridades.
    • ¿Qué servidores y estaciones de trabajo son importantes?
    • ¿Cuáles son sus aplicaciones críticas para el negocio o para la productividad
      ?
    • ¿Cuáles son sus puntos débiles en materia de TI?
  3. Supervisa tu sistema PSA/Ticketing para detectar problemas recurrentes.
    • Ajusta las alertas para evitar el exceso de tickets.
  4. Supervisa los registros de eventos de los clientes para detectar problemas recurrentes.

Buenas prácticas en la gestión de tickets y alertas

  1. Envía alertas solo sobre información que requiera una acción concreta: si no tienes una respuesta específica asociada a un monitor, no lo supervises.
  2. Clasifica tus alertas para que se dirijan a los distintos tableros de servicio de tu PSA.
  3. Organiza reuniones regulares para revisar y debatir las alertas.
    • ¿Qué alertas están generando más ruido? ¿Se pueden eliminar o reducir su alcance?
    • ¿Qué es lo que no se está supervisando o lo que está generando notificaciones y debería supervisarse?
    • ¿Qué alertas comunes se pueden resolver automáticamente?
    • ¿Hay algún proyecto próximo que pueda generar alertas?
  4. Limpia tus tickets y alertas cuando se resuelvan. 
    • En NinjaOne, muchas condiciones cuentan con las opciones «Restaurar cuando ya no sea verdadero» o «Restaurar cuando no sea verdadero durante un período de x», para ayudarte a resolver y limpiar las notificaciones que puedan resolverse por sí solas.

FAQ

Próximos pasos