/
/

28 ejemplos esenciales de automatización de TI para la supervisión, las alertas y la corrección proactivas en MSP

Por Peter Bretton, VP, Product Strategy   |  
traducido por David Herrera Rivero
28 ejemplos esenciales de automatización de TI para la supervisión, las alertas y la corrección proactivas en MSP

Resumen instantáneo

Este post ofrece una lista completa de comandos CMD básicos y una inmersión profunda en los comandos de Windows, con más de 70 comandos cmd esenciales tanto para principiantes como para usuarios avanzados. Explica comandos prácticos del símbolo del sistema para la gestión de archivos, la navegación por directorios, la solución de problemas de red, las operaciones de disco y la automatización con ejemplos reales para mejorar la productividad. Tanto si estás aprendiendo los comandos básicos de cmd como si ya dominas las herramientas avanzadas de la CLI de Windows, esta guía te ayudará a utilizar el Símbolo del sistema de forma más eficaz.

Puntos clave

  • Los MSP que automatizan la supervisión del estado de los dispositivos, las aplicaciones, las redes, las unidades de almacenamiento y la seguridad pueden resolver las incidencias con mayor rapidez y evitar interrupciones antes de que afecten a los usuarios finales.
  • Esta lista de comprobación incluye 28 condiciones concretas que se pueden supervisar, con criterios de activación, umbrales y medidas de corrección recomendados que los equipos de TI pueden adaptar a cualquier plataforma RMM.
  • Una automatización eficaz implica generar alertas solo cuando sea posible actuar, corregir automáticamente problemas habituales —por ejemplo, reiniciando servicios detenidos o liberando espacio en disco cuando sea necesario— y gestionar los tickets según su prioridad para evitar un exceso de alertas innecesarias.
  • La supervisión de las copias de seguridad es un aspecto crítico que a menudo se pasa por alto: automatizar las alertas cuando fallan las tareas de copia de seguridad en Ninja Data Protection y herramientas similares es esencial para proteger los datos.
  • Crear una plantilla base de supervisión, adaptarla a las prioridades de cada cliente y revisar periódicamente las alertas para eliminar las innecesarias son prácticas que distinguen a los MSP proactivos de los reactivos.

La supervisión de endpoints y la gestión de alertas son una parte fundamental de la gestión de TI. Si eres un MSP, unas buenas prácticas de supervisión y alertas te permiten detectar problemas de forma proactiva, responder y corregirlos con mayor rapidez, reducir el tiempo de inactividad y minimizar su impacto en los usuarios finales.

El reto está en saber:

  • qué conviene supervisar,
  • qué situaciones requieren una alerta,
  • qué problemas pueden resolverse automáticamente y
  • cuáles requieren la intervención de una persona.

Adquirir estos conocimientos puede llevar años y, aun así, incluso los mejores equipos de TI pueden tener dificultades para reducir la  saturación por alertas  y el exceso de tickets en sus redes y dispositivos.

Para acortar ese proceso de aprendizaje y ayudarte a centrarte en lo más importante, hemos preparado esta lista de condiciones que conviene supervisar, junto con criterios de activación y acciones de automatización recomendados. Estas recomendaciones se basan en la experiencia de nuestros clientes y en la de NinjaOne ayudando a equipos de TI a establecer una supervisión más eficaz y centrada en alertas sobre las que realmente se puede actuar.

Cómo utilizar la siguiente lista de comprobación de supervisión para MSP

Para cada condición, explicamos qué se supervisa, cómo configurar la comprobación en NinjaOne y qué acciones deben llevarse a cabo cuando se cumpla dicha condición. Algunas de las recomendaciones de supervisión son muy concretas, mientras que otras pueden requerir pequeños ajustes para adaptarlas a tu caso de uso.

Nota: Aunque hemos elaborado esta lista de comprobación pensando en NinjaOne y en nuestros clientes, estas recomendaciones de supervisión pueden adaptarse fácilmente a cualquier solución RMM o de gestión de endpoints.

Esta lista tampoco pretende ser exhaustiva y puede que no todas las recomendaciones sean aplicables a cualquier situación.

Una vez que hayas empezado a crear tu plan de supervisión a partir de estas recomendaciones, conviene desarrollar una estrategia más completa y adaptada a tus necesidades concretas. Al final del artículo encontrarás más recomendaciones para ayudarte a conseguirlo y hacer que la supervisión, la gestión de alertas y los tickets sean más eficientes y eficaces.

Supervisión del estado de los dispositivos

Lista de comprobación para supervisar el estado de los dispositivos

Supervisar eventos críticos continuos

  • Condición: eventos críticos
  • Umbral: 80 eventos críticos en 5 minutos
  • Nota: Puede ser necesario ajustar el umbral o aplicar filtros de exclusión, ya que podría generar demasiadas alertas en entornos cuyos registros generan muchos eventos.
  • Acción: crear un ticket e investigar

Detectar apagados inesperados del sistema

  • Condición: evento de Windows
  • Origen del evento: Microsoft-Windows-Kernel-Power
  • ID de evento: 41
  • Nota: Esta condición resulta más adecuada para servidores, ya que en estaciones de trabajo y portátiles este error puede producirse como consecuencia de acciones del usuario.
  • Acción: crear un ticket e investigar

Detectar dispositivos que pueden necesitar un reinicio

  • Condición: tiempo de actividad del sistema
  • Umbral recomendado: 30 o 60 días, aunque puede resultar demasiado estricto para servidores con cargas de trabajo estables
  • Acción: reiniciar el dispositivo en un momento adecuado. En las estaciones de trabajo, puede ser conveniente automatizar esta corrección.

Supervisar endpoints desconectados

  • Condición: dispositivo sin conexión
  • Umbral recomendado:
    • 10 minutos o menos para servidores
    • 24 horas o más para estaciones de trabajo
  • Acción:
    • crear un ticket e investigar
    • activar Wake-on-LAN, solo en servidores

Supervisar cambios en el hardware

  • Actividad: sistema
  • Nombre: adaptador añadido/modificado, CPU añadida/eliminada, unidad de disco añadida/eliminada, memoria añadida/eliminada
  • Acción: crear un ticket e investigar

Supervisión de unidades de almacenamiento

Lista de comprobación para supervisar las unidades de almacenamiento

Supervisar indicios de un posible fallo del disco

  • Condición: estado SMART de Windows degradado y/o evento de Windows
  • Origen del evento: Disco
  • ID de eventos: 7, 11, 29, 41, 51, 153
  • Acción: crear un ticket e investigar

Identificar cuando el espacio en disco se acerca a su capacidad

  • Condición: espacio libre en el disco
  • Umbral: 20% y de nuevo al 10%
  • Acción: liberar espacio en disco y eliminar archivos temporales

Supervisar posibles fallos del RAID

  • Condición: estado del RAID
  • Umbrales: crítico y no crítico para todos los atributos
  • Acción: crear un ticket e investigar

Supervisar un uso elevado del disco durante periodos prolongados

  • Condición: uso del disco
  • Umbrales: 90 % o más para reducir las alertas innecesarias; también es habitual utilizar un umbral del 95 % o más durante periodos de 30 o 60 minutos
  • Acción: crear un ticket e investigar

Supervisar niveles elevados de actividad del disco

  • Condición: tiempo activo del disco
  • Umbrales: superior al 90% durante 15 minutos
  • Acción: crear un ticket e investigar

Supervisar un uso elevado de la memoria

  • Condición: uso de memoria
  • Umbrales: superior al 90% durante 15 minutos
  • Acción: crear un ticket e investigar

Banner: ¿quieres convertirte en un Ninja de TI?

Supervisión de aplicaciones

Lista de comprobación para la supervisión de aplicaciones

Comprobar si las aplicaciones necesarias están instaladas en un endpoint

  • Condición: software
  • Uso:
    • aplicaciones de negocio del cliente (p. ej., AutoCAD, SAP, Photoshop)
    • herramientas de productividad del cliente (p. ej., Zoom, Microsoft Teams, Dropbox, Slack, Office, Acrobat)
    • herramientas auxiliares del cliente (p. ej., TeamViewer, CCleaner, AutoElevate, BleachBit)
  • Acción: marcar las aplicaciones que falten para revisarlas o desplegarlas automáticamente cuando proceda

Supervisar si las aplicaciones y los servicios críticos están en ejecución, especialmente en servidores

  • Condición: proceso o servicio
  • Umbral: inactivo durante al menos 3 minutos
  • Ejemplos de procesos:
    • en estaciones de trabajo: TeamViewer, RDP, DLP
    • en un servidor Exchange: MSExchangeServiceHost, MSExchangeIMAP4, MSExchangePOP3
    • en un servidor de Active Directory: Netlogon, dnscache, rpcss
    • en un servidor SQL: mssqlserver, sqlbrowser, sqlwriter
  • Acción: reiniciar el servicio o proceso

Supervisar el consumo de recursos de aplicaciones que puedan causar problemas de rendimiento

  • Condición: recursos del proceso
  • Umbral: 90 % o más durante al menos 5 minutos
  • Ejemplos de procesos: Outlook, Chrome, y TeamViewer
  • Acción:
    • crear un ticket e investigar
    • deshabilitar el inicio automático

Supervisar bloqueos de aplicaciones

  • Condición: evento de Windows
  • Origen: Aplicación Hang
  • ID de evento: 1002
  • Acción: crear un ticket e investigar

 

Supervisión de redes

Lista de comprobación para la supervisión de la red

Supervisar un uso inusual de la red

  • Condición: uso de la red
  • Dirección: saliente
  • Umbral: en función del tipo de endpoint y de la capacidad de la red
    • cada servidor debe tener su propio umbral en función del uso que se le dé
    • en las estaciones de trabajo, el umbral de supervisión de la red debe ser lo bastante alto como para generar una alerta únicamente cuando el uso pueda poner en riesgo el funcionamiento de la red del cliente
  • Acción: crear un ticket e investigar

Asegurarse de que los dispositivos de red están activos

  • Condición: dispositivo sin conexión
  • Duración: 3 minutos

Supervisar la disponibilidad de determinados puertos de red

  • Condición: monitor de la nube
  • Puertos: 80 (HTTP), 443 (HTTPS), 25 (SMTP), 21 (FTP)

Supervisar la disponibilidad del sitio web del cliente

  • Supervisión: ping
  • Destinatario: sitio web del cliente
  • Condición: 5 intentos fallidos
  • Acción: crear un ticket e investigar

 

Supervisión básica de seguridad

Lista de comprobación básica para la supervisión de la seguridad

Identificar si se ha desactivado el Firewall de Windows

  • Condición: evento de Windows
  • Origen del evento: sistema
  • ID de evento: 5025
  • Acción: activar el Firewall de Windows

Comprobar si las herramientas antivirus y de seguridad están instaladas y/o en ejecución en un endpoint

  • Condición: software
  • Presencia: no detectado
  • Ejemplos de software: Huntress, Cylance, Threatlocker, Sophos
  • Acción: automatizar la instalación del software de seguridad que falte
  • Condición: proceso o servicio
  • Estado: Inactivo
  • Ejemplos de procesos: threatlockerservice.exe, EPUpdateService.exe
  • Acción: reiniciar el proceso

Supervisar las amenazas detectadas por soluciones antivirus/EDR no integradas

  • Condición: evento de Windows
  • Ejemplo: Sophos
  • Origen del evento: Sophos antivirus
  • ID de eventos: 6, 16, 32, 42

Supervisar los intentos fallidos de inicio de sesión y los bloqueos de cuentas

  • Condición: evento de Windows
  • Origen del evento: Microsoft-Windows-Security-Auditing
  • ID de eventos: 4625, 4740 (cuentas locales; 644 solo se aplica a sistemas antiguos con Windows Server 2003)
  • Acción: crear un ticket e investigar

Supervisar la creación de cuentas de usuario y los cambios en la pertenencia a grupos con privilegios

  • Condición: evento de Windows
  • Origen del evento: Microsoft-Windows-Security-Auditing
  • ID de eventos: 4720, 4732, 4729
  • Acción: crear un ticket e investigar 

Identificar si las unidades de un endpoint están cifradas/no cifradas

  • Condición: resultado de script
  • Script (personalizado): Check Encryption Status
  • Acción: crear un ticket e investigar

Supervisar fallos en las copias de seguridad (NinjaOne Backup)

  • Actividad: NinjaOne Backup
  • Nombre: tarea de copia de seguridad fallida

Supervisar fallos de copia de seguridad (otros proveedores de copias de seguridad)

  • Condición: evento de Windows
  • Ejemplo de origen/Id. (Veeam):
    • Origen del evento: Agente Veeam
    • ID de evento: 190
    • El texto contiene: fallido
  • Ejemplo de origen/Id. (Acronis):
    • Origen del evento: sistema de copia de seguridad en línea
    • ID de evento: 1
    • El texto contiene: fallido

4 claves para mejorar la supervisión en tu MSP

  1. Crea una plantilla base para supervisar el estado de los dispositivos.
  2. Habla con tus clientes sobre sus prioridades.
    1. ¿Qué servidores y estaciones de trabajo son importantes?
    2. ¿Cuáles son sus aplicaciones críticas de negocio o productividad?
    3. ¿Qué problemas de TI les afectan más?
  3. Supervisa tu PSA/sistema de tickets para detectar problemas recurrentes. Ajusta también las alertas para evitar la generación innecesaria de tickets.
  4. Supervisa los registros de eventos de tus clientes para detectar problemas recurrentes.

Buenas prácticas para gestionar tickets y alertas 

  1. Genera alertas solo para situaciones que requieran una acción concreta. Si una condición supervisada no requiere una respuesta definida, considera registrarla únicamente con fines informativos en lugar de generar una alerta.
  2. Clasifica las alertas para que se dirijan a distintos paneles de servicio de tu PSA según el tipo o la prioridad.
  3. Programa revisiones periódicas de las alertas para responder a las siguientes preguntas:
    • ¿Qué alertas generan más notificaciones innecesarias? ¿Se pueden eliminar o limitar su alcance?
    • ¿Qué aspectos no se están supervisando o deberían generar notificaciones y no lo hacen?
    • ¿Qué incidencias habituales detectadas mediante alertas pueden corregirse automáticamente?
    • ¿Hay algún proyecto previsto que pueda generar alertas?
  1. Cierra los tickets y elimina las alertas una vez que se hayan resuelto.
    • En NinjaOne, muchas condiciones incluyen las opciones «Restablecer cuando deje de cumplirse» o «Restablecer cuando no se cumpla durante un periodo de x», que ayudan a cerrar las notificaciones cuando la condición se resuelve por sí sola.

Más ideas para la supervisión en MSP

Consulta la excelente serie de Kelvin Tegelaar sobre supervisión remota con PowerShell. Explica cómo supervisar desde el tráfico de red y el estado de Active Directory hasta los intentos fallidos de inicio de sesión en Office 365, los resultados de Shodan y mucho más. Y, lo mejor de todo, comparte scripts de PowerShell diseñados para funcionar con cualquier solución RMM. También puedes consultar nuestra entrada del blog sobre las diferencias entre PowerShell y el símbolo del sistema (CMD), y cuándo utilizar cada uno.

Además, si buscas una solución que te ayude a automatizar la supervisión de todos tus activos de TI, la solución de gestión de activos de TI de NinjaOne ofrece una visión completa y en tiempo real de tus recursos y te permite gestionar el software de tus endpoints a gran escala. Descubre NinjaOne en acción con una demo o regístrate para probar el software gratis.

Banner: ¿quieres convertirte en un Ninja de TI?

FAQs

La supervisión proactiva para MSP utiliza la automatización para controlar en tiempo real el estado de los dispositivos, las redes, las aplicaciones y los eventos de seguridad. Al detectar los problemas a tiempo, los MSP pueden reducir el tiempo de inactividad y el exceso de tickets, y resolver las incidencias antes de que afecten a los usuarios finales.

Entre los principales se encuentran el tiempo de actividad de los sistemas, el estado de los discos, el uso de la CPU y la memoria, los picos de consumo de ancho de banda, los fallos en las copias de seguridad, el estado del firewall y el antivirus, los intentos fallidos de inicio de sesión y los cambios no autorizados en las cuentas de usuario. Supervisar estos aspectos ayuda a los MSP a mantener entornos de TI fiables.

La automatización reduce la fatiga por alertas al generar únicamente aquellas que requieren una intervención, clasificar los tickets por prioridad y corregir automáticamente problemas habituales, como reiniciar servicios o liberar espacio en disco. De este modo, los MSP pueden centrarse en los incidentes de mayor prioridad.

Los MSP pueden automatizar la supervisión de firewalls deshabilitados, herramientas de protección de endpoints ausentes o inactivas, el estado del cifrado de las unidades, los intentos fallidos de inicio de sesión y los eventos de seguridad generados por soluciones como Sophos o ThreatLocker. Cuando sea apropiado, la corrección automatizada también puede restablecer las configuraciones de seguridad esperadas ante problemas habituales.

Las plataformas de supervisión y gestión remotas (RMM), como NinjaOne, permiten a los MSP automatizar la supervisión de dispositivos, detectar riesgos de seguridad, controlar el estado del software y corregir problemas habituales de TI a gran escala, reduciendo así el trabajo manual.

Empieza con una plantilla base que cubra los aspectos fundamentales: tiempo de actividad de los dispositivos, estado de los discos, disponibilidad de los servicios críticos, intentos fallidos de inicio de sesión y estado de las tareas de copia de seguridad. A partir de ahí, añade comprobaciones específicas para cada aplicación y cliente en función de sus sistemas críticos y de los problemas que más les preocupan.

No intentes supervisarlo todo desde el principio: una alerta para la que no existe una respuesta definida solo genera ruido. Los MSP más eficaces entienden la supervisión como un proceso en constante evolución. Revisan los tickets recurrentes para detectar carencias, eliminan las comprobaciones que generan demasiadas alertas innecesarias y automatizan gradualmente la corrección de los problemas que aparecen con mayor frecuencia.

Quizá también te interese…

¿Listo para simplificar los aspectos más complejos de las TI?