Volver a la wiki

Guía de Troubleshooting con CNS/ITSM

Guía de Troubleshooting con CNS/ITSM

Para: Operadores de red y administradores de infraestructura Sistema: CreaRack Network Sentinel (CNS) + ITSM Última actualización: 17-03-2026


1. Introduccion

CreaRack Network Sentinel (CNS) es el sistema de inteligencia artificial que monitorea tu infraestructura de red en tiempo real. Cuando detecta una anomalía (pérdida de paquetes, latencia elevada, errores de interfaz, caídas de clientes WiFi, etc.), genera un Insight: un diagnóstico completo con causa raíz, nivel de riesgo, y comandos recomendados para resolver el problema. El módulo ITSM complementa al CNS proporcionando gestión de incidentes: políticas SLA, notificaciones, escalamiento, y documentación de problemas conocidos.

CNS está disponible en tres páginas de monitoreo, cada una mostrando solo los insights relevantes a sus dispositivos:

PáginaDispositivos monitorizados
ObservatoryElectrónica de red (switches, routers, firewalls) + targets manuales
WirelessAccess Points WiFi
UPS MonitorSistemas de alimentación ininterrumpida

2. El ciclo de vida de un Insight

Cada insight pasa por un ciclo de vida desde que se detecta la anomalía hasta su resolución:

   Anomalía detectada por el Agent
              │
              ▼
        ┌──────────┐
        │ PENDING  │ ← El insight espera acción del operador
        └────┬─────┘
             │
     ┌───────┼──────┐────────────┐
     │              │            │
     ▼              ▼            ▼
┌───────────┐ ┌────────────┐ ┌─────────┐
│ APPLIED   │ │ACKNOWLEDGED│ │ EXPIRED │
│(commands  │ │(operador   │ │(4h sin  │
│ejecutados)│ │ confirma)  │ │ acción) │
└────┬──────┘ └────────────┘ └─────────┘
     │
     ├── OK ──→ APPLIED (éxito)
     └── Error → FAILED (fallo)

Significado de cada estado

EstadoQué significaQué puedes hacer
PendingEl sistema ha diagnosticado un problema y espera tu decisiónVer detalles, Aplicar fix, Hacer preguntas (Explain), Acknowledge
ExecutingLos comandos se están ejecutando en el dispositivoEsperar resultado (el insight está bloqueado)
AppliedLos comandos se ejecutaron correctamenteVerificar resultado, hacer rollback si es necesario
AcknowledgedHas confirmado que revisaste el insightCaso cerrado. Visible en History
ExpiredPasaron 4 horas sin acciónSe archiva automáticamente. Consultable en History
FailedLa ejecución de comandos fallóReintentar, aplicar rollback, o acknowledge

3. Cuando aparece un Insight

Cuando el sistema detecta una anomalía, recibirás tres señales visuales:

Notificacion toast

Un mensaje emergente aparece brevemente en la esquina superior derecha con el nivel de riesgo y un resumen:

Punto pulsante en el sidebar

Junto al nombre del dispositivo afectado aparece un punto pulsante de color:

Si un dispositivo tiene múltiples insights activos, el punto muestra el color del más severo.

Contador en la barra de stats

La pestaña CNS actualiza los contadores en la barra superior. El número de insights “Pending” aumenta.


4. Ejemplo 1: Insight de alta prioridad (HIGH)

Escenario: Un Access Point pierde conectividad con varios clientes WiFi.

Paso 1: Recibes la alerta

Estás en la página Wireless Monitor. Aparece un toast rojo: “AI Insight [HIGH]: AP-Nodal — Client disconnect storm”. Un punto rojo pulsante aparece junto a “AP-Nodal” en el sidebar.

Paso 2: Abres la pestaña CNS

Haces clic en la pestaña CNS en la barra superior. Ves la barra de stats con 1 insight Pending. En la tabla aparece:

CaseRiskTargetSummaryStatus
CNS-000127HIGHAP-Nodal (192.168.230.2)Client disconnect storm — 15 clients dropped in 2 minutespending

Paso 3: Revisas el detalle

Haces clic en Details. Se abre el modal con:

Paso 4: Haces una pregunta (Explain)

Antes de aplicar, quieres más contexto. Escribes: “¿Cuántos usuarios están afectados ahora mismo?” y haces clic en Explain. El sistema responde con un análisis contextual basado en la telemetría actual.

Paso 5: Aplicas el fix

Decides aplicar los comandos. Haces clic en Apply Fix. El estado cambia a “Executing”. Tras unos segundos, el Agent ejecuta los comandos via SSH y reporta éxito. El estado cambia a Applied.

Paso 6: Verificas el resultado

Revisas que los clientes se reconectan. Todo funciona. El insight queda como Applied y se archivará tras 4 horas.


5. Ejemplo 2: Insight informativo (LOW)

Escenario: Un router muestra un pico temporal de latencia.

Paso 1: Notificacion

Toast azul: “AI Insight [LOW]: Router Casa — Latency spike to 180ms”. Punto azul pulsante en el sidebar de Observatory.

Paso 2: Revisas el detalle

Abres CNS, clic en Details. El insight muestra:

Paso 3: Acknowledges con nota

Como el problema es del ISP y no puedes actuar, haces clic en Acknowledge. Aparece un campo de texto donde escribes: “Pico de latencia ISP. Abierto ticket #4521 con proveedor.” Confirmas.

El insight pasa a estado Acknowledged con tu nota visible para el equipo.


6. Ejemplo 3: Insight que expira

Escenario: Error temporal de CRC en una interfaz que se autocorrige.

Lo que pasa

  1. El Agent detecta errores CRC elevados en un puerto del switch
  2. Se genera un insight MEDIUM: “Interface CRC errors above threshold”
  3. Antes de que nadie actúe, los errores vuelven a niveles normales
  4. Pasan 4 horas → el insight cambia automáticamente a Expired
  5. El insight desaparece de la vista principal pero queda consultable en History

Cuándo es normal que expiren

Si ves muchos insights expirando para el mismo dispositivo, considera ajustar los umbrales del Agent o documentarlo como Known Issue en ITSM.


7. Trabajando con la tabla CNS

Barra de estadísticas

Los 5 contadores en la parte superior son clickables. Al hacer clic en un contador, la tabla se filtra automáticamente por ese estado. Clic de nuevo para quitar el filtro.

ContadorSignificado
TotalTodos los insights (sin filtro)
PendingEsperando acción del operador
ExecutingComandos en ejecución
AppliedComandos ejecutados con éxito
AcknowledgedConfirmados por un operador
Success RatePorcentaje de insights aplicados vs total

Filtros disponibles

Acciones de la toolbar

Paginacion

La tabla muestra 25 insights por página. Usa los botones Prev/Next o los números de página.

Cada página muestra solo sus dispositivos


8. El modal de detalle

Al hacer clic en Details o en el resumen de un insight, se abre el modal con toda la información:

Campos principales

CampoQué te dice
SummaryDiagnóstico en una frase. Qué está pasando
Root CausePor qué está pasando. Causa técnica identificada por la IA
ConfidenceDel 0% al 100%. Cuánto confía la IA en su diagnóstico. >80% es fiable. <50% revisa manualmente
Risk LevelHIGH (crítico), MEDIUM (degradación), LOW (informativo)
OSI LayerCapa de red afectada (1=Físico, 2=Enlace, 3=Red, 4=Transporte, 7=Aplicación)
TelemetryDatos de monitoreo que provocaron la alerta (valores SNMP, latencia, etc.)
Action LabelAcción recomendada en lenguaje natural (ej: “Restart BGP session”)
CommandsLista numerada de comandos SSH que el sistema puede ejecutar
RollbackComandos para deshacer el fix si algo sale mal

Badges ITSM

Si tienes ITSM configurado, verás badges adicionales:

BadgeSignificado
SLA Ack (verde)Tiempo para acknowledgar: cumplido
SLA Ack (rojo)Tiempo para acknowledgar: VENCIDO
SLA Resolve (verde/rojo)Tiempo para resolver: cumplido/vencido
Escalation L2El insight se ha escalado al nivel 2 (SLA vencido)
Known Issue: [titulo]Coincide con un problema conocido documentado
Runbook: [titulo]Existe un procedimiento paso a paso aplicable
Group: [titulo]Este insight forma parte de un incidente correlacionado

Botones de accion

BotónCuándo usarlo
Apply FixCuando confías en el diagnóstico y quieres ejecutar los comandos
AcknowledgeCuando has revisado el insight pero no necesitas ejecutar comandos
ExplainCuando necesitas más contexto antes de decidir
ReviseCuando crees que el diagnóstico puede mejorar con tu feedback

9. Preguntar al sistema (Explain)

La función Explain te permite hacer preguntas contextuales sobre cualquier insight. La IA tiene acceso completo al contexto del insight (datos SNMP, diagnóstico, comandos, historial) y responde en base a esa información.

Ejemplos de preguntas útiles

PreguntaCuándo hacerla
“¿Qué otros dispositivos podrían estar afectados?”Cuando sospechas un problema en cascada
“¿Esto puede esperar a mañana?”Para evaluar urgencia
“¿Cuál es el riesgo de aplicar estos comandos?”Antes de ejecutar un fix
“¿Hay alguna alternativa menos invasiva?”Si los comandos te parecen agresivos
“Explícame la causa raíz en términos simples”Si el diagnóstico es muy técnico
“¿Esto ha ocurrido antes en este dispositivo?”Para detectar patrones

Historial de conversacion

Cada pregunta y respuesta se guarda permanentemente en el insight. Si otro operador abre el mismo insight, verá todas las preguntas anteriores y las respuestas. Esto facilita el traspaso entre turnos.

El número entre paréntesis junto al resumen (ej: “(3)”) indica cuántas preguntas se han hecho sobre ese insight.


10. Configuracion ITSM

La pestaña ITSM contiene la configuración organizacional del sistema de gestión de incidentes. Estas configuraciones son compartidas en toda la organización (aplican a todas las páginas por igual).

SLA Policies (Acuerdos de Nivel de Servicio)

Define cuánto tiempo tiene el equipo para responder a cada nivel de riesgo:

Risk LevelAck (Acknowledgar)Resolve (Resolver)
HIGH15 minutos60 minutos
MEDIUM30 minutos240 minutos (4h)
LOW60 minutos480 minutos (8h)

Estos valores son personalizables. Si se excede el tiempo, el insight se marca como “SLA Breached” (incumplido) y se activan las escalaciones.

Para crear las políticas por defecto, haz clic en Initialize Default Policies la primera vez.

Notification Channels (Canales de Notificacion)

Configura dónde recibir alertas cuando ocurren eventos importantes:

TipoUso típico
EmailNotificación al equipo NOC (una o varias direcciones)
SlackCanal de incidentes del equipo (#network-alerts)
Microsoft TeamsCanal de operaciones
WebhookIntegración con sistemas externos (ServiceNow, PagerDuty, etc.)

Cada canal puede filtrarse por nivel de riesgo (ej: solo HIGH y MEDIUM al email del jefe).

Usa el botón Test para verificar que la configuración funciona antes de confiar en ella.

Escalation Policies (Políticas de Escalamiento)

Define qué pasa cuando se incumple un SLA:

Cada nivel tiene un canal de notificación y un retraso configurable.

Maintenance Windows (Ventanas de Mantenimiento)

Programa periodos donde NO quieres recibir alertas:

Known Issues (Problemas Conocidos)

Documenta problemas recurrentes y sus soluciones:

Runbooks (Procedimientos)

Guías paso a paso para resolver tipos específicos de problemas:

Cuando un insight coincide con un runbook, aparece el badge “Runbook” en el detalle con enlace al procedimiento completo.


11. Patrones recurrentes y Grupos de incidentes

Patrones recurrentes

El sistema analiza automáticamente si un mismo dispositivo genera insights repetidos. Si detecta un patrón (mismo trigger, mismo dispositivo, frecuencia regular), lo muestra en la sección Recurring Patterns:

Puedes marcar un patrón como Acknowledged para indicar que eres consciente de él. Los patrones no reconocidos se destacan visualmente.

Grupos de incidentes

Cuando múltiples insights ocurren al mismo tiempo y comparten la misma causa raíz, el sistema los agrupa automáticamente:


12. Referencia rapida

Estados y colores

EstadoColorAccion disponible
PendingAzulDetails, Apply, Acknowledge, Explain
ExecutingNaranjaSolo lectura (esperando resultado)
AppliedVerdeRollback, Acknowledge
AcknowledgedGrisSolo lectura (caso cerrado)
ExpiredGris oscuroSolo lectura (consultable en History)
FailedRojoReintentar, Rollback, Acknowledge

Niveles de riesgo

NivelColorSignificadoTiempo SLA típico
HIGHRojoServicio interrumpido o degradación severaAck: 15 min, Resolve: 1h
MEDIUMNaranjaDegradación parcial del servicioAck: 30 min, Resolve: 4h
LOWAzulInformativo, sin impacto inmediatoAck: 1h, Resolve: 8h

Atajos y consejos

AccionCómo
Filtrar por un estadoClic en el contador de la barra de stats
Buscar un caso específicoEscribe “CNS-000042” o solo “42” en el buscador
Ver solo insights críticosSelecciona “HIGH” en el filtro de Risk Level
Exportar para informeClic en “Export CSV” (respeta los filtros activos)
Ver historial de casos cerradosClic en “History”
Ir a configuración ITSMClic en “ITSM Settings” en la toolbar CNS
Hacer pregunta sobre un insightAbre Details → escribe pregunta → clic Explain

Anomalías que detecta el sistema

Tipo de anomalíaUmbral típicoRiesgo habitual
Pérdida de paquetes>10%HIGH
Latencia elevada>200msMEDIUM
Errores CRC en interfaz>100/minMEDIUM
Caída de clientes WiFi>30% en 5 minHIGH
Interfaz downLink downHIGH
Saturación de ancho de banda>90% capacidadMEDIUM
Pico de temperatura>70°CLOW-MEDIUM

Mantenido por: Equipo CreaRack Última actualización: 17-03-2026

Véase también

Subir