Volver a la wiki

Incidente: needrestart colgó un job de CI 45 min sin fallar, y crearack-ops-1 llevaba 4 días caído sin aviso

Cuándo

01-09-2026 (v1.97.2, PR #485, commit e5027651). Dos fallos independientes salieron a la luz el mismo día, ambos en la infraestructura de CI que corre en el servidor Hetzner OPS ([[concept—infra—ops-server]]).

Síntomas visibles

  1. Un job del CI estuvo 45 minutos colgado sin fallar nunca — ninguno de los 5 jobs de .github/workflows/ci.yml tenía timeout-minutes (el default de GitHub Actions son 6 horas).
  2. Al restaurar el runner caído (ver más abajo), 4 tests de subida de MIBs empezaron a fallar con PermissionError (500 en vez de 202).
  3. Retroactivamente se descubrió que crearack-ops-1 (uno de los 2 runners self-hosted, [[concept—infra—ops-server]]) llevaba caído por OOM desde el 28-08-2026, cuatro días, sin que nada lo avisara — el CI seguía en verde porque el otro runner absorbía todo el trabajo, a la mitad de velocidad.

Causa raíz

Fix aplicado

Commit e5027651 (PR #485):

Lecciones

Preventivos futuros

Véase también

Subir