Glosario de Automatización • Ajustar un temporizador de retención de failover

Cómo ajustar un temporizador de retención de failover

Ingeniería Merobix • • 6 min de lectura

El temporizador de retención (hold-down) de failover es el ajuste que decide cuánto tiempo debe verse mal un enlace antes de que el gateway se dé por vencido con él, y cuánto tiempo debe probarse un enlace recuperado antes de que el gateway vuelva a confiar en él. Demasiado corto, y el gateway rebota con cada parpadeo momentáneo; demasiado largo, y un corte real deja el sitio a oscuras mientras el temporizador cuenta. Este procedimiento es para el técnico que afina un gateway de doble SIM o doble WAN y necesita que el temporizador ignore el ruido pero reaccione a las fallas genuinas.

Volver al glosario

Ajustar un temporizador de retención de failover en una línea: Para ajustar un temporizador de retención de failover, elija una ventana de detección lo bastante larga para dejar pasar los parpadeos momentáneos, un retardo de conmutación que se comprometa con el respaldo solo cuando el primario esté convincentemente caído, y un tiempo de permanencia de retorno (failback) que exija al primario recuperado mantenerse sano antes de regresar. Después pruebe ambos bordes: un parpadeo breve no debe disparar la conmutación y un corte sostenido sí. Alargue el temporizador si el sitio oscila, acórtelo si los cortes se alargan.

Entienda las dos direcciones que gobierna el temporizador

Un temporizador de retención trabaja en ambas direcciones, y confundirlas es la razón usual de que un gateway se porte mal. De ida, fija cuánto tiempo debe verse fallado el primario antes de que el gateway conmute al respaldo, lo que evita que una caída de señal de un instante dispare una conmutación innecesaria. De regreso, fija cuánto tiempo debe mantenerse sano el primario recuperado antes de que el gateway regrese, lo que impide que un primario que revive a parpadeos saque al sitio de un respaldo que funciona antes de tiempo. El problema de oscilación que esto resuelve se describe en la guía del temporizador de retención de failover.

El principio es la histéresis: el umbral para abandonar una ruta y el umbral para volver a ella no deben ser el mismo, para que el gateway no oscile en la frontera. Un enlace que ronda justo el punto de conmutación es exactamente donde un failover ingenuo se sacude, y los tiempos de retención son lo que le da al gateway la memoria para comprometerse con una decisión en lugar de reconsiderarla cada segundo.

Elija valores que le queden al sitio

Fije la ventana de detección contra el comportamiento normal de señal del sitio. Un sitio con un primario limpio y estable puede permitirse una ventana corta porque las caídas reales son raras y decisivas; un sitio cuyo primario es conocido por parpadear necesita una ventana más larga para que el ruido ordinario no se lea como falla. No hay un número universal, porque depende de cómo se comporta de verdad el enlace primario en esa ubicación, así que básese en lo que muestren el sondeo del sitio y las primeras tendencias en lugar de un valor por defecto. El punto es que el temporizador sea más largo que el parpadeo típico del sitio y más corto que un corte que usted consideraría intolerable.

Fije el tiempo de permanencia del retorno con generosidad. Regresar al primario en el instante en que da señales de vida es una causa clásica de oscilación, así que exija que el primario se mantenga sano un periodo significativo y sostenido antes de volver a él. A muchos sitios les va mejor con un failover agresivo y un retorno paciente: aléjese rápido de un primario roto, pero regrese a él solo cuando se haya recuperado con claridad. Si el sitio prefiere quedarse quieto antes que sacudirse, incluso puede optar por sostenerse en el respaldo hasta una ventana de mantenimiento, lo que se relaciona con la lógica más amplia de tiempos de reconexión de la guía sobre el backoff de reconexión para clientes de telemetría.

Pruebe ambos bordes y registre el ajuste

Pruebe el temporizador con dos ensayos. Primero, provoque un parpadeo breve del primario, más corto que la ventana de detección, y confirme que el gateway no conmuta, porque un temporizador que reacciona a un parpadeo está demasiado corto y se sacudirá en servicio. Segundo, provoque un corte sostenido más largo que la ventana y confirme que el gateway sí conmuta y se reconecta a su host, porque un temporizador que ignora un corte real está demasiado largo y deja el sitio a oscuras. Ajuste y repita hasta que el gateway deje pasar el parpadeo y reaccione al corte.

Después pruebe el retorno: restaure el primario y confirme que el gateway regresa solo después del periodo de permanencia, una sola vez y de forma limpia, sin oscilar. Si se sacude, alargue la permanencia del retorno. Este par de pruebas, una corta y una larga, es lo que separa un temporizador de retención que fue configurado de uno que fue verificado.

Registre los tiempos de detección, conmutación y retorno con los que se quedó, y anote el comportamiento del sitio que los justificó. Cuando una plataforma como Merobix grafica después la conectividad del sitio, un gateway que empieza a oscilar a pesar del temporizador le está diciendo que el comportamiento del primario cambió y el ajuste necesita revisarse, mientras que una conmutación única y limpia durante un corte real confirma que el temporizador hace su trabajo. El temporizador se afina una vez; la tendencia le dice cuándo el sitio lo dejó atrás.

Preguntas frecuentes

¿Cuál es un buen tiempo de retención para failover celular?

No hay un valor universal, porque depende de cómo se comporta el enlace primario en el sitio específico. Fije la ventana de detección más larga que el parpadeo momentáneo típico del sitio y más corta que un corte que le resulte intolerable, y fije una permanencia de retorno generosa para que un primario recuperado deba demostrar estabilidad antes de que el gateway regrese a él. Base los números en el comportamiento real de señal del sitio y después pruebe ambos bordes.

¿El failover y el retorno deben usar el mismo temporizador?

No. Usar el mismo umbral en ambas direcciones invita a oscilar en la frontera. Prefiera un failover más rápido, para que un primario roto no deje el sitio a oscuras, y un retorno más lento y paciente, para que un primario que revive a parpadeos no pueda sacar al sitio de un respaldo que funciona. Esa asimetría, una forma de histéresis, es lo que detiene la oscilación.

Mi gateway ignora un corte real. ¿La retención está demasiado larga?

Probablemente sí. Si un corte sostenido no dispara la conmutación, la ventana de detección es más larga que el corte que a usted le importa, así que el sitio queda a oscuras esperando al temporizador. Acorte la ventana de detección hasta que un corte genuino dispare la conmutación, manteniéndola lo bastante larga para ignorar los parpadeos ordinarios, y vuelva a probar ambos bordes.

Fuentes y lecturas

Referencias primarias de los organismos de normas y reguladores que definen este tema:

Más en PLC, RTU, HMI y DCS
Puesta en servicio del temporizador anticiclado  •  POC modo temporizador  •  Registro de trabajador solitario  •  Temporizador deadman  •  Temporizador retentivo (RTO)  •  Todo en PLC, RTU, HMI y DCS →
Capacitación SCADA gratuita para operadores
Merobix University - 70 lecciones en video y 261 preguntas de examen, del primer inicio de sesión a los reportes de cumplimiento (contenido en inglés). Sin llamada de ventas.
Comenzar gratis →