Glosario de Automatización • Un sitio vs redundancia geográfica

Redundancia de un solo sitio vs geográfica para SCADA

Ingeniería Merobix • • 7 min de lectura

Un par de servidores redundantes en un rack sobrevive a un servidor muerto. No sobrevive a que el cuarto se inunde, a que el sitio pierda energía o a un incendio en el edificio. Esta página compara mantener la redundancia dentro de un solo sitio contra repartirla en dos ubicaciones geográficamente separadas, para que usted decida si un segundo sitio protege contra un evento creíble o contra uno tan raro que sale más barato aceptarlo.

Volver al glosario

Un sitio vs redundancia geográfica en una línea: La redundancia de un solo sitio pone ambos servidores en una ubicación y sobrevive la falla de un nodo pero no una pérdida a nivel de sitio como incendio, inundación o falla del suministro eléctrico. La redundancia geográfica coloca un respaldo en una segunda ubicación y sobrevive la pérdida de todo el sitio primario, al costo de un enlace WAN de replicación y mayor latencia. Elija un segundo sitio cuando perder la ubicación primaria sea un evento creíble que usted no puede tolerar, no por defecto.

Separe la falla de nodo de la falla de sitio

Los dos diseños protegen contra clases distintas de evento, y confundirlas es la raíz de la mayoría de las malas decisiones aquí. Un par redundante en un solo sitio, el patrón de un par de servidores redundantes para SCADA, protege contra la muerte de un servidor. Ambas máquinas comparten el cuarto, la alimentación, la bajada de red y el techo, así que cualquier evento que se lleve ese contexto compartido se lleva ambos nodos a la vez. La redundancia de nodo es protección real contra la falla de nodo y ninguna protección contra la falla de sitio.

La redundancia geográfica, descrita en el explicador de la redundancia geográfica para SCADA, coloca un servidor de respaldo o un sistema completo en una ubicación físicamente separada, de modo que la pérdida del sitio primario - por incendio, inundación, pérdida prolongada de energía o un corte de red - no termine la operación supervisora. El precio es que los dos sitios deben enlazarse por una red de área amplia, que agrega latencia, un costo recurrente y su propio modo de falla: el mismísimo enlace entre los sitios puede caerse mientras ambos siguen sanos, lo que reintroduce el problema de split-brain a través de un cable mucho más largo.

Compare los dos alcances de redundancia

La tabla separa lo que compra en realidad cada alcance, porque un proyecto que pagó redundancia de nodo suele creer, erróneamente, que pagó recuperación ante desastres.

FactorRedundancia de un sitioRedundancia geográfica
Sobrevive la falla de un servidor
Sobrevive la pérdida de energía del sitioNo
Sobrevive incendio o inundación en el sitioNo
Enlace entre nodosRed local - rápidaWAN - más lenta, costo recurrente
ReplicaciónLocal, baja latenciaA distancia, hay que planear el rezago
Modo de falla nuevoPérdida del enlace localPartición WAN y split-brain entre sitios
Correcto cuandoLa pérdida del sitio no es una preocupación de diseñoPerder el sitio primario es creíble e intolerable

La redundancia geográfica también obliga a una decisión de consistencia de datos que el diseño de un solo sitio mayormente evita. La replicación síncrona a través de una WAN frena cada escritura al tiempo de ida y vuelta del enlace, mientras que la asíncrona es rápida pero arriesga perder los últimos segundos de datos si el primario muere antes de que el respaldo lo alcance. Ninguna es incorrecta; la elección depende de si un pequeño hueco de datos en el momento del desastre es aceptable para su deber de registro.

El failover mismo es más difícil entre sitios. Un corte entre sitios suele involucrar redirigir clientes, restablecer las comunicaciones de campo desde la segunda ubicación y confirmar que el respaldo tiene datos vigentes, así que el simulacro de failover de un diseño geográfico es un ejercicio mayor que un cambio local de rack y debe practicarse en serio, incluido el caso de WAN caída.

Cuándo se justifica cada alcance

La redundancia de un solo sitio es el alcance correcto cuando una pérdida a nivel de sitio no forma parte de su modelo de amenazas o está cubierta de otra manera. Muchas plantas aceptan que un evento catastrófico del sitio significa un paro ordenado y no una operación remota continua, y para ellas pagar un segundo centro de control protege contra un evento cuya respuesta correcta es detenerse, no seguir corriendo. Si un incendio en la sala de control significa que la planta se está evacuando de todos modos, la continuidad supervisora remota compra poco.

La redundancia geográfica se justifica cuando la operación continua a través de la pérdida del sitio primario es genuinamente requerida. Las salas de control de ductos con un deber regulatorio de mantener la supervisión, las operaciones que abarcan regiones y no pueden pausar, y cualquier sistema donde la ubicación primaria está expuesta a un riesgo regional creíble pertenecen aquí. El segundo sitio protege un requisito específico y enunciable de seguir vigilando y controlando incluso después de que la primera ubicación se fue.

Hay una postura intermedia más ligera que vale la pena nombrar: un solo sitio activo más respaldos fuera del sitio y un plan de reconstrucción documentado. Esto no es redundancia geográfica, porque la recuperación toma horas y no segundos, pero protege los datos contra la pérdida del sitio sin un segundo centro de control completo. Para sitios que no deben perder la historia pero pueden tolerar una interrupción de reconstrucción, el respaldo fuera del sitio es la respuesta honesta y mucho más barata.

Trampas del diseño geográfico

La trampa distintiva es creer que la redundancia de nodo es recuperación ante desastres. Un par redundante bellamente diseñado en un solo cuarto da a la organización la confianza falsa de estar protegida contra una inundación o un incendio que se llevará ambos servidores juntos. Declare con claridad qué eventos sobrevive de verdad su redundancia, y si la pérdida del sitio está en el alcance, la redundancia debe cruzar sitios o al menos los datos deben vivir fuera del sitio.

Una segunda trampa es ignorar la WAN como modo de falla. El enlace entre dos sitios es más lento y menos confiable que un cable de rack, y cuando se particiona, ambos sitios pueden estar sanos pero incapaces de coordinarse, produciendo split-brain entre sitios a menos que un testigo de quórum en una tercera ubicación arbitre. La trampa final es elegir replicación síncrona sin contabilizar su costo de latencia, con lo que cada escritura espera a la WAN y el sistema se siente lento, o elegir asíncrona sin aceptar que un desastre puede costarle los últimos segundos de datos sin replicar.

Preguntas frecuentes

¿Un par de servidores redundantes protege contra un desastre del sitio?

No. Un par redundante en una ubicación sobrevive la falla de un servidor, pero comparte el cuarto, la energía y el edificio con su compañero, así que un incendio, una inundación o una pérdida prolongada de energía se lleva ambos servidores juntos. Sobrevivir la pérdida de todo el sitio requiere redundancia geográfica en dos ubicaciones, o como mínimo respaldos fuera del sitio con un plan de reconstrucción. La redundancia de nodo y la recuperación ante desastres son protecciones distintas que resuelven problemas distintos.

¿Qué agrega la redundancia geográfica sobre un solo sitio?

Coloca un sistema de respaldo en una ubicación físicamente separada, de modo que la pérdida del sitio primario no termine la operación supervisora. Eso sobrevive incendio, inundación y falla de suministro en una ubicación, al costo de un enlace WAN con mayor latencia y gasto recurrente, una decisión de consistencia de replicación y un failover más difícil que redirige clientes y comunicaciones de campo al segundo sitio. Se justifica cuando operar a través de una pérdida de sitio es un requisito real.

¿El respaldo fuera del sitio es una alternativa más barata a un segundo sitio?

Para muchas operaciones, sí. Los respaldos fuera del sitio más un plan de reconstrucción documentado protegen el historiador y la configuración contra una pérdida del sitio sin financiar un segundo centro de control completo. La recuperación toma horas y no segundos, así que no es redundancia geográfica, pero evita la pérdida permanente de datos. Elíjalo cuando no deba perder la historia pero pueda tolerar una interrupción de reconstrucción tras un desastre en lugar de necesitar un corte sin costuras.

Fuentes y lecturas

Referencias primarias de los organismos de normas y reguladores que definen este tema:

Más en Fundamentos de SCADA
Redundancia geográfica  •  Telemetría de doble ruta  •  Dimensionar panel solar (SCADA remoto)  •  Días de autonomía  •  SCADA en sitio vs en la nube  •  Todo en Fundamentos de SCADA →
Capacitación SCADA gratuita para operadores
Merobix University - 70 lecciones en video y 261 preguntas de examen, del primer inicio de sesión a los reportes de cumplimiento (contenido en inglés). Sin llamada de ventas.
Comenzar gratis →