¿Qué es la redundancia geográfica en SCADA?
Servidores redundantes en un cuarto protegen contra un servidor muerto, pero no contra la pérdida del cuarto mismo. Un incendio, una inundación, una falla prolongada de energía o un corte de red en un solo sitio puede tumbar todos los servidores dentro de él a la vez, sin importar cuántos haya. La redundancia geográfica responde a eso al repartir la redundancia entre ubicaciones físicamente separadas, para que un desastre en un sitio no acabe la supervisión. Esta guía explica qué significa la redundancia geográfica para SCADA, cómo una ubicación en espera se mantiene sincronizada a través de una red de área amplia, la latencia y el ancho de banda que exige, y por qué la redundancia de un solo edificio no basta para operadores críticos.
Redundancia geográfica en una línea: La redundancia geográfica es redundancia que abarca ubicaciones físicamente separadas, para que un centro de control en espera o una segunda región de nube puedan seguir supervisando el campo aun si el sitio primario se pierde por un incendio, una inundación, una falla de energía o un corte de red. Los sitios se mantienen sincronizados a través de una red de área amplia, lo que introduce consideraciones de latencia y ancho de banda que la redundancia local no enfrenta. Protege contra desastres de sitio completo que duplicar servidores dentro de un edificio no puede.
Redundancia que abarca ubicaciones separadas
La redundancia local - un par de servidores redundante o un arreglo N+1 dentro de un cuarto de control - protege contra fallas de componentes dentro de ese cuarto. Lo que no puede proteger es la pérdida del cuarto mismo. Si el edificio se inunda, se incendia, pierde energía por un periodo extendido o tiene su red seccionada, cada servidor adentro comparte ese destino, y ninguna cantidad de redundancia en el cuarto ayuda. La redundancia geográfica quita esta exposición compartida al colocar una segunda copia capaz del sistema supervisorio en una ubicación física distinta - un centro de control de respaldo en otro edificio o ciudad, o una segunda región de nube en un área distinta - lo bastante lejos para que un solo desastre local no pueda alcanzar a ambos.
La idea esencial es la diversidad de sitio: las dos ubicaciones no deben compartir los peligros que tumbarían un sitio. Eso significa redes o alimentaciones de energía separadas, rutas de red separadas, y suficiente distancia física para que un evento regional como una inundación o una tormenta sea poco probable de golpear a ambos a la vez. Cuando el sitio primario está sano, hace el trabajo y mantiene al sitio remoto al día; cuando el sitio primario se pierde por completo, la supervisión conmuta al sitio geográficamente separado, que tiene sus propios operadores o su propia ruta para que ellos se conecten. El campo sigue siendo vigilado aunque el cuarto de control primario se haya ido.
Mantenerse en sincronía a través de una WAN: latencia y ancho de banda
Mantener dos sitios sincronizados es más difícil que mantener dos servidores en un cuarto sincronizados, porque el enlace entre ubicaciones es una red de área amplia en lugar de una conexión local rápida. El estado que el sitio primario colecta - valores de tags, alarmas, datos históricos - debe replicarse al sitio remoto a través de esa WAN, y la WAN introduce latencia y tiene ancho de banda finito. La latencia significa que la copia remota va atrás del primario por lo que sea que tome el viaje de ida y vuelta, así que el espejeo instantáneo perfecto no siempre es alcanzable a través de largas distancias; los diseños muchas veces aceptan un pequeño retraso acotado en el sitio remoto como el precio de la separación geográfica.
El ancho de banda moldea qué y con qué frecuencia se puede replicar. Transmitir cada cambio en tiempo real a través de una WAN puede ser costoso, así que los diseños geográficos pesan cuántos datos deben mantenerse actuales en el sitio remoto contra la capacidad y el costo del enlace. Algunos replican el estado en vivo completo de continuo para la toma de control entre sitios más rápida posible; otros replican con menos frecuencia, aceptando una brecha mayor en el sitio remoto a cambio de un enlace más ligero. Este es en el fondo el mismo intercambio que separa el respaldo en caliente, tibio y frío, ahora aplicado a través de la geografía, y es por lo que una conmutación al sitio remoto puede recuperarse con una imagen ligeramente más vieja que una local. La latencia y el ancho de banda de la WAN son las restricciones alrededor de las cuales todo diseño de redundancia geográfica tiene que planear.
Por qué la redundancia de un solo edificio no basta
Para un operador crítico como una empresa de ductos, los eventos que justifican la redundancia en primer lugar incluyen unos que tumban sitios enteros. Un cuarto de control puede perder energía por horas, un edificio puede inundarse, un incendio puede forzar una evacuación, o un corte de fibra puede aislar el sitio del campo por completo. La redundancia de un solo edificio no tiene nada que ofrecer contra ninguno de estos, porque duplica servidores pero no el sitio en que están. Para operaciones donde perder la supervisión carga consecuencias de seguridad y regulatorias, esa brecha es inaceptable, y la redundancia geográfica es lo que la cierra al asegurar que una capacidad de control funcional sobreviva la pérdida de cualquier ubicación.
Aquí es donde el SCADA de nube ofrece una ventaja estructural. Una plataforma como Merobix corre sobre infraestructura distribuida a través de múltiples regiones y zonas de disponibilidad por diseño, así que la separación geográfica es inherente en lugar de algo que cada operador deba construir. Si una región entera tiene un problema, la presencia de la plataforma en otro lado sigue sirviendo, y los operadores - que se conectan por un navegador en lugar de a un edificio específico - simplemente siguen trabajando desde donde estén. Los dispositivos de campo reportan a un punto de nube en lugar de a un cuarto de control físico, así que no hay un solo sitio cuya pérdida acabe la supervisión. Para operadores que sirven petróleo y gas, agua, energía o manufactura a través de áreas amplias, esto convierte la redundancia geográfica de un costoso proyecto de segundo centro de datos en una propiedad del servicio que ya usan.
Preguntas frecuentes
¿En qué se diferencia la redundancia geográfica de un par de servidores redundante local?
Un par redundante local pone dos servidores en el mismo cuarto para sobrevivir una falla de servidor, pero ambos comparten el destino del cuarto: un incendio, una inundación o una pérdida de energía tumba a ambos. La redundancia geográfica coloca una copia capaz del sistema en una ubicación físicamente separada, para que un desastre en un sitio no acabe la supervisión. Protege contra la pérdida de sitio completo, algo que el emparejamiento local no puede.
¿Por qué la redundancia geográfica agrega latencia?
Porque los dos sitios están conectados por una red de área amplia en lugar de un enlace local rápido. Replicar el estado a través de esa distancia toma un viaje de ida y vuelta, así que la copia remota va atrás del primario por lo que sea que tome ese viaje. A través de largas distancias esto significa que el sitio remoto puede sostener una imagen ligeramente más vieja, y los diseños muchas veces aceptan un pequeño retraso acotado como el costo de la separación geográfica verdadera.
¿Necesito construir un segundo centro de datos para tener redundancia geográfica?
No si usa SCADA de nube. Tradicionalmente la redundancia geográfica significaba levantar un segundo centro de control o de datos en otra ubicación y mantenerlo sincronizado, lo cual es caro. Una plataforma de nube corre a través de múltiples regiones y zonas por diseño, así que la separación geográfica está integrada en el servicio: los operadores se conectan por un navegador desde cualquier lado, y la pérdida de ningún sitio físico único acaba la supervisión.
Servicios de automatización
¿Necesita convertir esta información en un sistema que funcione?
Merobix integra SCADA, programa PLC Allen-Bradley y Siemens, y diseña y fabrica tableros de control industrial.
Las solicitudes de reunión se revisan antes de confirmarse.