Glosario de Automatización • Condición de cerebro dividido

¿Qué es una condición de cerebro dividido en SCADA redundante?

Ingeniería Merobix • • 6 min de lectura

El cerebro dividido es la falla que los sistemas redundantes temen más que un choque ordinario, porque la redundancia misma pensada para proteger el proceso se vuelve en su contra. En lugar de que un servidor falle limpiamente, ambos servidores siguen vivos pero pierden de vista al otro, y cada uno concluye que debería estar a cargo. El resultado son dos maestros comandando el mismo campo sin coordinación. Esta guía explica cómo ocurre una condición de cerebro dividido en un sistema SCADA redundante, el peligro que plantea al equipo de planta, y las defensas estándar que la previenen.

Volver al glosario

Condición de cerebro dividido en una línea: Una condición de cerebro dividido es una falla de redundancia en la que el enlace de comunicación entre dos nodos se rompe mientras ambos nodos siguen corriendo, así que cada uno concluye que su pareja está muerta y se promueve a primario. El sistema entonces tiene dos primarios activos escribiendo comandos potencialmente en conflicto a los mismos dispositivos de campo. Se previene con desempates como un testigo de quórum, aislamiento (fencing) que aísla a la fuerza a un nodo, y rutas de latido redundantes.

Cómo ocurre un cerebro dividido

Un par redundante depende del enlace entre sus dos nodos para hacer dos trabajos: mantener sincronizado al respaldo, y llevar el latido que le dice a cada nodo que el otro está vivo. La lógica de failover normalmente funciona con una regla simple: si el respaldo deja de escuchar el latido del primario, asume que el primario está muerto y toma el relevo. Esa regla es sólida mientras un latido perdido de verdad signifique un primario muerto. El cerebro dividido es lo que sucede cuando esa suposición se rompe: el enlace mismo falla mientras ambos servidores siguen corriendo. El respaldo deja de escuchar al primario y se promueve, pero el primario no está muerto, también deja de escuchar al respaldo y, desde su punto de vista, todo es normal, así que sigue operando como primario también.

Ahora ambos nodos creen que son el primario. Cada uno está sondeando el campo, cada uno está sirviendo a los operadores, y cada uno está emitiendo comandos, pero ninguno sabe que el otro está haciendo lo mismo porque el enlace que los habría coordinado es justo lo que se rompió. La condición se llama cerebro dividido porque el cerebro único y coordinado del sistema redundante se ha dividido en dos cerebros independientes, cada uno actuando como si fuera el todo. Es crucial que esto no lo cause hardware muerto, lo causan dos nodos sanos incapaces de hablar, que es por lo que la regla ingenua de latido perdido es peligrosa sin salvaguardas adicionales.

El riesgo para el equipo de planta

El peligro del cerebro dividido no es la pérdida de datos, es el control en conflicto. Con dos primarios activos, el campo puede recibir comandos contradictorios de dos orígenes que no coinciden sobre el estado del proceso. Un primario podría abrir una válvula mientras el otro la cierra, uno podría arrancar una bomba que el otro intenta detener, o dos puntos de ajuste podrían pelear entre sí. Como cada primario cree que es la sola autoridad, ninguno cede, y el equipo queda atrapado entre ellos. En un ducto o instalación de proceso, comandos que pelean entre sí pueden llevar el equipo a estados inseguros, causar excursiones de presión o nivel, o desgastar actuadores que se ciclan repetidamente por el conflicto.

Esto es peor que una interrupción limpia de una forma importante. Si un solo servidor simplemente muere, el proceso puede perder la supervisión pero al menos no está siendo mal manejado de forma activa, el campo puede mantener su último estado comandado o dispararse a una condición segura. Un cerebro dividido, por el contrario, significa que el proceso está siendo comandado incorrectamente de forma activa por dos maestros que no coinciden, lo que puede ser más destructivo que ningún comando en absoluto. Por eso los ingenieros tratan el cerebro dividido como un escenario genuinamente temido en lugar de un caso de borde académico, y por eso los diseños redundantes serios se construyen específicamente para hacerlo imposible en lugar de meramente improbable.

Defensas estándar: quórum, aislamiento, y latidos redundantes

La primera defensa es un testigo de quórum: un tercero ligero que ambos nodos pueden alcanzar y que actúa como desempate. Cuando el enlace entre los dos nodos se rompe, cada uno consulta con el testigo, y solo el nodo que tiene el quórum, una mayoría que incluye el voto del testigo, se le permite ser primario. El nodo que no puede formar quórum se hace a un lado en lugar de actuar solo. Como un par de dos nodos puede quedar en punto muerto cuando los nodos no coinciden, agregar un tercer votante impar garantiza una mayoría clara, que es por lo que el testigo es tan efectivo para prevenir el enfrentamiento de doble primario.

La segunda defensa es el aislamiento (fencing): aislar a la fuerza a un nodo que no debería ser primario para que no pueda tocar el campo aunque su software todavía crea que está a cargo. El aislamiento puede cortar el acceso de un nodo a los dispositivos compartidos o apagarlo, eliminando cualquier posibilidad de que siga emitiendo comandos. La tercera defensa son las rutas de latido redundantes, correr el latido sobre más de una ruta independiente, para que una sola falla de enlace no corte toda la comunicación entre los nodos. Si la ruta primaria falla pero una ruta secundaria sobrevive, los nodos todavía saben que el otro está vivo y no ocurre un failover falso. En la práctica estas se ponen en capas: los latidos redundantes hacen raro una pérdida total de comunicación, y un testigo de quórum más el aislamiento aseguran que si ocurre, exactamente un nodo termina como primario. Una plataforma SCADA de nube como Merobix maneja esta coordinación internamente dentro de su propio agrupamiento, así que los clientes obtienen redundancia segura ante el cerebro dividido sin diseñar el quórum y el aislamiento ellos mismos.

Preguntas frecuentes

¿Qué causa una condición de cerebro dividido?

La causa el enlace de comunicación entre dos nodos redundantes que falla mientras ambos nodos siguen vivos. Cada nodo deja de escuchar el latido del otro y concluye erróneamente que su pareja está muerta, así que ambos se promueven a primario. La causa raíz no es hardware muerto sino dos nodos sanos incapaces de hablar, que es por lo que una simple regla de latido perdido es insegura sin salvaguardas adicionales.

¿Por qué es más peligroso el cerebro dividido que una falla normal de servidor?

Porque el proceso no está meramente sin supervisión, está siendo comandado de forma activa por dos maestros que no coinciden. Dos primarios pueden enviar comandos contradictorios al mismo equipo, abriendo y cerrando válvulas o arrancando y deteniendo bombas en conflicto, lo que puede llevar el proceso a estados inseguros. Una falla única limpia al menos deja que el campo mantenga un estado seguro, mientras que el cerebro dividido lo maneja mal de forma activa.

¿Cómo se previene una condición de cerebro dividido en SCADA redundante?

Con tres defensas en capas. Un testigo de quórum da un tercer voto impar para que solo el nodo que tiene una mayoría pueda ser primario, rompiendo el empate. El aislamiento aísla a la fuerza a un nodo que no debería ser primario para que no pueda comandar el campo. Las rutas de latido redundantes corren el latido sobre más de una ruta para que una sola falla de enlace no corte la comunicación y cause un failover falso.

Más en Fundamentos de SCADA
Sondeo redundante  •  Servidor SCADA único vs redundante  •  Conmutación de controlador  •  Agregar un tag en SCADA  •  Configurar alertas por SMS  •  Todo en Fundamentos de SCADA →
Capacitación SCADA gratuita para operadores
Merobix University - 70 lecciones en video y 261 preguntas de examen, del primer inicio de sesión a los reportes de cumplimiento (contenido en inglés). Sin llamada de ventas.
Comenzar gratis →