Hay una frase que suele aparecer justo antes de una cotización muy grande: "para esto necesitas un clúster de alta disponibilidad". A veces es cierto. A veces es la puerta de entrada a comprar tres veces el hardware que tu operación necesitaba. Separar una cosa de la otra vale mucho dinero, y empieza por entender qué es —y qué exige— la alta disponibilidad de verdad.
Qué es la alta disponibilidad (y qué no)
Alta disponibilidad (HA) en Proxmox significa algo concreto: si un nodo físico muere, las máquinas virtuales que corrían en él se reinician automáticamente en otro nodo, sin que nadie intervenga de madrugada. Ojo con la palabra "reinician": HA no es tolerancia a fallos instantánea —las VMs se caen y vuelven a arrancar en otro lado, con unos minutos de interrupción—. No es magia sin cortes; es recuperación automática y rápida.
Lo que exige sí o sí
- Al menos tres nodos (o dos + testigo): el clúster necesita quórum, una mayoría que decida quién manda si se pierde la comunicación. Con solo dos nodos aparece el "split-brain": ambos creen ser el activo y pueden corromper datos. Se resuelve con un tercer nodo o un dispositivo de desempate (qdevice).
- Almacenamiento compartido o replicado: para que una VM reviva en otro nodo, ese nodo debe poder leer su disco. Sin almacenamiento común (o replicación tipo Ceph), no hay a dónde revivirla.
- Red dedicada y estable para la comunicación del clúster: una red saturada provoca falsos positivos y reinicios innecesarios.
- Fencing: el mecanismo que aísla a un nodo "dudoso" para no arrancar la misma VM dos veces.
Si falta cualquiera, no tienes HA real —tienes varios servidores y una etiqueta—.
Qué te quieren vender de más
El sobredimensionamiento clásico: HA de gama alta para cargas que toleran perfectamente una ventana de recuperación. Ejemplo real: un servidor de archivos interno que puede estar 30 minutos caído sin que el negocio sangre no justifica el costo de un clúster HA de tres nodos con Ceph. La HA es cara en hardware, licencias y complejidad; se reserva para lo que de verdad no puede parar.
Y lo que HA no es: un backup
Un malentendido peligroso: HA protege contra la falla de un nodo, no contra el borrado, la corrupción o el ransomware —eso se replica igual a los demás nodos—. HA y backup resuelven problemas distintos; necesitas ambos.
Cómo se ve una caída con HA (y sin ella)
Un ejemplo concreto vale más que la teoría. Con HA: a las 3:14 a. m. muere la fuente de un nodo. El clúster mantiene quórum con los nodos restantes, detecta la caída, aísla al nodo muerto (fencing) y reinicia sus VMs en otro nodo; en dos o tres minutos los servicios vuelven, y por la mañana solo queda una alerta que revisar. Sin HA: ese mismo nodo se lleva sus VMs hasta que alguien despierta, entra en remoto, diagnostica y las levanta a mano —treinta minutos con suerte, dos horas si el de guardia no contesta—. La diferencia no es tecnología por tecnología: es quién se levanta de madrugada, y cuánto duele mientras tanto.
La pregunta que conviene hacerse
Antes de aprobar un clúster, la pregunta no es "¿quiero alta disponibilidad?" —claro que sí, en abstracto— sino ¿qué cargas de verdad no pueden tolerar una caída de minutos, y estoy pagando HA solo para esas? Dimensionar eso, con la calculadora de dimensionamiento y el diseño correcto, es parte de nuestros servidores de alto rendimiento.
Preguntas frecuentes
help ¿Qué necesito para un clúster Proxmox de alta disponibilidad?
Al menos tres nodos (o dos más un dispositivo de desempate) para mantener quórum y evitar el split-brain, almacenamiento compartido o replicado al que todos accedan, una red dedicada y estable para el clúster, y fencing para aislar nodos dudosos. Sin cualquiera de esos elementos no hay HA real.
help ¿La alta disponibilidad evita toda interrupción?
No. HA reinicia automáticamente las VMs de un nodo caído en otro nodo, con unos minutos de interrupción; no es tolerancia a fallos instantánea sin cortes. Es recuperación automática y rápida, no magia sin caídas.
help ¿Toda mi infraestructura necesita HA?
No. Se justifica para las cargas que no toleran minutos de caída; para las que aguantan una ventana de recuperación (por ejemplo un servidor de archivos que puede estar 30 minutos abajo), la HA añade costo y complejidad sin beneficio proporcional. Se dimensiona por carga, cruzando el costo del downtime contra el del clúster.
help ¿La alta disponibilidad reemplaza al backup?
No. HA protege contra la falla de un nodo físico, pero no contra el borrado, la corrupción o el ransomware, que se replican igual a los demás nodos. HA y backup resuelven problemas distintos y se necesitan ambos.
Rubén Espinoza es fundador y Director Técnico de IT Experts de México. Trabaja en la industria de TI desde 1998: diseña y opera soluciones de infraestructura, ciberseguridad, continuidad, automatización y tecnología OT para entornos empresariales e industriales. Escribe desde proyectos reales y sistemas en producción.
Ver perfil y todos sus artículos →