En un clúster de virtualización, el almacenamiento es la decisión que arrastra a todas las demás: marca el rendimiento que sentirán tus VMs, cuánto sobrevives a un fallo y buena parte del presupuesto. En Proxmox la disyuntiva frecuente es Ceph contra un almacenamiento compartido tradicional, y elegir por moda en lugar de por caso se paga.
Ceph: distribuido, resiliente y exigente
Ceph reparte tus datos, con réplicas, entre los discos de varios nodos del clúster. Su gran virtud es que no tiene un punto único de falla y escala horizontalmente: ¿necesitas más capacidad o rendimiento? Agregas nodos. Puede perder discos —o un nodo entero— y seguir operando.
El costo de esa virtud es lo que muchos subestiman, y conviene ser concreto: Ceph quiere al menos tres nodos, una red dedicada y rápida (10 GbE o más; replica constantemente por red y una red lenta lo estrangula), suficientes discos, y más conocimiento para operarlo. Y con la réplica x3 habitual, de cada 3 TB crudos usas ~1 TB: la resiliencia cuesta espacio. Mal dimensionado, decepciona en rendimiento y culpan a la tecnología cuando el problema fue el diseño.
Almacenamiento compartido tradicional: simple y directo
Una SAN o un NAS compartido al que acceden todos los nodos es más simple de entender y operar, y en clústeres pequeños puede dar baja latencia con menos complicación. Su límite es el reflejo del de Ceph: si no se diseña con redundancia, ese almacenamiento central es un punto único de falla —cae él, cae todo—, y escalar implica reemplazarlo o ampliarlo de forma más rígida.
Cuándo cada uno
- Ceph cuando prevés crecer, quieres eliminar el punto único de falla y tienes (o tendrás) tres o más nodos con red rápida dedicada.
- Compartido tradicional cuando priorizas simplicidad, tu clúster es pequeño y estable, o ya cuentas con una SAN bien diseñada y redundante.
No hay ganador universal, y desconfía de quien te lo pinte así. Es la misma familia de decisiones que hiperconvergencia vs. servidores + SAN, a nivel de almacenamiento del clúster.
El error que hunde a Ceph: la red
El fracaso más común de un Ceph no es el software, es la red. Montarlo sobre la misma red de 1 GbE que usa todo lo demás lo estrangula: como Ceph replica cada escritura entre nodos por la red, esa red se vuelve el cuello de botella y el rendimiento se desploma —y entonces culpan a Ceph—. Un despliegue sano quiere una red dedicada de 10 GbE (o más) solo para el tráfico de almacenamiento. Si no estás dispuesto a esa inversión de red, un almacenamiento compartido tradicional te dará menos dolores que un Ceph mal alimentado.
Ceph es una pieza del clúster: se decide junto con la alta disponibilidad y, si vienes de VMware, con la migración a Proxmox.
La pregunta que conviene hacerse
La pregunta no es "¿cuál es mejor?", sino ¿voy a crecer y a operar esto con equipo que domine el almacenamiento distribuido y una red de 10 GbE, o necesito algo simple y predecible que un clúster pequeño agradezca? Es una de las decisiones que dimensionamos al armar un clúster de alta disponibilidad dentro de nuestros servidores de alto rendimiento.
Preguntas frecuentes
help ¿Qué es Ceph en Proxmox y qué exige?
Es un almacenamiento distribuido que reparte los datos con réplicas entre los discos de varios nodos, sin punto único de falla y con escalado horizontal. Exige al menos tres nodos, una red dedicada rápida (10 GbE o más), suficientes discos y experiencia para operarlo. Con réplica x3, de cada 3 TB crudos usas alrededor de 1 TB: la resiliencia cuesta espacio.
help ¿Cuándo conviene Ceph y cuándo un almacenamiento compartido tradicional?
Ceph conviene si prevés crecer, quieres eliminar el punto único de falla y tienes tres o más nodos con red rápida dedicada. Un almacenamiento compartido (SAN/NAS) conviene por simplicidad, en clústeres pequeños y estables, o si ya tienes una SAN bien diseñada y redundante. Su riesgo es ser un punto único de falla si no se diseña con redundancia.
help ¿Ceph es más lento que una SAN?
Depende del diseño. Ceph replica por la red, así que su rendimiento depende mucho de una red dedicada rápida y de suficientes discos y nodos; mal dimensionado, decepciona. Bien diseñado ofrece rendimiento y resiliencia excelentes. Una SAN dedicada puede dar baja latencia con más facilidad en clústeres pequeños, pero escala de forma más rígida.
Rubén Espinoza es fundador y Director Técnico de IT Experts de México. Trabaja en la industria de TI desde 1998: diseña y opera soluciones de infraestructura, ciberseguridad, continuidad, automatización y tecnología OT para entornos empresariales e industriales. Escribe desde proyectos reales y sistemas en producción.
Ver perfil y todos sus artículos →