NOC/SOC OPERATIVO · MONITOREO CONTINUO
IT Experts de México
Contáctanos
Inicio/Herramientas/Calculadora de Capacidad Ceph
Infraestructura & Proxmox HCI

Calculadora de Capacidad Ceph

Ingresa nodos, discos y esquema de redundancia — obtén capacidad útil, tolerancia a fallos de nodo y el margen operativo real que Ceph exige en producción.

Intermedio Actualizada septiembre 2026 100% del lado del cliente
Nodos del clúster
TB

Asume failure domain = host (la práctica estándar): las réplicas o fragmentos se distribuyen entre nodos distintos, no entre discos del mismo nodo.

Esquema de redundancia

Margen operativo

Ceph bloquea escrituras en TODO el clúster cuando un solo OSD cruza su full_ratio (95% por defecto) — no cuando el promedio se llena. Operar por debajo de este umbral deja margen para el desbalance normal entre discos y para reconstruir tras perder un nodo.

Resultado

Con nodos tienes el mínimo estricto para — si un nodo falla, no queda dónde reconstruir la redundancia perdida hasta que regrese. Para producción real, agrega al menos 1 nodo más de margen.

Comparación con los mismos nodos y discos
EsquemaCapacidad útilPrácticaTolerancia
Fórmula utilizada

Estimación de referencia basada en el modelo de capacidad de Ceph (replicación / Erasure Coding con failure domain = host). No sustituye el dimensionamiento con el CRUSH map real, la distribución efectiva de PGs, ni las pruebas de carga sobre el hardware final.


¿Por qué la capacidad "útil" de Ceph no es la capacidad que realmente puedes usar?

Ceph reporta capacidad útil como la matemática pura: capacidad raw dividida entre el factor de redundancia (3 en replicado 3x, o (k+m)/k en Erasure Coding). Pero ese número no es el que deberías planear usar. Ceph bloquea escrituras en todo el clúster cuando un solo OSD —no el promedio, uno solo— cruza su full_ratio (95% por defecto). La distribución de datos entre discos nunca es perfectamente uniforme, así que ese límite se alcanza en algún disco individual antes de que el clúster "en promedio" esté lleno.

Por eso la práctica operativa es mantener el clúster por debajo de 80-85% de su capacidad útil (el nearfull_ratio, que dispara alertas, es 85% por defecto). Ese margen no es desperdicio — es el espacio que necesitas para: (1) el desbalance normal entre OSDs, y (2) reconstruir la redundancia completa después de perder un nodo, sin cruzar el límite de escritura mientras lo haces.

Replicación vs. Erasure Coding: la decisión real

El nodo, no solo el disco, es la unidad de falla que importa

Con failure domain = host, perder un OSD individual es un evento menor — Ceph lo reconstruye automáticamente usando los OSDs restantes del mismo nodo y de otros nodos. El evento que de verdad hay que dimensionar es perder un nodo completo: de golpe salen todos sus OSDs a la vez, y el clúster necesita espacio libre en los nodos restantes para reconstruir esa redundancia perdida. Por eso esta calculadora reporta la tolerancia en nodos, no en discos — es la unidad de riesgo real en un despliegue HCI sobre Proxmox.

El backend de red que carga esa replicación y esa reconstrucción también forma parte del dimensionamiento — una red de 1G se satura con el tráfico de recuperación de un solo nodo caído. 10G dedicado para la red de clúster de Ceph es la práctica estándar, no un lujo.


Preguntas frecuentes

¿Cuántos nodos mínimos necesito para Ceph en producción?
Técnicamente Ceph replicado 3x funciona con 3 nodos, pero con exactamente 3 no hay margen: si uno falla, no queda dónde reconstruir la tercera copia hasta que regrese. Para producción real se recomiendan mínimo 4 nodos — el estándar de facto en despliegues HCI sobre Proxmox VE.
¿Replicado 2x o 3x?
3x es el estándar recomendado por la documentación oficial de Ceph para producción. Con 2x, durante una reconstrucción (tras perder un nodo o disco) los datos quedan con una sola copia — cualquier segunda falla en esa ventana es pérdida de datos real. 2x se acepta en laboratorio o para datos no críticos, nunca como política general de producción.
¿Qué es Erasure Coding y cuándo conviene sobre replicación?
Erasure Coding (EC) divide los datos en k fragmentos y agrega m fragmentos de paridad, tolerando la pérdida de hasta m fragmentos. Con un perfil 4+2 obtienes 66% de eficiencia de espacio contra el 33% de replicado 3x — pero a costa de más CPU y latencia en la reconstrucción. EC conviene para datos fríos o de bajo IOPS (backup, archivo); replicación conviene para el pool de VMs con IOPS alto, que es el caso típico de Proxmox HCI.
¿Por qué no puedo usar el 100% de la capacidad útil de Ceph?
Ceph bloquea escrituras en todo el clúster cuando cualquier OSD individual supera su full_ratio (95% por defecto) — no cuando el clúster en promedio se llena, sino cuando UN disco se llena, y la distribución entre discos nunca es perfectamente uniforme. Por eso la práctica operativa es mantener el clúster por debajo de 80-85% de su capacidad útil, dejando margen para el desbalance normal y para poder reconstruir tras perder un nodo sin cruzar ese límite.
¿El failure domain siempre es por nodo (host)?
No es automático — es una decisión de configuración (CRUSH map), pero es la práctica estándar y la que asume esta calculadora: distribuir las réplicas o fragmentos entre nodos distintos, no entre discos del mismo nodo. Con failure domain a nivel disco, perder un nodo completo (con varios OSDs) puede perder más copias de las que el esquema tolera. Para HCI en Proxmox, failure domain = host es la configuración correcta casi siempre.
¿Cuántos discos por nodo puedo usar en Ceph?
No hay un máximo técnico rígido, pero el diseño importa: más OSDs por nodo aceleran la reconstrucción tras una falla de disco (se reparte entre más discos), aunque también significa que perder ESE nodo completo saca más capacidad de golpe. El backend de red (idealmente 10G dedicado para el tráfico de replicación) debe dimensionarse junto con el número de OSDs, no después.

¿Vas a desplegar un clúster Ceph sobre Proxmox VE?

Somos partner oficial de Proxmox. Diseñamos y operamos clústeres HCI Proxmox + Ceph desde nuestro NOC/SOC, incluida la migración desde VMware.

Hablar con un especialista

Herramientas relacionadas

Otras herramientas gratuitas de IT Experts

// Contacto

Inicia hoy tu transformación digital

Trabajemos juntos. Cuéntanos qué necesita tu operación y te respondemos a la brevedad.

call+52 (614) 400-0013 phone_in_talk+52 (614) 426-2339 mailcontacto@itxperts.com.mx

Al enviar aceptas nuestro Aviso de Privacidad.