Jefe de servicios de TI repasando un diagrama de proceso en la pizarra junto a una colega con una tablet

Cuánto te cuesta una hora de sistema caído (y cómo calcularlo)

El costo de una hora de sistema caído se calcula sumando cuatro cosas: los ingresos que no se generan, el costo de las personas que no pueden trabajar, la recuperación posterior y el daño con clientes. Casi ninguna empresa tiene ese número, y es el que convierte una discusión de presupuesto en una decisión obvia.

Vamos a calcularlo.

Los cuatro componentes

1. Ingresos que no se generan

El más directo, y no siempre el más grande. Divide tus ingresos de un mes normal por las horas hábiles de ese mes y tienes el punto de partida. Con dos ajustes: si tu operación se concentra en ciertos días o ciertas horas, una caída en el peak no vale lo mismo que una a las 8 de la mañana de un lunes; y hay ventas que no se pierden sino que se posponen.

2. Personas que no pueden trabajar

Si 40 personas quedan detenidas dos horas, son 80 horas de trabajo pagadas y no producidas. Este componente suele ser mayor de lo que se cree, porque incluye a todos los que dependen del sistema aunque no lo usen directamente.

3. Recuperación

Horas del equipo técnico, soporte externo, trabajo de reingreso manual de lo que no se registró mientras el sistema estaba caído, y horas extra para ponerse al día. Este costo llega después y por eso rara vez se asocia al incidente.

4. Clientes y reputación

El más difícil de cuantificar y el que más pesa a largo plazo. Un despacho que no salió, un cliente que no pudo comprar, un compromiso de nivel de servicio incumplido. Si tienes contratos con multas por incumplimiento, ahí hay una cifra exacta con la que trabajar.

Las dos preguntas que ordenan todo

Antes de invertir en cualquier solución, hay que responder dos cosas por cada sistema crítico:

¿Cuánto tiempo puedes estar sin esto? Es el tiempo objetivo de recuperación. Para un sistema de facturación pueden ser cuatro horas; para el control de acceso a una faena, minutos.

¿Cuánta información puedes permitirte perder? Es el punto objetivo de recuperación. Si respaldas una vez al día a medianoche y el servidor falla a las 5 de la tarde, perdiste 17 horas de trabajo. ¿Es aceptable?

Esas dos respuestas definen la solución. Todo lo demás es conversación.

El error de tratar todo por igual

Proteger todos los sistemas al mismo nivel sale caro e innecesario. La clasificación honesta suele quedar así:

  • Críticos: sin ellos la operación se detiene. Requieren redundancia y recuperación en minutos u horas.
  • Importantes: se puede seguir un día, con incomodidad. Recuperación en horas, respaldo diario.
  • El resto: se puede esperar. Respaldo periódico y recuperación cuando toque.

Casi siempre resulta que solo dos o tres sistemas son realmente críticos. Concentrar ahí la inversión rinde mucho más que repartirla pareja.

Lo que efectivamente reduce el tiempo de caída

  • Virtualización. Un entorno virtual se levanta en otro hardware en minutos; un servidor físico dañado se reemplaza en días.
  • Respaldos probados. No basta con que corran: hay que restaurarlos de prueba y cronometrar cuánto demoran. Un respaldo nunca probado es una intención, no un plan.
  • Redundancia en el enlace. Si todo depende de una conexión, esa conexión es el punto único de falla de la empresa entera.
  • Monitoreo. La diferencia entre enterarse por una alerta y enterarse porque llamó un cliente son horas de caída.
  • Procedimientos escritos. Quién hace qué, en qué orden, con qué contactos. A las 3 de la mañana nadie improvisa bien.

Cómo usar el número

Con el costo por hora calculado, la conversación cambia de forma. Ya no se discute si una solución «vale la pena»: se compara su costo anual contra las horas de caída que evita.

Y aparece un efecto secundario útil: el ejercicio obliga a revisar cuántas horas estuviste caído el año pasado. Casi siempre es más de lo que la gente recuerda, porque las caídas cortas y frecuentes no se registran en ninguna parte y suman más que el incidente grande que todos comentan.

En Saytec abordamos la continuidad desde la arquitectura: virtualización, respaldo, monitoreo y procesos, en ese orden. Puedes ver cómo en la línea de Tecnologías de la Información, y si la caída viene por el lado del enlace, el trabajo es de Telecomunicaciones.

Escríbele a un especialista si quieres hacer el cálculo con tus cifras.

Dudas frecuentes

Dudas sobre continuidad operativa

¿Cómo calculo cuánto me cuesta una hora de sistema caído?

Sumando cuatro componentes: los ingresos que no se generan en esa hora, el costo de las personas que quedan sin poder trabajar, las horas de recuperación posteriores y el daño con clientes o las multas contractuales.

El componente que más se subestima es el segundo: si cuarenta personas quedan detenidas dos horas, son ochenta horas pagadas y no producidas. Y el tercero llega después del incidente, por lo que casi nunca se asocia a él en la contabilidad.

¿Qué son el RTO y el RPO?

El RTO es cuánto tiempo puedes estar sin un sistema; el RPO es cuánta información puedes permitirte perder. Esas dos respuestas, por cada sistema crítico, definen qué solución necesitas.

Si respaldas una vez al día a medianoche y el servidor falla a las cinco de la tarde, perdiste diecisiete horas de trabajo: ese es tu RPO real, lo hayas definido o no. Ponerle número a ambos antes de invertir evita comprar de más en unos sistemas y de menos en otros.

¿Hay que proteger todos los sistemas por igual?

No, y hacerlo sale caro sin sumar seguridad. Conviene clasificarlos en críticos, importantes y el resto, y concentrar la inversión en los primeros.

Al hacer el ejercicio con honestidad, casi siempre resulta que solo dos o tres sistemas detienen la operación de verdad. Repartir el presupuesto de forma pareja deja a esos dos o tres peor protegidos de lo que deberían estar.