

En los últimos años, el sector ha incrementado su inversión en backup, deduplicación y retención para enfrentar la creciente ola de ransomware. Sin embargo, las empresas siguen enfrentando problemas significativos cuando intentan restaurar sus datos a tiempo. El Tiempo Objetivo de Recuperación (RTO) pasa de horas a días, lo que dispara los impactos operativos y económicos.
Especialistas consultados señalan que aunque los repositorios y equipos de backup están optimizados para almacenar datos de manera eficiente, fallan al ejecutar múltiples restauraciones al mismo tiempo, lo que provoca una sobrecarga del sistema. Según David Carrero, cofundador de Stackscale (Grupo Aire), “el día más caro del backup es el día que restauras”. La infraestructura, diseñada para escritura, no está preparada para lecturas masivas concurrentes.
Las deduplicaciones agresivas que prometen ahorros de espacio se convierten en un problema cuando se trata de reconstruir los datos almacenados. La rehidratación de terabytes de información puede requerir cientos de miles de lecturas dispersas, lo cual incrementa la latencia y sobrecarga el sistema. La verdadera métrica que debería considerarse es cuántos terabytes por hora se pueden entregar rehidratando múltiples máquinas virtuales en paralelo.
Se recomienda establecer un Índice de Rendimiento de Recuperación (RPI) para medir cuántos terabytes por hora puede realmente servir una plataforma, en lugar de enfocarse únicamente en el ahorro por deduplicación.
El diseño para la recuperación debe separar el almacenamiento de la capacidad para volver a operar. Esto incluye capas calientes para recuperación instantánea, réplicas para cargas críticas, y un plan de restauración detallado en lugar de pruebas limitadas. También es fundamental ajustar la infraestructura de red y la seguridad para garantizar una restauración eficiente y segura.
Errores comunes, como la confusión en las pruebas y la compra basada en fichas técnicas inadecuadas, pueden convertir un incidente en una crisis. Un plan de acción de 90 días incluye definir prioridades, medir el RPI actual y mejorar la infraestructura de recuperación.
Los costes de implementar una arquitectura que permita restauraciones rápidas pueden ser elevados, pero el verdadero ahorro se encuentra en minimizar el tiempo de interrupción de servicios críticos. En resumen, el enfoque debe cambiar hacia la capacidad de dar continuidad al negocio, medido en tiempo y servicio, para evitar que un incidente se convierta en una crisis.
Más información y referencias en Noticias Cloud.
