Эксперт «ОБИТ» рассказал, почему резервного копирования недостаточно для защиты ИТ-инфраструктуры
Руководитель ИТ-департамента Кирилл Тимофеев отмечает, что при построении отказоустойчивой инфраструктуры важно понимать, что резервное копирование и резервирование самой ИТ-среды отвечают разным задачам:
«Сегодня, когда потенциальных точек отказа все больше, недостаточно просто иметь несколько копий данных: необходимо обеспечить возможность восстановления критичных систем, каналов связи и площадок при недоступности основной площадки.
Один из подходов к решению этой задачи — геораспределенная ИТ-инфраструктура, при которой компоненты системы размещаются на нескольких территориально разнесенных площадках. Это позволяет снизить риски простоя и потери данных в случае аварии или недоступности одного из ЦОДов.
В рамках недавних проектов мы реализовали несколько сценариев построения отказоустойчивой ИТ-инфраструктуры. Первый — организация аварийного восстановления между несколькими облачными средами, где облачные ресурсы резервируются в другом облаке на уровне IaaS. Резервная среда поддерживается в постоянной готовности путем тестового запуска. Второй сценарий — гибридная распределенная архитектура, в которой часть компонентов размещена на площадке, а часть — в облаке с одновременной обработкой нагрузки на обеих площадках в режиме Active-Active.
При этом важно помнить, что грамотная реализация инфраструктурного резервирования не гарантирует стопроцентной сохранности данных и корректной работы приложений после переключения. Например, если мы имеем дело со сложной базой данных, то при сбое в процессе транзакции часть данных может находиться в оперативной памяти и не реплицироваться по умолчанию. В результате после восстановления возможна потеря незавершенных операций.
Поэтому отказоустойчивость инфраструктуры необходимо оценивать и реализовывать комплексно: разработать регламенты, определить допустимое время восстановления (RTO) и допустимый объем потери данных (RPO), выбрать подходящие сценарий и режим резервирования, обеспечить связность каналов связи и регулярно проводить тестирование аварийного переключения. Только комплексный подход позволяет оценить, насколько выбранная архитектура закрывает задачу и действительно ли инфраструктура сможет восстановиться».


