Аварийное восстановление

Аварийное восстановление — план и проверенная способность вернуть сервис после сбоя, слишком крупного для обычного резервирования: отказ региона, повреждённая основная база, разрушительный деплой, атака шифровальщика. Определяется оно двумя числами, согласованными с бизнесом до того, как что-либо построено. Целевое время восстановления — сколько сервис может лежать. Целевая точка восстановления — сколько данных вы готовы потерять, считая назад от момента сбоя. Всё остальное — топология репликации, частота резервных копий, держите ли вы тёплый резерв — вытекает из этих двух целей, а называть их без оценки стоимости значит превращать план в художественный текст. Резервные копии сами по себе не являются аварийным восстановлением. Копия, которую ни разу не восстанавливали, — это предположение, а не способность, и проблемы, всплывающие при первом настоящем восстановлении, всегда одни и те же: недостающий доступ, незадокументированная миграция схемы, зависимость от сервиса, который тоже лежит, и восстановление, идущее намного дольше любых прикидок, потому что его никто не засекал. Копии нужно защищать и от того самого события, от которого они страхуют, — отсюда важность неизменяемых копий с отдельными учётными данными в сценарии с шифровальщиком. Единственная осмысленная проверка — репетиция: по расписанию восстанавливайтесь в чистое окружение, замеряйте затраченное время против заявленной цели и считайте разрыв дефектом, а не числом, которое надо объяснить.

Похожие термины

Ещё термины: Облако и инфраструктура