Первое, что я узнал о сервере, который взялся настраивать для дружественной организации -- последние два дня его проц работал на 100 °C ?
На водянке умерла помпа. Проц i7 13700k выжил только благодаря термозащите и троттлингу. Инженеры интел всё-таки не зря получают свою зарплату.
И примерно тогда сформулировался главный принцип такой работы: сервер это набор ответов на вопросы "а что, если?".
Что, если снова откажет охлаждение?
Теперь за температурой, и не только, следит мониторинг.
Что, если повредится база 1С?
Настроены автоматические бэкапы MS SQL локально на холодное и на удаленное S3-хранилище.
Что, если понадобится срочно подключиться удалённо?
Доступ организован через VPN-шлюз, без публикации самого сервера в интернете. На крайний случай оставлен отдельный аварийный доступ по SSH.
Что, если ночью перезагрузится ОС или упадёт один из сервисов?
Проверены автозапуск и восстановление работы системы.
Мне понравилось. Нужно придумать, что может пойти не так, и подготовить ответ на каждый возможный инцидент заранее.
Кстати, если вам тоже нужно развернуть или привести в порядок сервер -- обращайтесь.