Первое, что я узнал о сервере, который взялся настраивать для дружественной организации -- последние два дня его проц работал на 100 °C ?

На водянке умерла помпа. Проц i7 13700k выжил только благодаря термозащите и троттлингу. Инженеры интел всё-таки не зря получают свою зарплату.

И примерно тогда сформулировался главный принцип такой работы: сервер это набор ответов на вопросы "а что, если?".

Что, если снова откажет охлаждение?
Теперь за температурой, и не только, следит мониторинг.

Что, если повредится база 1С?
Настроены автоматические бэкапы MS SQL локально на холодное и на удаленное S3-хранилище.

Что, если понадобится срочно подключиться удалённо?
Доступ организован через VPN-шлюз, без публикации самого сервера в интернете. На крайний случай оставлен отдельный аварийный доступ по SSH.

Что, если ночью перезагрузится ОС или упадёт один из сервисов?
Проверены автозапуск и восстановление работы системы.

Мне понравилось. Нужно придумать, что может пойти не так, и подготовить ответ на каждый возможный инцидент заранее.

Кстати, если вам тоже нужно развернуть или привести в порядок сервер -- обращайтесь.