- Почему вам нужен план действий в чрезвычайных ситуациях, связанных с охлаждением центра обработки данных
- Шаг 1: Подтверждение сбоя и оценка риска
- Шаг 2: Ввести временные меры по регулированию воздушных потоков
- Шаг 3: Подключите переносные охлаждающие установки или резервные агрегаты
- Шаг 4: Снижение нагрузки на ИТ-системы
- Шаг 5: Определите пороги безопасного отключения
- Шаг 6: Чётко общайтесь и фиксируйте всё в документах
- Шаг 7: Выявление первопричины и восстановление охлаждения
- Шаг 8: После мероприятия — анализ и совершенствование
- Часто задаваемые вопросы
Почему вам нужен план действий в чрезвычайных ситуациях, связанных с охлаждением центра обработки данных
Агрегат CRAC может остановиться без предупреждения. Сработавший автоматический выключатель, изношенный ремень или вышедший из строя компрессор — и в помещении начинает становиться жарко. В типичном серверном помещении с 10 стойками, каждая из которых потребляет 5 кВт, это 50 кВт тепла, которому некуда деваться. Без охлаждения температура может подниматься на несколько градусов в минуту, в зависимости от объема помещения и ИТ-нагрузки. Именно поэтому план действий в чрезвычайных ситуациях, связанных с охлаждением центра обработки данных, — это не роскошь. Это необходимость.
План должен быть достаточно простым, чтобы его можно было выполнить в стрессовой ситуации. Нельзя допустить, чтобы люди лихорадочно листали руководства, пока звучат сирены. Необходимы чётко определённые роли, чётко прописанные действия и чётко установленные пороговые значения. Давайте рассмотрим, как выглядит практическое реагирование на чрезвычайную ситуацию.

Шаг 1: Подтверждение сбоя и оценка риска
Во-первых, проверьте сигнал тревоги. Иногда сбой датчика или кратковременное падение напряжения приводит к ложному срабатыванию. Проверьте дисплей или контроллер установки CRAC. Действительно ли она выключена? Вращается ли вентилятор? Работает ли компрессор? Если установка не работает, запишите время — это станет отправной точкой для расчета скорости повышения температуры.
Далее оцените риск. Какова ИТ-нагрузка в помещении? Какова текущая температура на входе? Если у вас есть резервные системы охлаждения, смогут ли оставшиеся агрегаты справиться с нагрузкой? Например, если у вас есть два агрегата CRAC мощностью 30 кВт, а ИТ-нагрузка составляет 40 кВт, один агрегат не сможет самостоятельно охладить помещение. У вас уже возникли проблемы. Если нагрузка составляет 20 кВт, у вас есть запас — но не надолго.
- Проверьте контроллер CRAC на наличие кодов ошибок и зафиксируйте время возникновения неисправности.
- Измеряйте температуру на входе в верхней части стеллажей — «горячие точки» появляются в первую очередь.
- Проверьте резервирование системы охлаждения: имеется ли агрегат конфигурации N+1, который может запускаться автоматически?
- Обратите внимание на скорость повышения температуры в помещении — это покажет, сколько времени у вас есть.
Шаг 2: Ввести временные меры по регулированию воздушных потоков
Времени мало. Если температура в помещении растет быстрее, чем на 1 °C в минуту, нужно выиграть время. Если у вас установлена система охлаждения с фальшполом, откройте плитки пола. Это позволит холодному воздуху проникать ближе к стойкам. Расположите переносные вентиляторы так, чтобы они направляли воздух на зоны с повышенной температурой. Но будьте осторожны — при неправильном размещении вентиляторы могут создавать рециркуляцию горячего воздуха. Направьте их так, чтобы они забирали прохладный воздух с пола или из ближайшего работающего кондиционера CRAC.
Во многих серверных помещениях проблема заключается не в общем количестве тепла, а в его неравномерном распределении. Один стойка с оборудованием высокой плотности может буквально «закипать», в то время как в остальной части помещения все в порядке. Проверьте герметичность прохода — есть ли щели в «холодном» проходе? Временно закройте их пластиковыми пленками или даже картоном. Выглядит это некрасиво, но работает.

Шаг 3: Подключите переносные охлаждающие установки или резервные агрегаты
Если в комнате по-прежнему становится жарко, вам нужно больше холодопроизводительность. Переносные кондиционеры или локальные охладители могут помочь, но их возможности ограничены. Типичный переносной агрегат может обеспечивать охлаждение мощностью 5–10 кВт, чего зачастую недостаточно для всей комнаты. Используйте их для охлаждения «горячих точек» — размещайте их рядом со стойками с самыми высокими температурами на входе.
Если у вас на объекте есть запасной блок CRAC, сейчас самое время его установить. Но замена блока занимает часы, а не минуты. Необходимо отключить вышедший из строя агрегат, установить запасной на его место, подключить линии питания и подачи охлаждающей жидкости, а также провести тестирование. Эта работа должна выполняться квалифицированными техническими специалистами. А пока ваши временные меры позволяют поддерживать нормальную работу помещения.
В некоторых объектах уже предусмотрены подключения для переносных холодильных установок. Если у вас их нет, рекомендуем установить их в ходе следующей модернизации. Простой быстроразъемный фитинг на контуре охлажденной воды может сэкономить несколько часов в чрезвычайной ситуации.
Шаг 4: Снижение нагрузки на ИТ-системы
Иногда самый быстрый способ снизить нагрев — отключить некритичные рабочие нагрузки. Если у вас виртуализированная среда, вы можете перенести виртуальные машины в другие места или просто отключить серверы разработки. В центре колокации вам, возможно, придётся связаться с клиентами и попросить их снизить нагрузку. Это не очень приятно, но всё же лучше, чем полное отключение.
Заранее определите приоритеты нагрузок. Какие приложения действительно имеют критическое значение для бизнеса? А какие могут простоять час? Зафиксируйте это в плане действий в чрезвычайных ситуациях, связанных с охлаждением вашего центра обработки данных. Когда сработает сигнализация, вам не придется принимать такие решения на ходу.
- Определите некритические рабочие нагрузки и сначала остановите их.
- По возможности перенесите виртуальные машины на другие хосты.
- Если у вас есть несколько серверных, переместите рабочие нагрузки с высокой плотностью в помещение с резервными системами охлаждения.
- Прежде чем что-либо отключать, проконсультируйтесь с заинтересованными сторонами из ИТ-отдела — у них могут быть взаимозависимости, о которых вы не знаете.
Шаг 5: Определите пороги безопасного отключения
Наступает момент, когда необходимо остановить работу ИТ-оборудования, даже если это повлечёт за собой простой. Большинство производителей серверов указывают максимальную температуру на входе — часто от 35 °C до 40 °C (от 95 °F до 104 °F). Однако длительная работа в таких пределах сопряжена с риском. Компоненты могут выйти из строя, а вентиляторы будут работать на полной скорости, потребляя больше энергии.
Установите порог отключения ниже, чем предусмотрено техническими характеристиками оборудования. Например, если в спецификации сервера указано 40 °C, начните отключение при 35 °C. Это обеспечит вам запас безопасности. И не забывайте о влажности — если в помещении станет слишком сухо, статический разряд может повредить оборудование. Большинство кондиционеров CRAC регулируют влажность, поэтому при их выходе из строя вы можете заметить падение влажности. Если она опустится ниже 20% относительной влажности (RH), это станет ещё одним поводом для выключения.
| Параметр | Типичное пороговое значение | Действие |
|---|---|---|
| Температура на входе в сервер | 35 °C (95 °F) | Начать ограничение потребления электроэнергии |
| Температура на входе в сервер | 40 °C (104 °F) | Отключить некритичные ИТ-системы |
| Влажность в помещении | Ниже 20% RH | Отключить при длительном воздействии |
| Скорость повышения температуры | >2 °C в минуту | Немедленное отключение всего ИТ-оборудования |
Эти цифры приведены в качестве примера — ознакомьтесь с техническими характеристиками вашего оборудования и установите собственные пороговые значения. Главное — определиться заранее, чтобы не задумываться, когда наступит нужный момент.

Шаг 6: Чётко общайтесь и фиксируйте всё в документах
Во время инцидента коммуникация не менее важна, чем технические меры. Кого нужно проинформировать? Управляющий объектом, команда ИТ-специалистов и, возможно, высшее руководство. Если вы находитесь в центре колокации, в ваш список контактов должен входить центр управления сетью (NOC) провайдера. А если у вас есть клиенты, им необходимо знать, подвергаются ли их услуги риску.
Назначьте одного руководителя операции. Этот человек будет координировать все действия и обмен информацией. Все остальные подчиняются ему. Это позволит избежать хаоса и противоречивых указаний. Используйте конференц-связь или групповой чат, чтобы держать всех в курсе событий. И фиксируйте всё в журнале — кто что сделал, когда и каковы были показатели температуры. Этот журнал станет неоценимым источником информации при анализе ситуации после инцидента.
Шаг 7: Выявление первопричины и восстановление охлаждения
Как только непосредственная угроза будет устранена, необходимо выяснить, по какой причине произошел сбой в работе агрегата CRAC. Проверьте коды ошибок, осмотрите ремни, проверьте, нет ли утечек хладагента, и проверьте электрические соединения. Было ли это простое отключение питания? Изношенный ремень, который порвался? Выход из строя двигателя компрессора? Результаты диагностики определят, сколько времени займет ремонт.
Если у вас заключен договор на техническое обслуживание с такой компанией, как VERHI, немедленно свяжитесь с ней. Они смогут направить к вам специалиста с необходимыми запчастями. Если вы занимаетесь ремонтом самостоятельно, убедитесь, что у вас под рукой есть запасные части — ремни, фильтры, контакторы и, возможно, запасной двигатель вентилятора. Ожидание запчастей — самая неприятная часть любого ремонта.
Перед перезапуском блока CRAC убедитесь в стабильности электропитания. Если сбой был вызван скачком напряжения, возможно, потребуется проверить ИБП и электрический щит. Кроме того, осмотрите змеевики конденсатора — если они забиты грязью, агрегат вскоре после перезапуска снова выйдет из строя.
Шаг 8: После мероприятия — анализ и совершенствование
Даже после восстановления системы охлаждения и нормализации температурных показателей работа еще не закончена. В течение нескольких дней проведите анализ ситуации после инцидента. Что прошло хорошо? А что — нет? Были ли пороговые значения установлены правильно? Сработал ли план коммуникации? Кто-нибудь засомневался, потому что не был уверен, как поступить?
Обновите план действий в чрезвычайных ситуациях, связанных с охлаждением вашего центра обработки данных, с учетом полученного опыта. Возможно, вам потребуется более эффективный мониторинг, большее количество переносных вентиляторов или изменение порядка отключения оборудования. Возможно, следует установить резервный блок CRAC или усовершенствовать график профилактического обслуживания. Цель состоит в том, чтобы последствия следующего сбоя были менее серьезными.
Кроме того, после инцидента проверьте показатель PUE (эффективность использования электроэнергии). Если вам пришлось запустить вентиляторы на полной скорости или использовать переносные системы охлаждения, ваш показатель PUE, скорее всего, резко вырос. Это вполне ожидаемо, но об этом стоит зафиксировать в документации, чтобы продемонстрировать финансовые последствия простоя.
Часто задаваемые вопросы
Что нужно сделать в первую очередь при выходе из строя блока CRAC?
Подтвердите наличие неисправности, зафиксируйте время и проверьте скорость повышения температуры. Если помещение быстро нагревается, немедленно приведите в действие план действий в чрезвычайных ситуациях — начиная с временного снижения расхода воздуха и нагрузки.
До какой температуры может нагреться серверная, прежде чем оборудование отключится?
Большинство серверов способны выдерживать температуру на входе до 35–40 °C (95–104 °F), однако длительная работа в пределах этих значений сопряжена с риском. Установите порог отключения на более низком уровне, например 35 °C, чтобы обеспечить себе запас безопасности.
Могут ли портативные кондиционеры спасти серверную?
Они могут помочь справиться с «горячими точками», но типичный переносной агрегат обеспечивает охлаждение мощностью всего 5–10 кВт — этого зачастую недостаточно для всего помещения. Используйте их для охлаждения самых нагретых стоек, пока вы разрабатываете более долгосрочное решение.
Как часто следует проводить проверку плана аварийного охлаждения?
Не реже двух раз в год. Проводите учения по моделированию аварийных ситуаций, чтобы проверить, как ваша команда реагирует на них. Скорее всего, вы обнаружите недостатки в вашем плане, которые можно устранить до возникновения реальной чрезвычайной ситуации.
Какие меры по техническому обслуживанию позволяют предотвратить отказы систем CRAC?
Регулярно проверяйте ремни, фильтры, уровень хладагента и электрические соединения. Кроме того, следите за чистотой змеевиков конденсатора и заменяйте изношенные детали до того, как они выйдут из строя. Грамотно составленный график профилактического обслуживания снижает вероятность внезапных поломок.
Нужна помощь в разработке или тестировании плана действий в чрезвычайных ситуациях, связанных с системой охлаждения? Инженеры VERHI могут проанализировать вашу текущую конфигурацию и предложить практические меры по повышению отказоустойчивости. Свяжитесь с нами уже сегодня.
На основе практического опыта компании VERHI в области высокоточных систем кондиционирования воздуха и сбоев в системах охлаждения центров обработки данных.
