Второй блок питания в сервере часто воспринимают как страховку от поломки самого блока. Это лишь половина смысла. Резервирование по питанию защищает всю цепочку от розетки до платы: сгоревший модуль, выбитый автомат, отключённый по ошибке кабель, севший источник бесперебойного питания, работы на одном из вводов здания. Насколько эта защита реальна, определяется не наличием второго модуля, а тем, что находится за ним.
Как работает пара модулей
В серверном исполнении блоки питания вставляются в общую объединительную плату и работают на одну шину. Наиболее распространённая схема — резервирование один плюс один: два модуля, каждый из которых способен вытянуть полную нагрузку машины в одиночку. В нормальном режиме они делят нагрузку между собой, обычно примерно поровну, и каждый работает вполсилы.
Разделение нагрузки даёт побочный выигрыш. Кривая коэффициента полезного действия у большинства блоков имеет максимум примерно в середине диапазона, и половинная загрузка часто попадает как раз в благоприятную область. Тепловыделение на модуль снижается, вентилятор внутри блока крутится медленнее, ресурс электролитических конденсаторов, чувствительных к температуре, расходуется медленнее. Пара модулей стареет мягче, чем один такой же блок, нагруженный целиком.
При исчезновении входного напряжения на одном модуле второй принимает всю нагрузку. Переход происходит без провала на выходе, потому что обе цепи уже работают параллельно на общую шину — переключения как такового нет, есть перераспределение тока. Именно поэтому схема переживает пропадание ввода без единого сбоя на стороне процессоров и дисков.
Горячая замена и её условия
Отказавший модуль вынимается и меняется на работающей машине. Это штатная процедура, но у неё есть предусловия. Первое: оставшийся блок должен реально тянуть полную нагрузку. Если конфигурация разрослась — добавились диски, вторая видеокарта, ещё один процессор — суммарное потребление могло выйти за возможности одиночного модуля, и резервирование превратилось в разделение нагрузки без запаса. Проверять это надо на пиковом, а не среднем потреблении.
Второе: замена выполняется одним модулем за раз, с паузой на выравнивание. Третье: новый блок должен быть той же мощности и того же семейства. Разные по номиналу модули в одной корзине либо не запускаются в параллель, либо делят нагрузку неравномерно, и часть выигрыша теряется. Требования к конкретным сериям и разъёмам объединительных плат смотрят в разделе про серверные блоки питания, а общая логика работы преобразователей разобрана в разделе про блоки питания.
Главная ошибка: общая точка отказа
Резервирование теряет смысл, если оба кабеля уходят в один удлинитель, в одну распределительную панель или на один автомат. При таком монтаже сервер защищён только от отказа самого модуля — то есть от наименее вероятного события в цепочке. Выбитый автомат, отключённая по ошибке панель или отказ единственного источника бесперебойного питания снимают оба модуля одновременно.
Правильная схема разводит модули на независимые ветви: разные распределительные панели, разные автоматы, по возможности разные вводы и разные источники бесперебойного питания. В стойке это выражается физически — две вертикальные панели по бокам, левый кабель в левую, правый в правую, и никаких перекрёстных удлинителей. Если независимый второй ввод недоступен, второй лучший вариант — один модуль на бесперебойное питание, второй на городскую сеть напрямую: при отказе самого источника машина продолжит работать от сети.
Что стоит проверять при монтаже
Маркировка кабелей обязательна: без неё через полгода никто не скажет, какой шнур куда идёт, и очередная перекоммутация тихо сведёт две ветви в одну. Полезно фиксировать распределение нагрузки по панелям — при отказе ветви вся её нагрузка перейдёт на соседнюю, и та не должна уйти в перегрузку по автомату.
Отдельная тема — пусковой ток. При одновременном включении стойки после длительного отключения входные цепи блоков заряжают конденсаторы, и мгновенный ток многократно превышает рабочий. Автомат, спокойно державший установившуюся нагрузку, может выбить именно в этот момент. Серверные блоки ограничивают пусковой ток, но при десятках машин на одной ветви эффект складывается, поэтому питание после аварии подают группами, а не всё разом.
Проверка вместо предположений
Резервирование, которое ни разу не проверяли, остаётся предположением. Плановая проверка выполняется просто: во время окна обслуживания снимается питание с одной ветви, фиксируется, что машина не перезагрузилась и что оставшийся модуль вышел на полную нагрузку без ухода в защиту, затем питание возвращается и проверка повторяется для второй ветви.
Одновременно проверяется сигнализация. Сервер с отказавшим модулем внешне работает нормально, и без работающего оповещения — звукового, светового или через систему управления — отказ может остаться незамеченным на недели. Всё это время машина живёт без резерва, а второй модуль несёт полную нагрузку и стареет вдвое быстрее. Резервирование без наблюдения даёт отсрочку, а не защиту, и её срок обычно никто не отсчитывает.