Горячая замена — свойство не детали, а всей цепочки: механики разъёма, схемы питания, контроллера, прошивки и драйвера операционной системы. Если хотя бы одно звено не рассчитано на подключение под напряжением, извлечение узла из работающей машины заканчивается в лучшем случае зависанием подсистемы, в худшем — повреждением порта или просадкой питания на соседних устройствах. Поэтому вопрос «что можно менять на ходу» на практике сводится к другому: где производитель заложил поддержку сразу на всех уровнях и подтвердил это в документации на конкретное шасси.

Что происходит в разъёме в момент подключения

Главная проблема подключения под напряжением — разность потенциалов и бросок тока. Входные конденсаторы вставляемого модуля разряжены, и в первый момент они ведут себя как короткое замыкание: ток заряда ограничен только сопротивлением проводников. На общей шине питания это выглядит как провал напряжения, который соседние устройства могут воспринять как аварию и уйти в перезагрузку.

Конструктивно проблему решают ступенчатой длиной контактов. Первой замыкается земля, затем силовые линии, последними — сигнальные. Земля успевает выровнять потенциалы до того, как через сигнальные цепи пойдёт ток, а сигнальные линии не оказываются под напряжением на «плавающей» земле. Дополнительно в цепь ставят hot-swap контроллер: он ограничивает скорость нарастания тока, держит модуль в закрытом состоянии до стабилизации, работает электронным предохранителем и сообщает системе о факте вставки. Именно наличие такой обвязки, а не форма разъёма, отличает горячее гнездо от обычного.

Накопители и корзины

Накопители — самый массовый случай горячей замены. Диск с интерфейсом SAS или SATA подключается к бэкплейну корзины, где разъём выполнен со ступенчатыми контактами, а питание каждого слота коммутируется отдельно. Контроллер рассчитан на внезапное исчезновение устройства: массив переходит в деградированное состояние, после вставки нового носителя начинается перестроение. Устройство с интерфейсом NVMe работает по правилам PCIe hot-plug, и здесь требований больше: корневой порт или коммутатор должны уметь управлять питанием слота, прошивка — сообщать о событии, драйвер — корректно отцепить устройство и освободить ресурсы. Разница в реализациях объясняет, почему в одном шасси диск меняется без последствий, а в другом та же операция подвешивает подсистему ввода-вывода. Конструктивные варианты отсеков разобраны в разделе про шасси и корзины.

Даже при полной поддержке порядок действий остаётся жёстким: сначала логическое извлечение — вывод носителя из пула, остановка активности, сброс кэша, — и только потом физическое. Признак того, что система готова к операции: она сама создаёт события о вставке и извлечении и подсвечивает нужный слот. Если журнал молчит, лучше считать, что горячей замены здесь нет.

Отдельно стоит помнить про нагрузку, которую создаёт сама операция. Перестроение массива читает все уцелевшие носители целиком и пишет полный объём на новый диск, то есть на часы поднимает дисковую активность до предела. В этот период массив живёт без резерва, задержки на приложениях растут, а вероятность встретить скрытый дефект на соседнем носителе максимальна. Горячая замена убирает простой, но не убирает риск, и планировать её лучше на время низкой нагрузки.

Питание и охлаждение

Резервные блоки питания подключены к общей выходной шине и делят нагрузку между собой. При отключении одного оставшийся забирает весь ток, поэтому запас по мощности — не формальность: если оба блока постоянно работают у верхней границы, замена одного превращается в перегрузку и аварийное выключение. Смысл схемы N+1 в том, что любой единичный блок способен нести полную нагрузку системы в одиночку. Требования к таким блокам и режимам разделения тока описаны в разделе про серверные блоки питания.

Вентиляторы меняются на ходу почти всегда: модуль вставляется в направляющие, контакты питания замкнуты через ту же ступенчатую схему, а контроллер при пропаже одного вентилятора поднимает обороты остальных. Тепловой резерв при этом измеряется десятками секунд, а не минутами: в плотном шасси поток воздуха рассчитан впритык, и открытый слот меняет картину обдува для всего ряда. Отсюда правило не оставлять пустых мест и не держать снятую заглушку дольше, чем требует сама операция.

Что почти никогда не меняется под напряжением

Процессоры, модули памяти и материнская плата требуют полного обесточивания. Механизмы горячего добавления вычислительных ресурсов существуют в архитектурах с аппаратным разбиением на домены, но в массовых двухсокетных платформах их нет: сокет и слоты памяти конструктивно не рассчитаны на подключение под напряжением, а контроллер памяти не умеет переучитывать топологию на лету.

Отдельная карта расширения — промежуточный случай. Спецификация PCIe допускает горячее подключение, но нужен слот с управляемым питанием и механической фиксацией, поддержка в прошивке и драйвер, переживающий внезапное исчезновение устройства. В обычной серверной плате такие слоты встречаются редко, поэтому карты расширения меняют в плановое окно вместе с проверкой посадки и питания.

Практический вывод простой: горячей замене подлежит то, что стоит в отдельном отсеке с собственным управлением питанием и имеет резерв. Всё, что впаяно в общую топологию или существует в единственном экземпляре, меняется только на остановленной машине.