Аварийный останов операционной системы — это реакция ядра на ситуацию, из которой оно не видит корректного выхода: повреждённая структура в памяти, обращение по недопустимому адресу, драйвер, не ответивший в отведённое время. Само по себе это не диагноз, а сигнал, что где-то ниже уровнем железо отдало неверные данные. Когда падение происходит при простое, круг подозреваемых широкий — от прошивки до драйверов. Когда падение привязано к нагрузке, круг резко сужается: под нагрузкой меняются три вещи — потребляемый ток, интенсивность обращений к памяти и температура кристаллов. Практически всегда виновата одна из них.

Почему нагрузка проявляет то, что не видно в простое

В простое процессор держит низкие частоты и напряжения, контроллер памяти работает вполсилы, преобразователи на плате отдают доли от номинала. Дефект в этих условиях остаётся ниже порога проявления: слабая пайка ещё держит контакт, ячейка памяти ещё успевает перезарядиться, конденсатор с деградировавшей ёмкостью ещё сглаживает пульсации. Нагрузка поднимает ток в разы, частоты — к максимальным, температуру — на десятки градусов. Любой из этих параметров может пересечь границу, за которой узел перестаёт быть исправным.

Отсюда практический вывод: диагностика по факту одного падения бесполезна. Нужна воспроизводимость. Задача первого этапа — найти сценарий, который валит машину предсказуемо, за минуты, а не за сутки. Дальше этот сценарий становится измерительным инструментом: любое изменение конфигурации проверяется на нём.

Просадка питания

Характерный почерк недостаточного или изношенного питания — падение в момент резкого роста потребления, а не при равномерной длительной нагрузке. Система стабильно держит час рендеринга, но валится на старте сцены в игре, при выходе из простоя, при одновременной раскрутке процессора и графики. Причина в переходных процессах: потребление меняется на десятки ватт за микросекунды, и если у источника не хватает запаса по току или ёмкость выходных конденсаторов деградировала, напряжение на линии кратковременно проседает ниже допуска. Логика получает неверные уровни, результат — повреждённые данные и останов.

Второй признак — падения без синего экрана, простым отключением, чередующиеся с остановами ядра. Это означает, что иногда защита источника успевает сработать раньше, чем система зафиксирует ошибку. Третий — зависимость от того, что ещё подключено: отключение части накопителей или второй платы расширения убирает симптом. Проверка здесь не в замерах напряжений мультиметром на холостом ходу — они покажут норму, — а в снижении нагрузки: ограничение частоты и лимита мощности процессора, ограничение кадров в графике. Если при вдвое меньшем потреблении симптом уходит полностью, версия питания подтверждена. Порядок величин запаса по мощности и то, чем отличаются источники по качеству сглаживания, разбираются в разделе о блоках питания.

Ошибки памяти

Память даёт другую картину. Падения не привязаны к пиковому потреблению, зато привязаны к объёму обрабатываемых данных: чем больше рабочий набор, тем выше вероятность попасть в дефектную область. Симптом сопровождается косвенными признаками — повреждёнными файлами после копирования больших объёмов, ошибками при распаковке архивов, невоспроизводимыми сбоями компиляции. Разные коды останова от запуска к запуску тоже указывают на память: аппаратный дефект не выбирает, какую именно структуру ядра испортить.

Ключевой вопрос — дефект самого модуля или режим, в котором он работает. Профиль повышенных частот, включённый одной галочкой в прошивке, задаёт тайминги и напряжения, которые контроллер памяти конкретного процессора может не тянуть, особенно при заполненных всех слотах. Проверка простая: вернуть память на базовую частоту JEDEC и повторить сценарий. Если стабильность возвращается, дефекта нет — есть неподъёмный режим. Если падения остались, планки тестируют по одной длительным проходом и меняют слоты, отделяя дефект модуля от дефекта канала на плате. Разница между обычной памятью и модулями с коррекцией ошибок, которые сообщают о единичных сбоях вместо тихого повреждения данных, описана в разделе о памяти ECC.

Тепловой срыв

Перегрев — самый простой для подтверждения случай, потому что он единственный из трёх имеет чёткую временную сигнатуру. Падение происходит не сразу, а через предсказуемый интервал после начала нагрузки: сначала машина работает нормально, потом наступает деградация, потом останов. Интервал зависит от массы радиатора и объёма корпуса и обычно измеряется минутами. Второй признак — зависимость от условий вне машины: летом валится, зимой нет; на полу под столом валится, на столе нет.

Подтверждается версия логированием температур во время сценария, а не разовым взглядом на показания после перезагрузки. Смотреть надо на процессор, графический кристалл и, отдельно, на температуру памяти видеокарты и накопителей — последние часто уходят в тепловой предел незаметно, потому что их редко выводят на экран. Дальше вопрос переходит в механику: прижим системы охлаждения, состояние термоинтерфейса, направление потоков в корпусе, забитые пылью рёбра. Важная деталь — современные процессоры и видеокарты при перегреве сначала снижают частоты и только потом отключаются, поэтому чистый тепловой останов без предшествующего падения производительности встречается реже, чем перегрев компонента, у которого защиты нет: цепей питания на плате, самого источника, микросхем памяти.

Разделение по этим трём почеркам обычно занимает вечер и сокращает поле поиска до одного узла, который дальше проверяется заменой на заведомо исправный.