Система самодиагностики накопителя собирает десятки счётчиков, но практическую ценность для прогноза отказа имеет лишь несколько из них. Остальные либо описывают условия эксплуатации, либо меняются штатно и пугают тех, кто читает их как оценку здоровья. Разобраться проще всего, если понимать, что именно измеряет каждый счётчик и какой физический процесс за ним стоит.

Сырое значение и нормированное: две разные шкалы

Каждый показатель имеет сырое значение — фактическое число событий, часов, градусов — и нормированное, которое устройство вычисляет само по внутренней формуле. Нормированное значение начинается с некоторого максимума и снижается по мере расходования ресурса; для критичных показателей задан порог, ниже которого устройство объявляет предупреждение.

Ловушка в том, что формула пересчёта у каждого производителя своя и нигде не документирована. Нормированное значение может держаться на высокой отметке, пока сырое уже показывает десятки тревожных событий, потому что запас заложен большой. Обратная ситуация тоже встречается: сырое значение выглядит внушительным числом, но кодирует не количество ошибок, а внутренний формат из нескольких полей. Смотреть надо на сырое значение и на его динамику, а порог использовать как последний рубеж, а не как индикатор.

Механический диск: три показателя решают почти всё

Первый — число переназначенных секторов. Диск обнаруживает сектор, который не читается устойчиво, и подставляет вместо него резервный из скрытой области. Единичное переназначение за годы работы — обычное дело: дефекты магнитного слоя существуют изначально. Опасен не факт, а темп. Если счётчик стоял на месте месяцами и вдруг начал расти каждую неделю, разрушение слоя пошло лавинообразно, и запас резервных секторов кончится быстрее, чем кажется.

Второй — сектора, ожидающие переназначения. Это участки, которые не прочитались, но ещё не заменены: диск не может решить их судьбу, пока в них не запишут заново. Ненулевое значение здесь означает, что часть данных уже недоступна для чтения. После перезаписи сектор либо вернётся в строй, либо уйдёт в переназначенные — второе хуже.

Третий — неисправимые ошибки, то есть обращения, которые не удалось выполнить даже после повторных попыток и коррекции. Их рост говорит, что механизм коррекции перестал справляться.

Отдельно стоит обращать внимание на счётчики повторных запусков шпинделя и ошибок позиционирования: они указывают на механические проблемы — подшипник, привод головок — и обычно предшествуют отказу, который наступает внезапно и целиком.

Твердотельный накопитель: другой набор

Здесь механики нет, и предсказание строится на другом. Ключевой показатель — доля израсходованного ресурса, которую контроллер вычисляет по среднему числу отработанных циклов стирания. Он меняется медленно и предсказуемо, поэтому годится для планирования замены: по темпу роста несложно оценить, когда запас подойдёт к концу.

Второй важный показатель — доступный резерв блоков и его порог. Резерв расходуется, когда блоки выводятся из оборота по износу или дефектам. Пока значение близко к исходному, всё в порядке; заметное снижение означает, что блоки выбывают быстрее расчётного и накопитель приближается к режиму только для чтения.

Третий — счётчик ошибок носителя, то есть данных, которые не удалось восстановить корректирующим кодом. В отличие от жёсткого диска, у флеш-памяти небольшое количество исправленных ошибок — норма, а вот неисправимые появляться не должны.

Полезен и счётчик некорректных завершений работы: он не свидетельствует о неисправности, но объясняет происхождение повреждённых данных, если накопитель регулярно теряет питание на ходу. Подбор устройства с защитой буфера от таких событий обсуждается в разделе накопителей.

Что показатели не предскажут

Значительная часть отказов приходит без предупреждения. Выход из строя контроллера, обрыв в цепи питания платы, деградация конденсаторов, разрушение прошивки — все эти сценарии не отражаются ни в одном счётчике, потому что счётчики ведёт как раз тот узел, который отказал. Наблюдения за крупными парками накопителей давно показывают: заметная доля устройств умирает при формально благополучной самодиагностике.

Отсюда правило: система самодиагностики полезна как ранний сигнал, но не как гарантия. Она может дать неделю или месяц на подготовку, а может не дать ничего. Резервное копирование строится на этом допущении, а не на показаниях счётчиков.

Как читать показания на практике

Разовый снимок почти бесполезен — значение имеет тренд. Разумно снимать показания периодически и сравнивать: важен не сам факт наличия переназначенных секторов, а появление новых. Температуру и наработку стоит держать в поле зрения как контекст: перегрев ускоряет деградацию и механики, и памяти, а данные о наработке помогают понять, идёт ли речь об износе или о раннем дефекте.

Полезны и встроенные самотесты. Короткий проверяет узлы и служебные области, длинный последовательно читает всю поверхность и выявляет нечитаемые участки, которые обычная эксплуатация просто не затрагивала. Длинный тест на архивном диске, к которому годами никто не обращался, регулярно находит то, о чём счётчики молчали.