Три фактора надёжности станционной части СБ
Питание, контроль, регламенты
Как выстроить инфраструктуру, которая простит ошибки электросети и человеческий фактор
Когда мы говорим об отказоустойчивости серверного и рабочего оборудования в составе системы безопасности, на первый план выходит не столько «железо», сколько среда его эксплуатации. Базовый элемент этой среды — качественное электропитание. Здесь главными действующими лицами выступают ИБП с аккумуляторными модулями. Они берут на себя удар при обрывах, просадках или импульсных выбросах напряжения. Обесточивание работающего сервера «всухую» — это почти гарантированная потеря транзакций, повреждение файловых систем и, как следствие, невозможность штатного старта ПО без ручного восстановления из бэкапов.
Современные модели бесперебойников, предназначенные для вычислительной техники, уже имеют встроенные средства сигнализации о переходе на батареи. Такой функционал даёт возможность настроить автоматическое грациозное завершение сессий и последующий перезапуск машин в безопасном режиме. Мы всегда советуем закладывать такое решение в проект, вне зависимости от того, к какой категории надёжности относится внешняя сеть объекта. При этом сам алгоритм аварийного выключения серверов должен быть чётко зафиксирован в техническом задании для проектировщиков.
Один из часто упускаемых моментов — старение аккумуляторных элементов. Если не проводить периодическую проверку их реальной ёмкости, в решающий момент батареи могут разрядиться быстрее, чем потребуется даже для корректного завершения работы, не говоря уже о длительной автономии.
Для достижения высшего уровня живучести практикуют схемы с двумя независимыми ИБП, когда каждый сервер получает питание от двух разных источников. Такая конфигурация даёт двойное преимущество: повышает устойчивость к сбоям и позволяет проводить профилактику каждого из блоков по очереди, не отключая вычислительные мощности. Но этот подход работоспособен только при наличии у серверов двух входных блоков питания (Redundant) — об этом мы уже говорили в предыдущей публикации, посвящённой выбору аппаратной платформы.
Не ждать отказа, а предупреждать: роль мониторинга и сервисных процедур
Резервирование отодвигает момент поломки, но вовсе не отменяет её. Без системы постоянного наблюдения за «здоровьем» компонентов — состояния дисковых массивов, температурных режимов, оборотов вентиляторов, загрузки CPU, сетевых интерфейсов и видеокарт — вовремя заметить начинающиеся неполадки невозможно. А значит, замена проблемного элемента произойдёт уже после того, как он спровоцирует остановку.
В нашем оборудовании, к примеру, предусмотрен предустановленный пакет для мониторинга, который активируется буквально одним действием. Система собирает полный набор метрик, что даёт обслуживающим организациям ценную статистику для анализа и продления ресурса техники.
Долговечность станционной части напрямую завязана на чётко прописанные и неукоснительно выполняемые регламенты технического ухода. Эти процедуры должны быть закреплены в эксплуатационной и проектной документации с указанием периодичности, необходимого инструментария и уровня подготовки персонала. При каждом плановом обслуживании настоятельно рекомендуется проверять работу автоматического резервного копирования и дополнительно создавать ручную копию данных и системных образов. Эти операции логично вписать в общий график работ по всей системе безопасности.
Отдельного внимания заслуживают тренировки по восстановлению из образов и бэкапов. Только регулярное практическое моделирование аварий даёт уверенность, что в реальной ситуации действия будут отлажены до автоматизма. Если возникают сомнения в выборе дополнительных мер повышения надёжности, их стоит согласовывать с производителем или поставщиком. При отсутствии в штате специалистов соответствующего уровня имеет смысл привлекать инженеров вендора.
Организационный контур: ЗИП, SLA и компетенции
Наличие на объекте обменного фонда комплектующих (запасные части, инструменты, принадлежности) позволяет реагировать на сигнал мониторинга мгновенной заменой отказавшего узла, сводя время простоя к минимуму. Однако технологии стремительно обновляются, и детали нового поколения нередко оказываются несовместимыми с ранее выпущенным оборудованием. Поэтому оптимальная стратегия — приобретать ЗИП одновременно с основной партией техники. Номенклатуру и количество рассчитывают, опираясь на статистику отказов за планируемый срок эксплуатации.
Сервисное соглашение (SLA) гарантирует квалифицированное восстановление в оговоренные промежутки времени. Но здесь важно не путать «время реакции» на заявку и «время полного устранения» — у разных вендоров эти параметры трактуются по-разному. В наших контрактах SLA может быть встроен прямо в стоимость оборудования: мы гарантируем возврат в строй в течение 1 или 5 рабочих дней, в зависимости от пожеланий заказчика.
И, наконец, человеческий фактор. Самая совершенная архитектура бессмысленна, если за ней нет грамотного ухода. Недостаточная квалификация обслуживающего персонала способна свести на нет любые инженерные ухищрения. Мы рекомендуем запрашивать у производителя чёткие требования к навыкам и знаниям персонала и включать их в эксплуатационную документацию.
Надёжность станционной части складывается из трёх взаимосвязанных пластов:
- продуманная схема электропитания с резервированием ИБП
- тотальный контроль параметров и неукоснительное выполнение регламентов ТО
- организационная база: ЗИП, SLA-обязательства, подготовка кадров и регулярные антикризисные учения
Никакое техническое совершенство не поможет, если не прописаны инструкции, не обновляются конфигурационные параметры и не отрабатываются сценарии поведения в нештатных ситуациях. Время возвращения системы к жизни определяется не только мощностью процессоров, но и чёткостью протоколов реагирования.
В следующей статье мы перейдём к практической части: как выбирать конкретные мероприятия по обеспечению надёжности для систем безопасности и видеонаблюдения. Поговорим о методах оценки рисков, расчёте требуемого уровня отказоустойчивости и критериях выбора решений для станционной инфраструктуры.