Архитектурные решения на базе аппаратных платформ IBM

Архитектура HACMP

Разбить на страницы
Показывать лекцию целиком

Концепции высокой надежности

Понятие "высокая надежность"

High Availability

Устранение или скрытие запланированного и незапланированного времени простоя.

Устранение общей точки отказа (Single Point of Failure).

Решение по обеспечению высокой надежности (доступности) - High Availability Solution – гарантирует, что сбой любого компонента решения, аппаратного, программного или элемента системного управления, не вызовет недоступность приложения и его данных для конечного пользователя. Это достигается путем устранения или маскирования как запланированного, так и незапланированного времени простоя.

В высокодоступном решении должны быть устранены единые точки отказа - single points of failure (SPOF), за счет тщательного дизайна, планирования, выбора аппаратного обеспечения, конфигурирования ПО и тщательного соблюдения дисциплины контроля изменений (change management).

Стоимость времени простоя

60% крупных предприятий работают круглосуточно (7x24)

Потери от сбоев:

  • В среднем $330,000 в час
  • Максимальные потери: $130,000 в минуту (телефонная сеть)
  • Потеря доверия заказчиков
  • При отсутствии процедур восстановления:

  • 50% не восстановили бизнес
  • Многие компании инвестируют средства в высокодоступные решения не только для защиты от сиюминутной потери прибыли из-за сбоя, но и для защиты от потери доверия заказчиков.

    Решение по обеспечению высокой доступности – это не решение по восстановлению после сбоев (disaster recovery). Решение по восстановлению после сбоев ориентировано на катастрофу с полной или частичной потерей инфраструктуры в одном географическом месте.

    Причины простоев

    Решения для обеспечения высокой надежности (High Availability) позволяют уменьшить время как запланированных, так и незапланированных простоев.

    Сбой аппаратного компонента – всего лишь небольшой процент об общей массы причин недоступности системы. Наиболее частая причина – это запланированные простои.

    Например, это останов приложений для резервного копирования, для установки обновлений ПО, перезагрузка после обновлений ядра ОС.

    Незапланированный простой – это тот простой, которого администратор не ожидал, например, сбой приложения, сбой аппаратуры. А наиболее частой причиной таких сбоев является ошибка администратора.

    Способы обеспечения доступности

    Для повышения доступности системы может быть использован большой диапазон решений. Они начинаются от простого сервера и заканчиваются специальной отказоустойчивой системой, специально разработанной для обеспечения ее жизнеспособности в случае сбоя какого-либо компонента.

    Классификация систем

    Stand-Alone система

    Ограниченные способы повышения доступности:

  • Журнальная файловая система (JFS)
  • Динамическое ядро ОС
  • Динамическое освобождение процессора (Dynamic CPU Deallocation)
  • Сервисный процессор
  • Резервные источники питания
  • Резервная система вентиляции (охлаждения)
  • Оперативная память с ECC
  • Адаптеры с возможностью горячей замены
  • Общие точки отказа:

  • Операционная система
  • Сеть
  • Сетевой адаптер
  • Хост
  • Диск
  • Приложение
  • Внешние причины
  • Отдельно стоящая (stand-alone) система может обеспечить некоторый уровень повышения доступности, в зависимости от типа и класса сервера.

    К сожалению, использование единственного сервера имеет один существенный недостаток, а именно, неспособность его к выживанию после сбоя критически важного системного компонента, например, операционной системы.

    Enhanced система

    Дополнительные способы повышения доступности:

  • Резервные пути передач данных
  • Зеркалирование данных
  • Дисковая подсистема с возможностью горячей замены
  • Резервные блоки питания для подсистемы хранения данных
  • Резервная система охлаждения для подсистемы хранения данных
  • Диски горячего резерва (Hot Spare)
  • Общие точки отказа:

  • Операционная система
  • Приложение
  • Сеть
  • Сетевой адаптер
  • Хост
  • Внешние причины
  • "Улучшенная" (enhanced) система может включать в себя технологию зеркалирования данных, используя ПО (например, LVM) или аппаратуру (RAID). В зависимости от типа дисковой подсистемы, возможно наличие нескольких путей к диску.

    Как и в случае использования отдельно стоящей системы, улучшенная система имеет серьезный недостаток – отсутствие дублирования всех компонентов (за исключением дисковой подсистемы).

    High Availability кластер

    Дополнительные преимущества кластерной технологии:

  • Резервные серверы
  • Резервные сети
  • Резервные сетевые адаптеры
  • Мониторинг состояния (heartbeat)
  • Обнаружение сбоев
  • Диагностика сбоев
  • Автоматический подхват нагрузки
  • Автоматическое восстановление
  • Общие точки отказа:

  • Приложение
  • Внешние причины
  • Высокодоступное (high availability) решение устраняет основные недостатки ранее упомянутых систем – все компоненты в таком решении продублированы.

    Если любой компонент такого решения выйдет из стоя, резервный компонент подхватит его работу.

    Однако, дублирование серверов и дисковых подсистем не устраняет все единые точки отказа.

    Например, это может быть... администратор системы.

    Fault Tolerant система

    Системы Fault Tolerant предназначены для постоянной работы:

  • Аппаратные компоненты с резервированием и горячей заменой
  • Специальная операционная система
  • Общие точки отказа:

  • Внешние причины
  • Отказоустойчивое (fault-tolerant) решение специально разработано, чтобы не выходить из строя.

    Такие решения очень дороги по сравнению с решениями по обеспечению высокой доступности; они выпускаются ограниченным количеством производителей и ориентированы на выполнение конкретных задач.

    Такие системы имеют плохое соотношение цена/производительность, список поддерживаемого ПО невелик.

    Такие системы применяются в тех случаях, когда любой сбой просто недопустим.

    Сравнение решений

    Указанные в таблице стоимости решений, конечно, очень относительны.

    То-же относится и к времени простоя; реально время простоя очень сильно зависит от многих факторов, например, от того, сколько времени потребуется приложению в HA-решении для рестарта на резервном узле.

    Географически распределенный кластер

  • Неограниченное расстояние
  • Удаленная репликация данных
  • Автоматический подхват и реинтеграция
  • Единый кластер на несколько географически распределенных объектов
  • HACMP XD (eXtended Distance) – географически распределенный кластер.

    Он устанавливается поверх HACMP и обеспечивает репликацию данных через глобальную сеть, с автоматическим переходом работы в резервную географическую точку в случае сбоя в основной.

    HACMP XD не зависит от приложений, дисковых технологий, типа данных и расстояний между объектами. Он может работать по любой сети TCP/IP.

    Преимущества HA-кластеров

  • Стандартные компоненты (аппаратное обеспечение)
  • Не требуют специальных приложений
  • Поддерживается широкий набор дисковых и сетевых подсистем
  • Хорошее соотношение цена/надежность
  • Для построения HACMP могут использоваться уже имеющиеся у компании системы и дисковые массивы.

    Требования к HA-кластерам

  • Продуманный дизайн и детальное планирование
  • Устранение единой точки сбоя
  • Продуманный выбор аппаратного обеспечения
  • Качественная реализация
  • Профессиональное системное администрирование
  • Подробное документирование
  • Тщательное тестирование
  • Дизайн, планирование и тестирование – критические шаги, которые нельзя пропускать при внедрении решения по обеспечению высокой доступности. Время, потраченное на проектирование сэкономит потом усилия на поддержку решения, а также послужит залогом правильной работы системы.

    Устранение общих точек отказа

    Объект Способ
    Узел Использование нескольких узлов
    Источник питания Использование ИБП и (или) раздельных линий электропитания
    Сетевой адаптер Использование резервных сетевых адаптеров
    Сеть Использование резервных сетей для связи между узлами
    Подсистема TCP/IP Использование последовательных (serial) линий связи
    Дисковый адаптер Использование резервных дисковых адаптеров
    Диск Использование резервных дисков и RAID-технологий
    Приложение Использование мониторинга приложений и автоматического подхвата приложения резервным узлом

    Всегда есть неустранимые точки отказа. Например, как правило, это общая серверная комната. Другой вариант – долговременное отключение электричества во всем городе.

    Необходимо документировать такие точки, с обоснованием причин, по которым их нельзя устранить.

    Итоги

  • Кластеры высокой надежности - хороший способ сохранить доступность приложений и данных при адекватной стоимости.
  • Одна из основных задач при построении кластера - устранение единых точек сбоя.
  • Необходимо тщательное планирование кластера.
  • Страницы:

    Концепции высокой надежности

    Понятие "высокая надежность"

    High Availability

    Устранение или скрытие запланированного и незапланированного времени простоя.

    Устранение общей точки отказа (Single Point of Failure).

    Решение по обеспечению высокой надежности (доступности) - High Availability Solution – гарантирует, что сбой любого компонента решения, аппаратного, программного или элемента системного управления, не вызовет недоступность приложения и его данных для конечного пользователя. Это достигается путем устранения или маскирования как запланированного, так и незапланированного времени простоя.

    В высокодоступном решении должны быть устранены единые точки отказа - single points of failure (SPOF), за счет тщательного дизайна, планирования, выбора аппаратного обеспечения, конфигурирования ПО и тщательного соблюдения дисциплины контроля изменений (change management).

    Стоимость времени простоя

    60% крупных предприятий работают круглосуточно (7x24)

    Потери от сбоев:

  • В среднем $330,000 в час
  • Максимальные потери: $130,000 в минуту (телефонная сеть)
  • Потеря доверия заказчиков
  • При отсутствии процедур восстановления:

  • 50% не восстановили бизнес
  • Многие компании инвестируют средства в высокодоступные решения не только для защиты от сиюминутной потери прибыли из-за сбоя, но и для защиты от потери доверия заказчиков.

    Решение по обеспечению высокой доступности – это не решение по восстановлению после сбоев (disaster recovery). Решение по восстановлению после сбоев ориентировано на катастрофу с полной или частичной потерей инфраструктуры в одном географическом месте.

    Причины простоев

    Решения для обеспечения высокой надежности (High Availability) позволяют уменьшить время как запланированных, так и незапланированных простоев.

    Сбой аппаратного компонента – всего лишь небольшой процент об общей массы причин недоступности системы. Наиболее частая причина – это запланированные простои.

    Например, это останов приложений для резервного копирования, для установки обновлений ПО, перезагрузка после обновлений ядра ОС.

    Незапланированный простой – это тот простой, которого администратор не ожидал, например, сбой приложения, сбой аппаратуры. А наиболее частой причиной таких сбоев является ошибка администратора.

    Способы обеспечения доступности

    Для повышения доступности системы может быть использован большой диапазон решений. Они начинаются от простого сервера и заканчиваются специальной отказоустойчивой системой, специально разработанной для обеспечения ее жизнеспособности в случае сбоя какого-либо компонента.

    Классификация систем

    Stand-Alone система

    Ограниченные способы повышения доступности:

  • Журнальная файловая система (JFS)
  • Динамическое ядро ОС
  • Динамическое освобождение процессора (Dynamic CPU Deallocation)
  • Сервисный процессор
  • Резервные источники питания
  • Резервная система вентиляции (охлаждения)
  • Оперативная память с ECC
  • Адаптеры с возможностью горячей замены
  • Общие точки отказа:

  • Операционная система
  • Сеть
  • Сетевой адаптер
  • Хост
  • Диск
  • Приложение
  • Внешние причины
  • Отдельно стоящая (stand-alone) система может обеспечить некоторый уровень повышения доступности, в зависимости от типа и класса сервера.

    К сожалению, использование единственного сервера имеет один существенный недостаток, а именно, неспособность его к выживанию после сбоя критически важного системного компонента, например, операционной системы.

    Enhanced система

    Дополнительные способы повышения доступности:

  • Резервные пути передач данных
  • Зеркалирование данных
  • Дисковая подсистема с возможностью горячей замены
  • Резервные блоки питания для подсистемы хранения данных
  • Резервная система охлаждения для подсистемы хранения данных
  • Диски горячего резерва (Hot Spare)
  • Общие точки отказа:

  • Операционная система
  • Приложение
  • Сеть
  • Сетевой адаптер
  • Хост
  • Внешние причины
  • "Улучшенная" (enhanced) система может включать в себя технологию зеркалирования данных, используя ПО (например, LVM) или аппаратуру (RAID). В зависимости от типа дисковой подсистемы, возможно наличие нескольких путей к диску.

    Как и в случае использования отдельно стоящей системы, улучшенная система имеет серьезный недостаток – отсутствие дублирования всех компонентов (за исключением дисковой подсистемы).

    High Availability кластер

    Дополнительные преимущества кластерной технологии:

  • Резервные серверы
  • Резервные сети
  • Резервные сетевые адаптеры
  • Мониторинг состояния (heartbeat)
  • Обнаружение сбоев
  • Диагностика сбоев
  • Автоматический подхват нагрузки
  • Автоматическое восстановление
  • Общие точки отказа:

  • Приложение
  • Внешние причины
  • Высокодоступное (high availability) решение устраняет основные недостатки ранее упомянутых систем – все компоненты в таком решении продублированы.

    Если любой компонент такого решения выйдет из стоя, резервный компонент подхватит его работу.

    Однако, дублирование серверов и дисковых подсистем не устраняет все единые точки отказа.

    Например, это может быть... администратор системы.

    Fault Tolerant система

    Системы Fault Tolerant предназначены для постоянной работы:

  • Аппаратные компоненты с резервированием и горячей заменой
  • Специальная операционная система
  • Общие точки отказа:

  • Внешние причины
  • Отказоустойчивое (fault-tolerant) решение специально разработано, чтобы не выходить из строя.

    Такие решения очень дороги по сравнению с решениями по обеспечению высокой доступности; они выпускаются ограниченным количеством производителей и ориентированы на выполнение конкретных задач.

    Такие системы имеют плохое соотношение цена/производительность, список поддерживаемого ПО невелик.

    Такие системы применяются в тех случаях, когда любой сбой просто недопустим.

    Сравнение решений

    Указанные в таблице стоимости решений, конечно, очень относительны.

    То-же относится и к времени простоя; реально время простоя очень сильно зависит от многих факторов, например, от того, сколько времени потребуется приложению в HA-решении для рестарта на резервном узле.

    Географически распределенный кластер

  • Неограниченное расстояние
  • Удаленная репликация данных
  • Автоматический подхват и реинтеграция
  • Единый кластер на несколько географически распределенных объектов
  • HACMP XD (eXtended Distance) – географически распределенный кластер.

    Он устанавливается поверх HACMP и обеспечивает репликацию данных через глобальную сеть, с автоматическим переходом работы в резервную географическую точку в случае сбоя в основной.

    HACMP XD не зависит от приложений, дисковых технологий, типа данных и расстояний между объектами. Он может работать по любой сети TCP/IP.

    Преимущества HA-кластеров

  • Стандартные компоненты (аппаратное обеспечение)
  • Не требуют специальных приложений
  • Поддерживается широкий набор дисковых и сетевых подсистем
  • Хорошее соотношение цена/надежность
  • Для построения HACMP могут использоваться уже имеющиеся у компании системы и дисковые массивы.

    Требования к HA-кластерам

  • Продуманный дизайн и детальное планирование
  • Устранение единой точки сбоя
  • Продуманный выбор аппаратного обеспечения
  • Качественная реализация
  • Профессиональное системное администрирование
  • Подробное документирование
  • Тщательное тестирование
  • Дизайн, планирование и тестирование – критические шаги, которые нельзя пропускать при внедрении решения по обеспечению высокой доступности. Время, потраченное на проектирование сэкономит потом усилия на поддержку решения, а также послужит залогом правильной работы системы.

    Устранение общих точек отказа

    Объект Способ
    Узел Использование нескольких узлов
    Источник питания Использование ИБП и (или) раздельных линий электропитания
    Сетевой адаптер Использование резервных сетевых адаптеров
    Сеть Использование резервных сетей для связи между узлами
    Подсистема TCP/IP Использование последовательных (serial) линий связи
    Дисковый адаптер Использование резервных дисковых адаптеров
    Диск Использование резервных дисков и RAID-технологий
    Приложение Использование мониторинга приложений и автоматического подхвата приложения резервным узлом

    Всегда есть неустранимые точки отказа. Например, как правило, это общая серверная комната. Другой вариант – долговременное отключение электричества во всем городе.

    Необходимо документировать такие точки, с обоснованием причин, по которым их нельзя устранить.

    Итоги

  • Кластеры высокой надежности - хороший способ сохранить доступность приложений и данных при адекватной стоимости.
  • Одна из основных задач при построении кластера - устранение единых точек сбоя.
  • Необходимо тщательное планирование кластера.
  • Вернуться к учебному плану