Архитектурные решения на базе аппаратных платформ IBM

Высокопроизводительные кластеры

Показывать лекцию целиком

Cluster 1600

Что такое "кластер"?

Кластер – это набор соединенных друг с другом компьютеров, используемых как общий вычислительный ресурс в едином административном пространстве.

Кластер состоит из двух или более серверов, соединяющих их сетей, общего дискового пространства и управляющего программного обеспечения.

Кластеры могут быть использованы в решениях, требующих масштабируемости большей, чем одна система: High Performance Computing (HPC, высокопроизводительные вычисления). Кластеры могут быть использованы для упрощения управления группой индивидуальных систем в решении по консолидации серверов (Server Consolidation). Кластеры могут быть использованы для повышения доступности приложений - High Availability (решение по обеспечению высокой доступности).

Зачастую в одном решении можно обнаружить признаки нескольких кластерных моделей.

Основные функции Cluster 1600

Масштабируемость: Блоками Cluster 1600 могут быть серверы или разделы, масштабируемые для удовлетворения потребностей клиентов.

Гибкая архитектура: Можно выбирать тип серверов, взаимосвязи, общей дисковой подсистемы и операционной системы.

Высокая доступность: Блоки кластера под управлением AIX, вместе с ПО HACMP могут повысить доступность критических приложений.

Системное управление: Недостаточно просто соединить большое количество серверов; необходимы инструменты для управления. Cluster 1600 предоставляет большой набор средств – ПО Cluster System Management (CSM).

Защита инвестиций: Повышенная гибкость решения Cluster 1600 предоставляет возможность снизить общую стоимость владения IT-инфраструктурой.

Предназначение высокопроизводительных кластеров

На фотографии – кластер в European Centre for Medium-Range Weather Forecasts (Европейском центре по среднесрочным прогнозам погоды).

Кластеры IBM хорошо известны, как высокопроизводительные вычислительные решения для научных и технологических расчетов в таких областях, как инженерный анализ, сейсмография, прогноз погоды, химические и физические расчеты.

Кластеризация предоставляет возможность параллельных вычислений, удовлетворяющих не только требованиям высокой производительности и масштабируемости, но и хорошего соотношения цена/производительность. Простого объединения сотен процессоров не всегда достаточно для обработки таких сложных задач, как анализ ДНК, экологическое моделирование, нефтяное моделирование, моделирование потоков. Такие задачи требуют сбалансированной системы с высокой пропускной способностью, устойчивой подсистемой памяти, подходящей подсистемой ввода- вывода и современными средствами управления. Кроме того, системы должны быть просты в обслуживании.

Компоненты Cluster 1600

Аппаратные компоненты Cluster 1600:

  • Узлы – либо отдельные серверы, либо логические разделы.
  • Коммуникации – технологии соединения узлов.
  • Программные компоненты Cluster 1600:

  • Операционная система (AIX или Linux).
  • Управляющее ПО (PSSP или CSM).
  • Программные решения для поддержки приложений (HACMP, ESSL и т.д.)
  • Приложения
  • Узлы Cluster 1600

    Узлом кластера может быть сервер с одной операционной системой или логический раздел (LPAR). Не все модели RS/6000 и pSeries могут быть включены в кластер.

    В процессе эволючии кластеров постепнно перешли от специализированного аппаратного обеспечения, например, SP nodes, к стандартным компонентам.

    Лезвия (blades) поддерживаются в качестве узлов кластера относительно недавно.

    Подробную информацию можно получить по адресам:

    http://www-1.ibm.com/servers/eserver/clusters

    http://www-1.ibm.com/servers/eserver/clusters/hardware/factsfeatures.html

    Коммуникации Cluster 1600

    Узлы кластера обмениваются данными и координируют свою деятельность по высокоскоростной сети. Эта сеть обычно отделена от сети, по которой происходит управление кластером.

    Соединение между узлами бывает как с коммутацией, так и без коммутации.

    Подходящий тип соединения зависит от таких факторов, как тип используемцых узлов, количество узлов, тип ОС, стоимость решения.

    Коммутатор High Performance Switch (HPS) предоставляет максимальную производительность, масштабируемость и пропускную способность.

    Он базируется на проверенной технологии коммутаторов SP Switch и SP Switch2.

    Пиковая пропускная способность 2 Гб/с с задержкой < 10 микросекунд.

    Если кластерное решение полностью базируется на Linux, то часто используется коммутатор MyricomMyrinet-2000. Более подробная информация – по адресу http://www.myri.com/

    Пример конфигурации (1)

    Это – пример конфигурации кластера Cluster 1600, состоящего из 32-х узлов, соединенных коммутаторами High Performance Switch.

    Пример конфигурации (2)

  • Суперкомпьютер MareNostrum
  • Linux кластер с JS20 Blades и Myrinet-2000
  • Пиковая производительность 40TFlops
  • Вес 60 тонн – стоимость $70 миллионов US dollars
  • 2,282 IBM eServer BladeCenter JS20 blade servers
  • MareNostrum – результат партнерства IBM и правительства Испании, которое привело к созданию Суперкомпьютерного Центра в Барселоне - Barcelona Supercomputer Center (BSC). BSC открытый консорциум, созданный правительством Испании, правительством Каталонии и Техническим Университетом Каталонии (Technical University of Catalonia, UPC)

    MareNostrum – дословно "наше море" – латинский термин Средиземноморья – имеет двойное предназначение – служить основным ресурсом для высокопроизводительных вычислений европейского научного сообщества и демонстрировать преимущества использования Linux на POWER в масштабируемых параллельных вычислениях.

    MareNostrum полностью построен на коммерчески доступных компонентах.

    2,282 IBM eServer BladeCenter JS20 blade servers расположены в 163 BladeCenter chassis, 4,564

    64-bit IBM Power PC 970FX процессоров и 140 ТБ в IBM TotalStorage DS4100 storage servers.

    Программное обеспечение Cluster 1600

    Операционная система

  • AIX
  • Linux
  • Управляющее ПО

  • CSM
  • PSSP
  • Приложения

  • HACMP
  • High Performance Computing Software Stack
  • GPFS
  • Решения Cluster 1600 могут работать как под ОС AIX 5L, так и Linux.

    ПО для управления может быть PSSP или CSM. Могут использоваться приложения для обеспечения высокой доступности, например, HACMP 5.2

    ОС AIX 5L работает на всех серверах, входящих в кластер Cluster 1600, включая pSeries, RS/6000 и узлы SP nodes.

    Можно выбрать в качестве ОС на Cluster 1600 также и Linux. Под Linux существует большое количество открытых приложений (Open Source). Однако, Linux не предоставляет всех тех же возможностей, например, RAS, что и AIX.

    ПО для управления Cluster 1600 - CSM

    Единая точка контроля для:

  • Инсталляции
  • Конфигурирования
  • Поддержки
  • Обновления
  • Поддержка смешанных кластеров:

  • Узлы pSeries или LPARs
  • Узлы xSeries
  • ОС Linux (Redhat AS; RedHat EC (AS/ES/WS); SUSE Enterprise Server)
  • AIX 5L v5.2H and 5.3
  • Контроль аппаратного обеспечения (HMC):

  • Включение/выключение
  • Перезагрузка
  • Включает CSM High Availability Management Server

    Управление кластеризованными серверами производится ПО CSM, разработанным для простого управленния распеделенными и кластеризованными системами IBM eServer. Современные версии поддерживают Linux на xSeries, Linux на pSeries и AIX на pSeries. CSM предоставляет единую точку контроля для инсталляции, конфигурирования, поддержки и обновления систем. Системы под управлением AIX и Linux можно консолидировать в единую среду под управлением CSM, для снижения затрат на управление ими.

    Программное обеспечение

  • LoadLeveler
  • Parallel Environment for AIX
  • Engineering and Scientific Subroutine Library (ESSL) for AIX and Linux
  • Parallel ESSL for AIX and Linux
  • LoadLeveler for AIX 5L – программа для управления заданиями, которая позволяет пользователям запустить больше заданий за меньшее время путем сопоставления необходимых для выполнения задания ресурсов с имеющимися.

    Parallel Environment for AIX – многофункциональная среда для разработки и выполнения приложений в распределенной среде, с распределенным использованием памяти и обменом сообщениями.

    Engineering and Scientific Subroutine Library (ESSL) – коллекция математических библиотек для обеспечения оптимальной производительности инженерных и научных приложений, выполняющих операции с плавающей точкой, написанных на FORTRAN, C или C++. ESSL содержит более 400 математических подпрограмм.

    Parallel ESSL содержит более 100 математических подпрограмм, специально разработанных для реализации всей мощности параллельного кластера на pSeries.

    General Parallel File System (GPFS)

  • Быстрый доступ к общим данным
  • Масштабируемая производительность
  • Простое управление
  • Доступна на AIX 5L и Linux
  • Производительность файловой системы в Cluster 1600 увеличивается при использовании файловой системы General Parallel File System (GPFS). Доступная под AIX 5L и Linux, GPFS – это высокопроизводительная файловая система для общего дискового пространства, которая может предоставить доступ к данным всем узлов кластера.

    Большинство файловых систем в UNIX разработано для исключительного доступа к данным с одного сервера. Добавление файловых серверов обычно не увеличивает скорость доступа к файлам. GPFS разработана для обеспечения масштабируемой производительности и восстановления после сбоев, при удовлетворении стандартов к файловым системам UNIX.

    В дополнение к существующим командам AIX 5L по администрированию файловых систем, GPFS предоставляет функции, которые упрощают администрирование множества узлов. Одна команда GPFS может выполнить административную функцию в пределах всего кластера и может быть выполнена с любого узла.

    GPFS обеспечивает высокую производительность, предоставляя одновременный доступ к дискам, содержащим файловую систему, независимо от того, подключены ли диски к серверу физически или через программную эмуляцию.

    Итоги

  • Высокопроизводительные кластеры используются как для научных, так и коммерческих задач
  • Решение от IBM – Cluster 1600
  • Вернуться к учебному плану