Если говорить совсем кратко, то вычислительный кластер - это
совокупность компьютеров, объединенных в рамках некоторой сети для
решения одной задачи. В качестве вычислительных узлов обычно
используются доступные на рынке однопроцессорные компьютеры, двух или
четырехпроцессорные
Ясно, что простор для творчества при проектировании кластеров
огромен. Узлы могут не содержать локальных дисков, коммуникационная
среда может одновременно использовать различные сетевые технологии,
узлы не обязаны быть одинаковыми и масса прочих нюансов. Рассматривая
крайние точки, кластером можно считать как пару ПК, связанных
локальной сетью
Рассмотрим аппаратную сторону будущей
Рассмотрим базовые компоненты и их характеристики, которые должны учитываться при построении кластерных систем:
В процессе проектирования важно осознать, что сейчас для
конструирования
Начнем с того, что для эффективного обслуживания кластера не последнюю роль будет играть его компоновка. Лучшее решение - это расположение кластера в стойке. Даже для небольшого кластера из 4-6 узлов стойка уже уместна (рис. 3.1), при этом увеличение стоимости решения будет не столь существенным.
(рис 3.1) Пример стойки с пятью узлами и мониторомНе стоит сильно экономить на собственно стойке, так как недоработки ее конструкции могут в последствии превратиться в неожиданные проблемы. При выборе стойки следует обратить внимание на следующие нюансы.
Расположить стойку в помещении нужно так, чтобы был удобный доступ к узлам и спереди, и сзади. Спереди должно быть достаточно места для того, чтобы поместился узел из стойки и человек. Сзади будет выходить тепло, поэтому расстояние до стены должно быть достаточным для его рассеивания.
Обратите внимание, что стоечный крепеж обычно поставляется отдельно, поэтому, приобретая стойку, купите там же соответствующие винты и гайки. Стоит закупить их с запасом, чтобы сберечь свое время в будущем.
Не менее важным, чем выбор стойки, является выбор форм-фактора вычислительных узлов. Устоявшихся решений в настоящее время существует несколько.
(рис 3.2) Пример стойки с 30 узлами формата 1 UСтоечное решение с серверами 3-4 U. Обслуживание такого решения, наверное, самое легкое. Любое дополнительное периферийное оборудование устанавливается в такие серверы без особых проблем, охлаждение в них производится легко. Основным недостатком этого решения является то, что много таких узлов в стойку не войдет.
Стоечное решение с серверами 1-2 U (рис. 3.2). Вариант компактен, таких узлов в стойку войдет уже больше, чем в предыдущем случае, однако установить в них какую-то дополнительную плату иногда бывает весьма сложно. Тщательно продумайте конфигурацию узлов. Охлаждение в серверах небольшого размера, как правило, организуется сложнее, поэтому еще раз проверьте параметры и общий план разворачивания системы кондиционирования. Холодный воздух должен подаваться к передней части стойки, и кондиционер не должен располагаться слишком близко.
Стоечное решение на блейд-серверах (лезвиях). Самое компактное
решение, поэтому и стоимость его при прочих равных условиях немного
выше. Управление блейд-серверами обычно организуется с помощью
специальных средств, которые нужно будет дополнительно изучить. Такие
серверы, как правило, ограничены в плане расширения, и далеко не
всегда в них можно установить необходимую новую плату. Например, если
штатная
В последнее время появились компактные и исключительно мощные
стоечные кластерные решения. Например, компания Rackable Systems
(http://www.rackable.com) в конце 2006 года
анонсировала выпуск кластерных систем, построенных на основе стоечных
серверов размера 1U и четырехядерных процессоров Intel Xeon серии
5300. В одной стандартной стойке на 42 U может быть собран кластер с
(рис 3.3) Пример расположения кластера из 16 узлов на стеллажахНемного особняком стоит вариант, в котором обычные корпуса серверов располагаются на стеллажах (рис. 3.3). В этом случае кластер займет значительно больше площади, чем стоечное решение. Оборудование обойдется дешевле, однако обслуживание кластера в будущем станет организационно сложнее, а его развитие будет сильно ограничено.
Если число вычислительных узлов невелико, то может быть полезен
В некоторых случаях идут на совмещение функций вычислительного кластера и отдельных рабочих мест (учебного класса). На каждый узел ставится полный комплект: монитор, клавиатура, мышь, а разграничение функций производится административно, чаще всего, по времени: днем оборудование используется в режиме отдельных рабочих мест, а ночью в режиме кластерной вычислительной системы.
Выбор архитектуры и параметров вычислительных узлов, во многом,
определит характеристики будущего кластера. Тип и частота процессоров,
свойства чипсета, частота системной шины, объем и частота оперативной
памяти, ее конструктив, параметры кэш-памяти, состав портов и
поддержка
Основа - это выбор процессора, который будет диктовать
многие дальнейшие шаги. Одни
В последнее время все производители процессоров переходят на
многоядерные технологии, что нужно обязательно учитывать. Выбирая
одноядерные модели процессоров, можно значительно сэкономить в цене на
процессоры, однако больших перспектив это решение не имеет.
Вычислительный мир стал параллельным, число ядер на кристалле будет
только увеличиваться. Мы уже говорили о том, что первый основной
толчок к массовому использованию параллельных вычислительных
технологий дали
Останавливаясь на многоядерном варианте, проверьте, что эта пока еще новая особенность поддерживается на всех уровнях ПО: в компиляторах, библиотеках, в необходимых прикладных пакетах и системах. Есть ли смысл вкладываться в дорогую аппаратуру, если потом ее нельзя будет эффективно использовать? Однако при всех "за" и "против" различных вариантов, хотим подчеркнуть еще раз: в конечном итоге все определяется способностью кластера решить задачи проекта. Если с помощью такой-то конфигурации кластера задачи будут решены оптимально, то этот вариант и будет хорошим.
При проектировании архитектуры узлов обратите внимание на то, что
иногда с увеличением тактовой частоты процессоров растет не только их
производительность и стоимость. Для некоторых моделей это ведет к
росту
Для многих задач критически важным является объем и скорость работы
оперативной памяти. В этом случае лучше пожертвовать одним-двумя
вычислительными узлами в пользу покупки памяти с требуемыми
характеристиками. Если рассматривается вариант возможного увеличения
объема оперативной памяти в будущем, то обратите внимание на
конструктив
Схожий и весьма важный вопрос - структура и объем кэш-памяти. В
зависимости от типа процессора эти характеристики могут сильно
меняться, влияя на эффективность работы конечных приложений. При этом
важны не только количественные показатели, но и такие свойства, как
разделение кэш-памяти последнего уровня и доступа к системной шине
между отдельными ядрами процессора. Например, двуядерный процессор
Intel
Наличие локальных дисков на узлах кластера, на первый взгляд, кажется излишним. В самом деле, зачем тратить лишние деньги? Эти диски работать почти не будут, загрузку ОС можно сделать по сети, да и ее обновления в будущем делать будет проще. Примерно так нередко и рассуждают при построении кластера.
Верно, однако отсутствие локальных дисков влечет за собой и
потенциальные проблемы, о которых сначала не всегда задумываются.
Например, если возникнут
Еще одним весомым аргументом за включение дисков в состав узлов
является возможность локализации ввода/вывода для определенного класса
приложений. Если этого не предусмотреть, то все файловые операции
программ будут идти через
Floppy- и CD/
Если планируется использовать платы ServNet или аналогичные для организации сервисной сети, то может потребоваться наличие в узлах СОМ-порта.
Говоря об общей архитектуре, отметим, что кроме вычислительных узлов, необходимо предусмотреть головной узел кластерной системы. На головном узле пользователи компилируют свои программы, готовят данные для счета, проводят предварительную обработку данных. С головного узла производится запуск задач.
Совмещать головной узел с одним из вычислительных узлом не
рекомендуется, так как и работа пользователей будет затруднена, и
эффективность
Так как на головном узле, скорее всего, будут работать несколько
пользователей одновременно, то дополнительная оперативная память на
нем лишней не будет. Для ускорения работы локальных приложений стоит
установить в него быстрый жесткий диск или рейд-контроллер. К
процессору головного узла больших требований, как правило, не
предъявляется,
Весьма тонкий момент, который следует продумать заранее, это использование на головной машине процессора, отличного от процессоров вычислительных узлов. Часто компиляторы устроены так, что выполняют различного рода оптимизацию кода именно под тот процессор, на котором идет собственно процесс компиляции. Эта проблема, как правило, легко решается, поскольку многие компиляторы поддерживают режим кросс-компиляции, генерируя код целевого процессора, однако убедиться в эффективности и целесообразности такого режима работы нужно до заказа оборудования.
Кроме головного узла, в составе кластера необходим файл-сервер. Его функции могут быть переложены на головной узел, если предполагаемые нагрузки на сетевой диск будут не очень большими.
На файл-сервере стоит предусмотреть аппаратный рейд-контроллер.
Оптимальным является использование
В настоящее время большинство серверных
Если предполагается использовать
Сетевая инфраструктура в современных
Коммуникационная сеть - это тот компонент, который во
многом определит эффективность работы программ на будущем кластере,
поскольку именно с помощью этой сети процессы
Выбор
В данный момент на рынке доступны несколько стандартов сетевого оборудования, дающего скорости более 1 Гбит/с, и со значительно более низкой латентностью. Рассмотрим наиболее распространенные и доступные варианты.
(рис 3.4) Соединение узлов в трехмерный тор в сети SCIСетевая технология SCI. Скорость передачи данных около 700 Мбайт/с
(5,6 Гбит/с), аппаратная
С одной стороны такая архитектура кажется выгодной, так как не нужно приобретать дополнительного оборудования, только сетевые адаптеры. При добавлении новых узлов также не надо заботиться о покупке нового коммутатора. С другой стороны, опыт показывает, что эта технология весьма трудоемка при первоначальной настройке. Более того, находить ошибки или сбои в коммутации такой сети крайне сложно. Средств для ее диагностики существует очень мало. Но самым неудобным является то, что выход из строя одного вычислительного узла означает отключение двух (для двумерного тора) или трех (для трехмерного) колец связи. Сбой двух узлов в двумерном торе приведет к отключению еще двух других узлов, лежащих на пересечении отключенных колец. Для трехмерного тора аналогичное отключение произойдет при сбое трех узлов.
Сетевая технология Myrinet-2000/Myri-10G. Скорость передачи данных
- 2 Гбит/с и 10 Гбит/с соответственно. Для МРI-приложений достигается
скорость 247 Мбайт/с и 1,2 Гбайт/с,
Сетевая технология InfiniBand. Скорость передачи данных до
10 Гбит/с,
Технология
Данная технология одна из самых молодых среди аналогов, но и одна
из самых быстро развивающихся. При построении сети используются
коммутаторы, которые можно объединять между собой. Аппаратно
поддерживается маршрутизация пакетов, при этом дублирующиеся маршруты
используются для
При соединении нескольких коммутаторов часто используется топология
"
В настоящее время коммуникационные технологии развиваются очень
быстро. Недавно появились и уже сегодня доступны на рынке технологии
Quadrics и 10
Кроме
Разделение коммуникационной и
Еще одна сеть, о которой нужно обязательно упомянуть, это сервисная сеть. Эта сеть используется исключительно для обслуживания вычислительных узлов. Оконечным оборудованием для этой сети должен быть, строго говоря, даже не вычислительный узел, а устройство, способное его контролировать. На многих современных серверных платформах такие устройства устанавливаются изначально. Эти устройства доступны и отдельно, например, платы Hewlett-Packard Lights-Out или платы ServNet, разработанные в Институте программных систем РАН. Все они предоставляют различный уровень сервиса от минимальной возможности удаленно перезагрузить узел, включить или выключить питание, до получения графической консоли.
Крайне важной может оказаться информация с
Получить дополнительную информацию об упомянутых технологиях можно на сайте http://skif.pereslavl.ru/ (поиском слова ServNet) и поиском по ключевым словам "Lights-Out 100 Remote Management Card" на сайте http://www.hp.com.
Наличие сервисной сети сильно упрощает обслуживание кластера. Администратору не надо идти в другое помещение для того, чтобы перезагрузить зависший узел, можно быстро выяснить причину зависания, а в некоторых случаях даже переустановить ОС прямо со своего рабочего места.
Очень важный момент, про который забывают или на котором часто возникает желание сэкономить, - это обеспечение качественного электропитания. От этого будет зависеть и долговечность работы кластера, и степень его доступности, и работоспособность критических приложений. Включить в конфигурацию источник бесперебойного питания стоит хотя бы для того, чтобы элементарно защитить вычислительные узлы. Корректное выключение кластера в случае аварийного выключения питания поможет спасти данные долгих расчетов, а очень часто и значительное время, необходимое на восстановление работоспособности кластера.
На практике чаще всего возникают кратковременные скачки напряжения,
с чем любой
Обязательно завершите проектирование составлением подробной схемы кластерной системы, показывающей архитектуру комплекса, его составные части, детали компоновки, особенности размещения, структуру коммуникаций. Не забывайте в будущем модифицировать схему сразу после модернизации кластера, поскольку даже очевидные действия со временем забываются, и много времени будет уходить на восстановление и правильное описание текущей конфигурации.
И еще раз повторим вопрос, поставленный в конце предыдущего раздела. Будет ли кластер расширяться или как-то модифицироваться в будущем? Финансирование проекта часто появляется порциями и возникает большое желание сначала купить часть системы, а потом ее нарастить еще каким-то числом узлов. К такому сценарию развития кластерного проекта подталкивает и тот факт, что архитектуры кластерных систем хорошо масштабируются, поэтому принципиальных препятствий для расширения нет.
Если выбирается вариант последовательного развития кластерной
системы, то, как правило, выбирают два пути. Первый предполагает
добавления какого-то числа новых вычислительных узлов в существующую
систему. Основная проблема здесь одна: если возможность для расширения
появилась через полгода-год после создания первой версии системы, то
возникает вопрос о целесообразности покупки уже устаревшего
оборудования. Приобретать такие же узлы уже не хочется, так как на
рынке по схожей же цене есть более привлекательные модели. Но если
купить современные варианты узлов, то кластер перестанет быть
однородным, и возникнут очевидные проблемы с его использованием.
Второй путь развития - это полная замена каких-либо компонентов
системы на новые аналоги: более мощные процессоры, больший объем
памяти, новые диски, новые
Любое оборудование, даже фирменное и самое дорогое, ломается. Не пренебрегайте изучением гарантийных обязательств производителя, а также его технической поддержкой и сервисным обслуживанием. Эти позиции можно и нужно включать в проект. Гарантия производителя позволит заменить сбойную деталь или целый узел в случае брака, но на это может уйти несколько дней или даже недель. Техническая поддержка позволит избавиться от необходимости искать самим сбойный компонент и перепоручить эту обязанность профессионалам. Особенно удобно, если предусмотрена поддержка "on-site", когда специалист выезжает прямо на место установки кластера. Сервисное обслуживание позволит проводить не только обмен сбойных компонент, но и ремонт узлов.
Наличие гарантии, безусловно, дает уверенность в том, что сбойный компонент будет заменен. Однако оно не дает уверенности в том, что он будет заменен быстро. Если приложению необходимы все процессоры, а один из них вышел из строя, то дело встанет. Придется ждать замены, которая займет от нескольких дней, до нескольких недель в зависимости от гарантийных обязательств поставщика и производителя оборудования.
Чтобы избежать подобной неопределенности хорошим решением станет резервный узел. Его можно заранее сконфигурировать, но не
включать в общее счетное поле. При выходе одного из узлов из строя его
можно заменить резервным на время ремонта. Это особенно важно для тех
кластерных систем, в которых узлы расположены по некоторой жестко
заданной структуре, а выход из строя одного узла может нарушить
структуру целого сегмента (например,
Другое решение - это резервные запчасти. Вместо целого узла можно приобрести в резерв только наиболее часто ломающиеся детали, в частности, жесткие диски, вентиляторы для охлаждения, модули памяти, блоки питания, а также запасные коммуникационные карты.
По какому пути обеспечения резерва пойти в каждом конкретном
проекте: резервные узлы, компоненты или же вообще отказаться от
резерва, - это предстоит решить руководству каждого кластерного
проекта самостоятельно. Решение определяется и бюджетом, и стоящими
задачами, и требуемой степенью доступности
Всегда хочется как-то проверить принятые решения и сравнить с чем- то уже работающим, поэтому в Приложении 1 приведено несколько примеров программно-аппаратных конфигураций реально существующих кластерных систем. Множество других вариантов можно найти на страницах информационно-аналитического центра Parallel.ru, а также на сайте http://www.supercomputers.ru списка Тор50 самых мощных компьютеров СНГ - большинство из них являются кластерами.
Если говорить совсем кратко, то вычислительный кластер - это
совокупность компьютеров, объединенных в рамках некоторой сети для
решения одной задачи. В качестве вычислительных узлов обычно
используются доступные на рынке однопроцессорные компьютеры, двух или
четырехпроцессорные
Ясно, что простор для творчества при проектировании кластеров
огромен. Узлы могут не содержать локальных дисков, коммуникационная
среда может одновременно использовать различные сетевые технологии,
узлы не обязаны быть одинаковыми и масса прочих нюансов. Рассматривая
крайние точки, кластером можно считать как пару ПК, связанных
локальной сетью
Рассмотрим аппаратную сторону будущей
Рассмотрим базовые компоненты и их характеристики, которые должны учитываться при построении кластерных систем:
В процессе проектирования важно осознать, что сейчас для
конструирования
Начнем с того, что для эффективного обслуживания кластера не последнюю роль будет играть его компоновка. Лучшее решение - это расположение кластера в стойке. Даже для небольшого кластера из 4-6 узлов стойка уже уместна (рис. 3.1), при этом увеличение стоимости решения будет не столь существенным.
(рис 3.1) Пример стойки с пятью узлами и мониторомНе стоит сильно экономить на собственно стойке, так как недоработки ее конструкции могут в последствии превратиться в неожиданные проблемы. При выборе стойки следует обратить внимание на следующие нюансы.
Расположить стойку в помещении нужно так, чтобы был удобный доступ к узлам и спереди, и сзади. Спереди должно быть достаточно места для того, чтобы поместился узел из стойки и человек. Сзади будет выходить тепло, поэтому расстояние до стены должно быть достаточным для его рассеивания.
Обратите внимание, что стоечный крепеж обычно поставляется отдельно, поэтому, приобретая стойку, купите там же соответствующие винты и гайки. Стоит закупить их с запасом, чтобы сберечь свое время в будущем.
Не менее важным, чем выбор стойки, является выбор форм-фактора вычислительных узлов. Устоявшихся решений в настоящее время существует несколько.
(рис 3.2) Пример стойки с 30 узлами формата 1 UСтоечное решение с серверами 3-4 U. Обслуживание такого решения, наверное, самое легкое. Любое дополнительное периферийное оборудование устанавливается в такие серверы без особых проблем, охлаждение в них производится легко. Основным недостатком этого решения является то, что много таких узлов в стойку не войдет.
Стоечное решение с серверами 1-2 U (рис. 3.2). Вариант компактен, таких узлов в стойку войдет уже больше, чем в предыдущем случае, однако установить в них какую-то дополнительную плату иногда бывает весьма сложно. Тщательно продумайте конфигурацию узлов. Охлаждение в серверах небольшого размера, как правило, организуется сложнее, поэтому еще раз проверьте параметры и общий план разворачивания системы кондиционирования. Холодный воздух должен подаваться к передней части стойки, и кондиционер не должен располагаться слишком близко.
Стоечное решение на блейд-серверах (лезвиях). Самое компактное
решение, поэтому и стоимость его при прочих равных условиях немного
выше. Управление блейд-серверами обычно организуется с помощью
специальных средств, которые нужно будет дополнительно изучить. Такие
серверы, как правило, ограничены в плане расширения, и далеко не
всегда в них можно установить необходимую новую плату. Например, если
штатная
В последнее время появились компактные и исключительно мощные
стоечные кластерные решения. Например, компания Rackable Systems
(http://www.rackable.com) в конце 2006 года
анонсировала выпуск кластерных систем, построенных на основе стоечных
серверов размера 1U и четырехядерных процессоров Intel Xeon серии
5300. В одной стандартной стойке на 42 U может быть собран кластер с
(рис 3.3) Пример расположения кластера из 16 узлов на стеллажахНемного особняком стоит вариант, в котором обычные корпуса серверов располагаются на стеллажах (рис. 3.3). В этом случае кластер займет значительно больше площади, чем стоечное решение. Оборудование обойдется дешевле, однако обслуживание кластера в будущем станет организационно сложнее, а его развитие будет сильно ограничено.
Если число вычислительных узлов невелико, то может быть полезен
В некоторых случаях идут на совмещение функций вычислительного кластера и отдельных рабочих мест (учебного класса). На каждый узел ставится полный комплект: монитор, клавиатура, мышь, а разграничение функций производится административно, чаще всего, по времени: днем оборудование используется в режиме отдельных рабочих мест, а ночью в режиме кластерной вычислительной системы.
Выбор архитектуры и параметров вычислительных узлов, во многом,
определит характеристики будущего кластера. Тип и частота процессоров,
свойства чипсета, частота системной шины, объем и частота оперативной
памяти, ее конструктив, параметры кэш-памяти, состав портов и
поддержка
Основа - это выбор процессора, который будет диктовать
многие дальнейшие шаги. Одни
В последнее время все производители процессоров переходят на
многоядерные технологии, что нужно обязательно учитывать. Выбирая
одноядерные модели процессоров, можно значительно сэкономить в цене на
процессоры, однако больших перспектив это решение не имеет.
Вычислительный мир стал параллельным, число ядер на кристалле будет
только увеличиваться. Мы уже говорили о том, что первый основной
толчок к массовому использованию параллельных вычислительных
технологий дали
Останавливаясь на многоядерном варианте, проверьте, что эта пока еще новая особенность поддерживается на всех уровнях ПО: в компиляторах, библиотеках, в необходимых прикладных пакетах и системах. Есть ли смысл вкладываться в дорогую аппаратуру, если потом ее нельзя будет эффективно использовать? Однако при всех "за" и "против" различных вариантов, хотим подчеркнуть еще раз: в конечном итоге все определяется способностью кластера решить задачи проекта. Если с помощью такой-то конфигурации кластера задачи будут решены оптимально, то этот вариант и будет хорошим.
При проектировании архитектуры узлов обратите внимание на то, что
иногда с увеличением тактовой частоты процессоров растет не только их
производительность и стоимость. Для некоторых моделей это ведет к
росту
Для многих задач критически важным является объем и скорость работы
оперативной памяти. В этом случае лучше пожертвовать одним-двумя
вычислительными узлами в пользу покупки памяти с требуемыми
характеристиками. Если рассматривается вариант возможного увеличения
объема оперативной памяти в будущем, то обратите внимание на
конструктив
Схожий и весьма важный вопрос - структура и объем кэш-памяти. В
зависимости от типа процессора эти характеристики могут сильно
меняться, влияя на эффективность работы конечных приложений. При этом
важны не только количественные показатели, но и такие свойства, как
разделение кэш-памяти последнего уровня и доступа к системной шине
между отдельными ядрами процессора. Например, двуядерный процессор
Intel
Наличие локальных дисков на узлах кластера, на первый взгляд, кажется излишним. В самом деле, зачем тратить лишние деньги? Эти диски работать почти не будут, загрузку ОС можно сделать по сети, да и ее обновления в будущем делать будет проще. Примерно так нередко и рассуждают при построении кластера.
Верно, однако отсутствие локальных дисков влечет за собой и
потенциальные проблемы, о которых сначала не всегда задумываются.
Например, если возникнут
Еще одним весомым аргументом за включение дисков в состав узлов
является возможность локализации ввода/вывода для определенного класса
приложений. Если этого не предусмотреть, то все файловые операции
программ будут идти через
Floppy- и CD/
Если планируется использовать платы ServNet или аналогичные для организации сервисной сети, то может потребоваться наличие в узлах СОМ-порта.
Говоря об общей архитектуре, отметим, что кроме вычислительных узлов, необходимо предусмотреть головной узел кластерной системы. На головном узле пользователи компилируют свои программы, готовят данные для счета, проводят предварительную обработку данных. С головного узла производится запуск задач.
Совмещать головной узел с одним из вычислительных узлом не
рекомендуется, так как и работа пользователей будет затруднена, и
эффективность
Так как на головном узле, скорее всего, будут работать несколько
пользователей одновременно, то дополнительная оперативная память на
нем лишней не будет. Для ускорения работы локальных приложений стоит
установить в него быстрый жесткий диск или рейд-контроллер. К
процессору головного узла больших требований, как правило, не
предъявляется,
Весьма тонкий момент, который следует продумать заранее, это использование на головной машине процессора, отличного от процессоров вычислительных узлов. Часто компиляторы устроены так, что выполняют различного рода оптимизацию кода именно под тот процессор, на котором идет собственно процесс компиляции. Эта проблема, как правило, легко решается, поскольку многие компиляторы поддерживают режим кросс-компиляции, генерируя код целевого процессора, однако убедиться в эффективности и целесообразности такого режима работы нужно до заказа оборудования.
Кроме головного узла, в составе кластера необходим файл-сервер. Его функции могут быть переложены на головной узел, если предполагаемые нагрузки на сетевой диск будут не очень большими.
На файл-сервере стоит предусмотреть аппаратный рейд-контроллер.
Оптимальным является использование
В настоящее время большинство серверных
Если предполагается использовать
Сетевая инфраструктура в современных
Коммуникационная сеть - это тот компонент, который во
многом определит эффективность работы программ на будущем кластере,
поскольку именно с помощью этой сети процессы
Выбор
В данный момент на рынке доступны несколько стандартов сетевого оборудования, дающего скорости более 1 Гбит/с, и со значительно более низкой латентностью. Рассмотрим наиболее распространенные и доступные варианты.
(рис 3.4) Соединение узлов в трехмерный тор в сети SCIСетевая технология SCI. Скорость передачи данных около 700 Мбайт/с
(5,6 Гбит/с), аппаратная
С одной стороны такая архитектура кажется выгодной, так как не нужно приобретать дополнительного оборудования, только сетевые адаптеры. При добавлении новых узлов также не надо заботиться о покупке нового коммутатора. С другой стороны, опыт показывает, что эта технология весьма трудоемка при первоначальной настройке. Более того, находить ошибки или сбои в коммутации такой сети крайне сложно. Средств для ее диагностики существует очень мало. Но самым неудобным является то, что выход из строя одного вычислительного узла означает отключение двух (для двумерного тора) или трех (для трехмерного) колец связи. Сбой двух узлов в двумерном торе приведет к отключению еще двух других узлов, лежащих на пересечении отключенных колец. Для трехмерного тора аналогичное отключение произойдет при сбое трех узлов.
Сетевая технология Myrinet-2000/Myri-10G. Скорость передачи данных
- 2 Гбит/с и 10 Гбит/с соответственно. Для МРI-приложений достигается
скорость 247 Мбайт/с и 1,2 Гбайт/с,
Сетевая технология InfiniBand. Скорость передачи данных до
10 Гбит/с,
Технология
Данная технология одна из самых молодых среди аналогов, но и одна
из самых быстро развивающихся. При построении сети используются
коммутаторы, которые можно объединять между собой. Аппаратно
поддерживается маршрутизация пакетов, при этом дублирующиеся маршруты
используются для
При соединении нескольких коммутаторов часто используется топология
"
В настоящее время коммуникационные технологии развиваются очень
быстро. Недавно появились и уже сегодня доступны на рынке технологии
Quadrics и 10
Кроме
Разделение коммуникационной и
Еще одна сеть, о которой нужно обязательно упомянуть, это сервисная сеть. Эта сеть используется исключительно для обслуживания вычислительных узлов. Оконечным оборудованием для этой сети должен быть, строго говоря, даже не вычислительный узел, а устройство, способное его контролировать. На многих современных серверных платформах такие устройства устанавливаются изначально. Эти устройства доступны и отдельно, например, платы Hewlett-Packard Lights-Out или платы ServNet, разработанные в Институте программных систем РАН. Все они предоставляют различный уровень сервиса от минимальной возможности удаленно перезагрузить узел, включить или выключить питание, до получения графической консоли.
Крайне важной может оказаться информация с
Получить дополнительную информацию об упомянутых технологиях можно на сайте http://skif.pereslavl.ru/ (поиском слова ServNet) и поиском по ключевым словам "Lights-Out 100 Remote Management Card" на сайте http://www.hp.com.
Наличие сервисной сети сильно упрощает обслуживание кластера. Администратору не надо идти в другое помещение для того, чтобы перезагрузить зависший узел, можно быстро выяснить причину зависания, а в некоторых случаях даже переустановить ОС прямо со своего рабочего места.
Очень важный момент, про который забывают или на котором часто возникает желание сэкономить, - это обеспечение качественного электропитания. От этого будет зависеть и долговечность работы кластера, и степень его доступности, и работоспособность критических приложений. Включить в конфигурацию источник бесперебойного питания стоит хотя бы для того, чтобы элементарно защитить вычислительные узлы. Корректное выключение кластера в случае аварийного выключения питания поможет спасти данные долгих расчетов, а очень часто и значительное время, необходимое на восстановление работоспособности кластера.
На практике чаще всего возникают кратковременные скачки напряжения,
с чем любой
Обязательно завершите проектирование составлением подробной схемы кластерной системы, показывающей архитектуру комплекса, его составные части, детали компоновки, особенности размещения, структуру коммуникаций. Не забывайте в будущем модифицировать схему сразу после модернизации кластера, поскольку даже очевидные действия со временем забываются, и много времени будет уходить на восстановление и правильное описание текущей конфигурации.
И еще раз повторим вопрос, поставленный в конце предыдущего раздела. Будет ли кластер расширяться или как-то модифицироваться в будущем? Финансирование проекта часто появляется порциями и возникает большое желание сначала купить часть системы, а потом ее нарастить еще каким-то числом узлов. К такому сценарию развития кластерного проекта подталкивает и тот факт, что архитектуры кластерных систем хорошо масштабируются, поэтому принципиальных препятствий для расширения нет.
Если выбирается вариант последовательного развития кластерной
системы, то, как правило, выбирают два пути. Первый предполагает
добавления какого-то числа новых вычислительных узлов в существующую
систему. Основная проблема здесь одна: если возможность для расширения
появилась через полгода-год после создания первой версии системы, то
возникает вопрос о целесообразности покупки уже устаревшего
оборудования. Приобретать такие же узлы уже не хочется, так как на
рынке по схожей же цене есть более привлекательные модели. Но если
купить современные варианты узлов, то кластер перестанет быть
однородным, и возникнут очевидные проблемы с его использованием.
Второй путь развития - это полная замена каких-либо компонентов
системы на новые аналоги: более мощные процессоры, больший объем
памяти, новые диски, новые
Любое оборудование, даже фирменное и самое дорогое, ломается. Не пренебрегайте изучением гарантийных обязательств производителя, а также его технической поддержкой и сервисным обслуживанием. Эти позиции можно и нужно включать в проект. Гарантия производителя позволит заменить сбойную деталь или целый узел в случае брака, но на это может уйти несколько дней или даже недель. Техническая поддержка позволит избавиться от необходимости искать самим сбойный компонент и перепоручить эту обязанность профессионалам. Особенно удобно, если предусмотрена поддержка "on-site", когда специалист выезжает прямо на место установки кластера. Сервисное обслуживание позволит проводить не только обмен сбойных компонент, но и ремонт узлов.
Наличие гарантии, безусловно, дает уверенность в том, что сбойный компонент будет заменен. Однако оно не дает уверенности в том, что он будет заменен быстро. Если приложению необходимы все процессоры, а один из них вышел из строя, то дело встанет. Придется ждать замены, которая займет от нескольких дней, до нескольких недель в зависимости от гарантийных обязательств поставщика и производителя оборудования.
Чтобы избежать подобной неопределенности хорошим решением станет резервный узел. Его можно заранее сконфигурировать, но не
включать в общее счетное поле. При выходе одного из узлов из строя его
можно заменить резервным на время ремонта. Это особенно важно для тех
кластерных систем, в которых узлы расположены по некоторой жестко
заданной структуре, а выход из строя одного узла может нарушить
структуру целого сегмента (например,
Другое решение - это резервные запчасти. Вместо целого узла можно приобрести в резерв только наиболее часто ломающиеся детали, в частности, жесткие диски, вентиляторы для охлаждения, модули памяти, блоки питания, а также запасные коммуникационные карты.
По какому пути обеспечения резерва пойти в каждом конкретном
проекте: резервные узлы, компоненты или же вообще отказаться от
резерва, - это предстоит решить руководству каждого кластерного
проекта самостоятельно. Решение определяется и бюджетом, и стоящими
задачами, и требуемой степенью доступности
Всегда хочется как-то проверить принятые решения и сравнить с чем- то уже работающим, поэтому в Приложении 1 приведено несколько примеров программно-аппаратных конфигураций реально существующих кластерных систем. Множество других вариантов можно найти на страницах информационно-аналитического центра Parallel.ru, а также на сайте http://www.supercomputers.ru списка Тор50 самых мощных компьютеров СНГ - большинство из них являются кластерами.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.