Снижение стоимости владения системой
RAS – надежность, доступность, ремонтопригодность
Мир информационных технологий переживает глубокие перемены, охватывающие все уровни, от поведения потребителя и запросов клиентов до спектра запрашиваемых услуг, включая даже такие, как критерии выбора аппаратного и программного обеспечения и архитектуры для построения инфраструктуры.
Сегодня делается все для того, чтобы обеспечить доступ к информации и приложениям из любого места и в любой момент времени.
В тоже время данная эволюция заставила всех IT-специалистов пересмотреть аспекты безопасности своих систем.
В таких условиях необходимо быстро реагировать и адаптироваться к
постоянно меняющимся требованиям и запросам рынка, в связи с этим
появляется новое понятие – Бизнес по требованию (On Demand
Business). В рамках концепции бизнеса по требованию, компания IBM
постоянно ведет разработку новых технологий. Одной из таких
технологий является программа автономных вычислений (
Цель программы автономных вычислений IBM – создание IT-систем, способных к автоматическому управлению своими компонентами и изолирующих сложную инфраструктуру от администраторов и пользователей. Данная работа базируется на открытых стандартах, необходимых для полноценной реализации этой стратегии в современном разнородном мире ИТ.

В долгосрочной перспективе автономные вычисления станут неизбежными, поскольку сложность зачастую сводит на нет преимущества доступности ресурсов. Среди технологий, появившихся с наступлением эпохи электронного Бизнеса по требованию, автономные вычисления, наверное, самая простая в понимании, но и потенциально самая сложная инновационная область. Самоуправляемая система должна обладать четырьмя атрибутами:
Защита от ошибок резервированием
Защита от ошибок изоляцией
Защита от ошибок переназначением
Зачастую приложения, устанавливаемые на сервер, должны функционировать 24 часа в сутки и остановка сервера ведет к значительным финансовым потерям предприятия. Поэтому одним из основных факторов, влияющих на выбор той или иной платформы, является отказоустойчивость аппаратных комплексов.
Компания IBM потратила много времени на развитие технологии RAS для мэйнфреймов, получивших широкую известность благодаря своей исключительной надежности. Наряду с прекрасно зарекомендовавшими себя технологиями мэйнфреймов, в серверах pSeries применен ряд новейших уникальных технологических разработок, которые позволили обеспечить еще больший уровень надежности по сравнению с системами подобного класса.
Отличное качество и надежность присуще линейке серверов pSeries во всех аспектах. Это делается для того, чтобы гарантировать работу этих серверов в тех случаях, когда требуется:
Возможности мэйнфреймов по диагностике, основанные на внутренних проверках ошибок, сборе данных об отказах, анализе результатов проверки ошибок без прекращения работы оборудования, доступны для процессоров, памяти, устройств ввода/вывода, элементов питания и охлаждения.

Процессор расположен на многокристальном модуле (Multi-Chip
Module), который напрямую соединен с системной платой. Такой
способ размещения был разработан специально для того, чтобы
повысить надежность, исключив ярусный способ расположения, при
котором отдельные процессорные модули располагаются на
процессорных платах, которые, в свою очередь, располагаются на
системной плате. Кроме того, сочетание в

Вот лишь некоторые функции, применяемые в серверах pSeries, позволяющие существенно повысить надежность аппаратно- программных комплексов:

Основываясь на данных об использовании серверов без возможности диагностики отказов в реальном времени, можно сказать, что серьезные отказы случаются в 2-3 раза чаще, если диагностика в реальном времени не используется. Система не может деконфигурировать какой-либо неисправный элемент, если его нельзя продиагностировать. Опыт и сравнение данных об эксплуатации серверов с и без возможности диагностики показывают, что сервера с такой возможностью имеют значительные преимущества.
Диагностика в системах pSeries выявляет примерно 95% отказов в

Сервисный процессор – это отдельный независимый процессор,
который обеспечивает инициализацию устройств во время

Для проведения диагностики в реальном времени, сервисный
процессор "общается" с сервером через сигналы предупреждения
(Attention signals) и специальный порт
При выявлении ошибки в каком-либо устройстве система
посылает сервисному процессору соответствующий сигнал
предупреждения. В ответ на такой сигнал сервисный процессор
читает содержимое соответствующего регистра

Основная конструкторская работа при разработке линейки pSeries была направлена на анализ и выявление критических точек в CEC для того, чтобы или совсем их исключить или добиться снижения вероятности отказа. Лучший способ сделать систему отказоустойчивой - это, в первуюочередь, предотвратить появление ошибок. Компоненты внутри CEC спроектированы таким образом, чтобы обеспечить уровень надежности, сравнимый с мэйнфреймами. Они проходят дополнительное тестирование в экстремальных условиях и подвергаются более жесткому отбору, чем стандартные промышленные компоненты, устанавливаемые в обычных UNIX-серверах.

Усиленная конструкция для высокой надежности:
Расположение элементов внутри CEC хорошо продумано и обеспечивает электромагнитнуюсовместимость, снижает вероятность возникновения ошибок, вызванных электрическими помехами, а также обеспечивает надежное крепление, которое предотвращает разрыв критически важных соединений при ударах или вибрации.

Внутри корпуса N+1 подсистема питания и охлаждения обеспечивают полнуюизбыточность на случай выхода из строя блоков питания, контроллеров питания, устройств охлаждения, и даже кабелей питания. Как и в мэйнфреймах zSeries, возможна немедленная замена компонентов питания и охлаждения.
В серверах pSeries имеется резервный внутренний аккумулятор IBF
(Internal

Дисковая корзина позволяет производить горячуюзамену дисков, обеспечивая динамическуюреконфигурациюи замену дисков. Каждый PCI-адаптер имеет функциюгорячей замены и доступен с тыльной стороны корзины ввода/вывода. Таким образом, при обслуживании PCI-адаптеров нет необходимости переключать корзину в режим обслуживания, при котором необходимо выдвинуть корзину и все подключенные к ней кабели для извлечения PCI адаптера из верхней части корзины. Такие движения корзины туда и обратно могут вызвать дополнительные сбои, связанные с повреждением самих адаптеров или подключенных к ним кабелей.

Стандартные чипы памяти имеют схему исправления одиночных
ошибок и обнаружения двойных (
В чипах памяти также используется "чистка" памяти (Memory scrubbing) и устанавливается критическое число исправляемых ошибок, превышение которого приводит к замене соответствующего модуля на резервный (dynamic bit steering).
"Чистка" памяти – это процесс, состоящий из чтения содержимого памяти во время бездействия, проверки и исправления одиночных ошибок. Одиночные ошибки могут быть устойчивыми (заводской брак) или случайными (вызванные, например, электрическим шумом).

Если удалось обнаружить ошибку, то данные пропускаются через
Если возникает ситуация, когда в модуле памяти возникает ошибка, а все резервные биты уже исчерпаны, то для предотвращения отказа системы сервисный процессор инициирует запрос на обслуживание модуля памяти.
System
Дисковая корзина позволяет производить горячуюзамену дисков,
обеспечивая их динамическуюреконфигурациюи замену. Системы
pSeries используют такие возможности ОС AIX, как AIX online
diagnostics,



Системы pSeries обладают огромными возможностями по обнаружению и предотвращению ошибок, так как обладают уникальными возможностями: "Динамическим отключением процессора" и "Постоянным отключением процессора". Обе используют такие возможности процессорной платы, как обнаружение ошибок и их изоляция, а также средства записи информации об ошибках. Таким образом, обеспечивается запись ключевой информации о сбоях. Запись происходит тогда, когда количество исправимых ошибок достигло критического числа.
Если процессор достигает критического числа сбоев, это событие записывается, а процессор будет помечен и деконфигурирован из системы. Операционная система продолжит работать на оставшихся процессорах.

При наличии резервного процессора (процессоров), установленного по программе Capacity on Demand, он будет автоматически активизирован в случае выхода из строя основного процессора.

Взаимодействие корзин ввода/вывода, системного ПО, а так же ОС
AIX позволяют исправлять периодические ошибки на шине и
переводить устройства в недоступное состояние в случае постоянной
ошибки четности. Этот механизм называется "Расширенной
Обработкой Ошибок" (
Для работы этого механизма необходимо, чтобы драйвер соответствующего устройства поддерживал функцию EEH. Такой драйвер должен отвечать на специальную последовательность данных, состоящую из одних единиц, обращением к системному ПО, которое, в свою очередь, должно протестировать PCI-слот и разрешить драйверу отключить его. Для достижения наивысших показателей доступности и отказоустойчивости компания IBM рекомендует использовать PCI-адаптеры только с поддержкой EEH.
Обычно, наличие логических разделов (LPAR) усложняет обслуживание сервера. Для того, что бы приспособить существующие средства диагностики, анализа и восстановления ошибок к работе с логическими разделами, было разработано специальное приложение, устанавливаемое на консоль управления. Это приложение называется Service Focal Point. Оно состоит из менеджеров ресурсов (resource managers), которые ведут наблюдение и записывают информацию о различных объектах системы. SFP сортирует и коррелирует информацию от менеджеров ресурсов и в случае необходимости инициирует звонок сервисному провайдеру. Оно так же имеет пользовательский интерфейс, через который можно просмотреть информацию о произошедших событиях и выполнить необходимые действия. После устранения проблемы, пользователь может записать последовательность действий, которую он выполнил. Эти данные в дальнейшем будут доступны представителям сервисного провайдера для того, чтобы определить какие действия предпринимались и соответственно скорректировать свои действия.
Electronic service agent

Сервисный агент состоит из 2 основных компонентов. Клиентская часть устанавливается на все копии операционной системы и наблюдает за ее состоянием. Она ведет наблюдение и анализирует все исправимые ошибки и при необходимости отправляет запрос на обслуживание SFP приложению.
Вторая составляющая сервисного агента – это шлюз, который устанавливается на консоль управления как часть SFP приложения и формирует как бы фокусную точку, в которой собирается вся необходимая информация для "звонка домой*quot;. Таким образом, уменьшается время простоя из-за отказа одного из компонентов системы, так как сервисному провайдеру предоставляется доступ к отчетам об ошибках, а также есть возможность заказать необходимые компоненты для замены прежде, чем сервисный инженер выедет на место. Следовательно, возможность неверного истолкования или недопонимания при выявлении ошибки исключается.

В системах на базе POWER5 появились такие дополнительные возможности, как резервирование сервисного процессора или замена I/O Drawer "на лету".
Встроенное программное обеспечение (firmware) записывается в двух копиях – Permanent и Temporary. При обновлении firmware нет необходимости в долговременном отключении системы – одна часть обновляется, в то время, как работа идет со второй частью. Для активизации достаточно перезагрузки.
В случае некорректного обновления firmware можно загрузиться с оставшейся копии.
Выбор firmware при загрузке определяется через сервисный процессор.

Надежность – один из важнейших факторов в производстве продукции класса hi-end. Технология RAS – неотъемлемая часть серверов pSeries и ОС AIX. Ее развитие начинается с создания архитектуры. Затем продолжается на стадиях разработки рабочего проекта и самого продукта, где идеи RAS еще раз пересматриваются, оцениваются и совершенствуются. Им следуют в процессе изготовления и выпуска серверов, когда качество находится под строгим контролем. И завершается в процессе обслуживания и технической поддержки, когда за надежностью сервера постоянно следят и когда проблемы, возникающие у заказчика, направляются по адресу.
Компоненты Reliablity, Availability, Serviceability:
Снижение стоимости владения системой
RAS – надежность, доступность, ремонтопригодность
Мир информационных технологий переживает глубокие перемены, охватывающие все уровни, от поведения потребителя и запросов клиентов до спектра запрашиваемых услуг, включая даже такие, как критерии выбора аппаратного и программного обеспечения и архитектуры для построения инфраструктуры.
Сегодня делается все для того, чтобы обеспечить доступ к информации и приложениям из любого места и в любой момент времени.
В тоже время данная эволюция заставила всех IT-специалистов пересмотреть аспекты безопасности своих систем.
В таких условиях необходимо быстро реагировать и адаптироваться к
постоянно меняющимся требованиям и запросам рынка, в связи с этим
появляется новое понятие – Бизнес по требованию (On Demand
Business). В рамках концепции бизнеса по требованию, компания IBM
постоянно ведет разработку новых технологий. Одной из таких
технологий является программа автономных вычислений (
Цель программы автономных вычислений IBM – создание IT-систем, способных к автоматическому управлению своими компонентами и изолирующих сложную инфраструктуру от администраторов и пользователей. Данная работа базируется на открытых стандартах, необходимых для полноценной реализации этой стратегии в современном разнородном мире ИТ.

В долгосрочной перспективе автономные вычисления станут неизбежными, поскольку сложность зачастую сводит на нет преимущества доступности ресурсов. Среди технологий, появившихся с наступлением эпохи электронного Бизнеса по требованию, автономные вычисления, наверное, самая простая в понимании, но и потенциально самая сложная инновационная область. Самоуправляемая система должна обладать четырьмя атрибутами:
Защита от ошибок резервированием
Защита от ошибок изоляцией
Защита от ошибок переназначением
Зачастую приложения, устанавливаемые на сервер, должны функционировать 24 часа в сутки и остановка сервера ведет к значительным финансовым потерям предприятия. Поэтому одним из основных факторов, влияющих на выбор той или иной платформы, является отказоустойчивость аппаратных комплексов.
Компания IBM потратила много времени на развитие технологии RAS для мэйнфреймов, получивших широкую известность благодаря своей исключительной надежности. Наряду с прекрасно зарекомендовавшими себя технологиями мэйнфреймов, в серверах pSeries применен ряд новейших уникальных технологических разработок, которые позволили обеспечить еще больший уровень надежности по сравнению с системами подобного класса.
Отличное качество и надежность присуще линейке серверов pSeries во всех аспектах. Это делается для того, чтобы гарантировать работу этих серверов в тех случаях, когда требуется:
Возможности мэйнфреймов по диагностике, основанные на внутренних проверках ошибок, сборе данных об отказах, анализе результатов проверки ошибок без прекращения работы оборудования, доступны для процессоров, памяти, устройств ввода/вывода, элементов питания и охлаждения.

Процессор расположен на многокристальном модуле (Multi-Chip
Module), который напрямую соединен с системной платой. Такой
способ размещения был разработан специально для того, чтобы
повысить надежность, исключив ярусный способ расположения, при
котором отдельные процессорные модули располагаются на
процессорных платах, которые, в свою очередь, располагаются на
системной плате. Кроме того, сочетание в

Вот лишь некоторые функции, применяемые в серверах pSeries, позволяющие существенно повысить надежность аппаратно- программных комплексов:

Основываясь на данных об использовании серверов без возможности диагностики отказов в реальном времени, можно сказать, что серьезные отказы случаются в 2-3 раза чаще, если диагностика в реальном времени не используется. Система не может деконфигурировать какой-либо неисправный элемент, если его нельзя продиагностировать. Опыт и сравнение данных об эксплуатации серверов с и без возможности диагностики показывают, что сервера с такой возможностью имеют значительные преимущества.
Диагностика в системах pSeries выявляет примерно 95% отказов в

Сервисный процессор – это отдельный независимый процессор,
который обеспечивает инициализацию устройств во время

Для проведения диагностики в реальном времени, сервисный
процессор "общается" с сервером через сигналы предупреждения
(Attention signals) и специальный порт
При выявлении ошибки в каком-либо устройстве система
посылает сервисному процессору соответствующий сигнал
предупреждения. В ответ на такой сигнал сервисный процессор
читает содержимое соответствующего регистра

Основная конструкторская работа при разработке линейки pSeries была направлена на анализ и выявление критических точек в CEC для того, чтобы или совсем их исключить или добиться снижения вероятности отказа. Лучший способ сделать систему отказоустойчивой - это, в первуюочередь, предотвратить появление ошибок. Компоненты внутри CEC спроектированы таким образом, чтобы обеспечить уровень надежности, сравнимый с мэйнфреймами. Они проходят дополнительное тестирование в экстремальных условиях и подвергаются более жесткому отбору, чем стандартные промышленные компоненты, устанавливаемые в обычных UNIX-серверах.

Усиленная конструкция для высокой надежности:
Расположение элементов внутри CEC хорошо продумано и обеспечивает электромагнитнуюсовместимость, снижает вероятность возникновения ошибок, вызванных электрическими помехами, а также обеспечивает надежное крепление, которое предотвращает разрыв критически важных соединений при ударах или вибрации.

Внутри корпуса N+1 подсистема питания и охлаждения обеспечивают полнуюизбыточность на случай выхода из строя блоков питания, контроллеров питания, устройств охлаждения, и даже кабелей питания. Как и в мэйнфреймах zSeries, возможна немедленная замена компонентов питания и охлаждения.
В серверах pSeries имеется резервный внутренний аккумулятор IBF
(Internal

Дисковая корзина позволяет производить горячуюзамену дисков, обеспечивая динамическуюреконфигурациюи замену дисков. Каждый PCI-адаптер имеет функциюгорячей замены и доступен с тыльной стороны корзины ввода/вывода. Таким образом, при обслуживании PCI-адаптеров нет необходимости переключать корзину в режим обслуживания, при котором необходимо выдвинуть корзину и все подключенные к ней кабели для извлечения PCI адаптера из верхней части корзины. Такие движения корзины туда и обратно могут вызвать дополнительные сбои, связанные с повреждением самих адаптеров или подключенных к ним кабелей.

Стандартные чипы памяти имеют схему исправления одиночных
ошибок и обнаружения двойных (
В чипах памяти также используется "чистка" памяти (Memory scrubbing) и устанавливается критическое число исправляемых ошибок, превышение которого приводит к замене соответствующего модуля на резервный (dynamic bit steering).
"Чистка" памяти – это процесс, состоящий из чтения содержимого памяти во время бездействия, проверки и исправления одиночных ошибок. Одиночные ошибки могут быть устойчивыми (заводской брак) или случайными (вызванные, например, электрическим шумом).

Если удалось обнаружить ошибку, то данные пропускаются через
Если возникает ситуация, когда в модуле памяти возникает ошибка, а все резервные биты уже исчерпаны, то для предотвращения отказа системы сервисный процессор инициирует запрос на обслуживание модуля памяти.
System
Дисковая корзина позволяет производить горячуюзамену дисков,
обеспечивая их динамическуюреконфигурациюи замену. Системы
pSeries используют такие возможности ОС AIX, как AIX online
diagnostics,



Системы pSeries обладают огромными возможностями по обнаружению и предотвращению ошибок, так как обладают уникальными возможностями: "Динамическим отключением процессора" и "Постоянным отключением процессора". Обе используют такие возможности процессорной платы, как обнаружение ошибок и их изоляция, а также средства записи информации об ошибках. Таким образом, обеспечивается запись ключевой информации о сбоях. Запись происходит тогда, когда количество исправимых ошибок достигло критического числа.
Если процессор достигает критического числа сбоев, это событие записывается, а процессор будет помечен и деконфигурирован из системы. Операционная система продолжит работать на оставшихся процессорах.

При наличии резервного процессора (процессоров), установленного по программе Capacity on Demand, он будет автоматически активизирован в случае выхода из строя основного процессора.

Взаимодействие корзин ввода/вывода, системного ПО, а так же ОС
AIX позволяют исправлять периодические ошибки на шине и
переводить устройства в недоступное состояние в случае постоянной
ошибки четности. Этот механизм называется "Расширенной
Обработкой Ошибок" (
Для работы этого механизма необходимо, чтобы драйвер соответствующего устройства поддерживал функцию EEH. Такой драйвер должен отвечать на специальную последовательность данных, состоящую из одних единиц, обращением к системному ПО, которое, в свою очередь, должно протестировать PCI-слот и разрешить драйверу отключить его. Для достижения наивысших показателей доступности и отказоустойчивости компания IBM рекомендует использовать PCI-адаптеры только с поддержкой EEH.
Обычно, наличие логических разделов (LPAR) усложняет обслуживание сервера. Для того, что бы приспособить существующие средства диагностики, анализа и восстановления ошибок к работе с логическими разделами, было разработано специальное приложение, устанавливаемое на консоль управления. Это приложение называется Service Focal Point. Оно состоит из менеджеров ресурсов (resource managers), которые ведут наблюдение и записывают информацию о различных объектах системы. SFP сортирует и коррелирует информацию от менеджеров ресурсов и в случае необходимости инициирует звонок сервисному провайдеру. Оно так же имеет пользовательский интерфейс, через который можно просмотреть информацию о произошедших событиях и выполнить необходимые действия. После устранения проблемы, пользователь может записать последовательность действий, которую он выполнил. Эти данные в дальнейшем будут доступны представителям сервисного провайдера для того, чтобы определить какие действия предпринимались и соответственно скорректировать свои действия.
Electronic service agent

Сервисный агент состоит из 2 основных компонентов. Клиентская часть устанавливается на все копии операционной системы и наблюдает за ее состоянием. Она ведет наблюдение и анализирует все исправимые ошибки и при необходимости отправляет запрос на обслуживание SFP приложению.
Вторая составляющая сервисного агента – это шлюз, который устанавливается на консоль управления как часть SFP приложения и формирует как бы фокусную точку, в которой собирается вся необходимая информация для "звонка домой*quot;. Таким образом, уменьшается время простоя из-за отказа одного из компонентов системы, так как сервисному провайдеру предоставляется доступ к отчетам об ошибках, а также есть возможность заказать необходимые компоненты для замены прежде, чем сервисный инженер выедет на место. Следовательно, возможность неверного истолкования или недопонимания при выявлении ошибки исключается.

В системах на базе POWER5 появились такие дополнительные возможности, как резервирование сервисного процессора или замена I/O Drawer "на лету".
Встроенное программное обеспечение (firmware) записывается в двух копиях – Permanent и Temporary. При обновлении firmware нет необходимости в долговременном отключении системы – одна часть обновляется, в то время, как работа идет со второй частью. Для активизации достаточно перезагрузки.
В случае некорректного обновления firmware можно загрузиться с оставшейся копии.
Выбор firmware при загрузке определяется через сервисный процессор.

Надежность – один из важнейших факторов в производстве продукции класса hi-end. Технология RAS – неотъемлемая часть серверов pSeries и ОС AIX. Ее развитие начинается с создания архитектуры. Затем продолжается на стадиях разработки рабочего проекта и самого продукта, где идеи RAS еще раз пересматриваются, оцениваются и совершенствуются. Им следуют в процессе изготовления и выпуска серверов, когда качество находится под строгим контролем. И завершается в процессе обслуживания и технической поддержки, когда за надежностью сервера постоянно следят и когда проблемы, возникающие у заказчика, направляются по адресу.
Компоненты Reliablity, Availability, Serviceability:
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.