
Научные открытия предоставляют базу новым технологиям, которые могут быть реализованы в новых и лучших продуктах, способных помочь клиентам решить бизнес-проблемы.
У IBM имеется богатый опыт открытий и инноваций, получивший международное признание. В дополнение к пяти Нобелевским Премиям, исследователи IBM получили пять Американских Медалей за Технологии (U.S. National Medals of Technology), пять Национальных Медалей за Научные Достижения (National Medals of Science) и 19 членств в Национальной Академии Наук (National Academy of Sciences). IBM Research имеет более 40 членов National Academy of Engineering.
В течение лет IBM регулярно получает патенты - всего более 25000 патентов – примерно на 7000 больше, чем ближайший конкурент. Но что более важно, чем статистика – это эффект, который эти патенты и открытия дают на рынке, и то, что они делают нечто действительно инновационное. Возможность создавать улучшенные технологии быстрее дает IBM значительное преимущество. За последние 10 лет, такие прорывы, как медные чипы, Web-кэширование и кремниево-германиевый сплав, помогли клиентам IBM получить значительное преимущество.

IBM лидирует по количеству патентов в течение последних 12 лет, значительно опережая ближайших конкурентов. При этом большая часть запатентованных технологий внедряется в промышленное производство в год их изобретения.
Значительную долю от общего числа патентов IBM составляют
патенты, которые были получены за технологии изготовления и
сборки полупроводниковых микросхем, разработанные
подразделением IBM

Copper Circuitry for Silicon Wafers
Медь – лучший электрический проводник, чем алюминий

SOI Silicon-On-Insulator
Тонкий слой SiO2 размещается под кремниевой поверхностью для изоляции миллионов транзисторов от электрических помех
Эти технологии позволяют увеличить количество транзисторов на чипе, повысить тактовую частоту, снизить электропотребление и повысить надежность процессоров.
В 1990 г. корпорация IBM начала выпуск первых систем RS/6000 $$\text{\textregistered}$$ на базе процессора POWER. С тех пор процессоры, созданные по технологии Power Architecture, не раз признавались лучшими в отрасли, а список используемых в них инновационных технологий становился все больше и больше. К таким крупным достижениям можно отнести технологию использования медных соединительных проводников, технологию "кремний на изоляторе", а также технологии применения двух ядер на одном кристалле и многопоточной обработки. В результате этих инноваций современные процессоры POWER5+ продолжают удерживать лидерство по показателям производительности.

John Cocke (30 мая 1925 – 16 июля 2002) – американский ученый, получивший наибольшее признание за его вклад в компьютерную архитектуру и оптимизацию компиляторов. Он признается многими как "отец RISC-архитектуры".
1980: IBM строит первый прототип компьютера на базе RISC (Reduced Instruction Set Computer) архитектуры. Основываясь на предложениях ученого Джона Кока (John Cocke) в начале 70-х, RISC-концепции упростили инструкции, выполняемые на процессорах. Сейчас RISC-архитектура – основа большинства рабочих станций и UNIX серверов и часто видится основной компьютерной архитектурой будущего.
1990: IBM анонсирует свою новыю линию компьютеров - RISC System -
RS/6000, которая сейчас называется IBM eServer pSeries (новое
название – IBM System p), под управлением AIX V3. Системная
архитектура получила название POWER (POWER1) -

Производительность компьютера зависит не только от производительности и количества процессоров, но и от множества других факторов, включая, например, производительность операционной системы.

На одном кристалле POWER4 и POWER5 находится два процессора, каждый со своим L1 кэшем и с общим L2 кэшем.
Развитие процессоров POWER применительно к серверам pSeries, а также IBM eServer i5 и iSeries $$\text{\texttrademark}$$ до 2007 г. предполагает усовершенствование вычислительных возможностей процессора POWER5, что позволит заказчикам превзойти доступные на сегодняшний день уровни загрузки вычислительных ресурсов и продуктивности.
На новом заводе впервые в мире (источник:
http://www.gorr.state.ny.us/gorr/10_10_00gov_ibm.htm) были
применены уникальные технологии IBM по производству
полупроводниковых кристаллов, такие как использование
медных соединительных проводников и технология "кремний
на изоляторе" (

В однопроцессорной системе на кристалле находится один процессор.

МCM используется при построении систем старшего уровня.

32-х процессорная система состоит из 4-х

На
Процессор POWER5 поддерживает 64-битную архитектуру
PowerPC. Один кристалл содержит два одинаковых
Инновационный дизайн. Высокая эффективность



Предоставляя одно- и много-поточное выполнение, POWER5 обеспечивает более высокую производительность в однопоточном режиме, чем его предшественник POWER4 на такой же тактовой частоте. Улучшения включают динамическую балансировку ресурсов для эффективного выделения системных ресурсов каждой нити, контролируемые программно приоритеты нитей и динамическое управление питанием для снижения энергопотребления без влияния на производительность.

POWER4 415mm2 115W @1.1
POWER4+ 267mm2 75W @ 1.2
POWER5 389mm2 167W @ 1.65
Процессор POWER5 был разработан с учетом двоичной и структурной совместимости с системами POWER4 для обеспечения поддержки всех существующих приложений.

Каждое
SMPLink – технология соединения без коммутации с очень малой задержкой, которая позволяет узлам быть соединенными как плоская SMP-система. Порты SMPLink находятся непосредственно на чипе POWER5. При подключении, SMPLink предоставляет прямое соединение между каждым чипом POWER5.
С внедрением

Улучшенный дизайн L1 кэша
Больший объем L2 кэша
Улучшенный дизайн L3 кэша
Контроллер каталога и памяти L3 – на чипе
Улучшенные алгоритмы
L1 кэш инструкций – двухпоточный, ассоциативный, с политикой замещения
L2 кэш доступен обоим ядрам на чипе. Он поддерживает полную аппаратную когерентность с системой и может поддерживать интервенцию данных в ядра на других чипах POWER5.
1.88 МБ (1920 КБ) L2 кэш физически реализован тремя слоями, каждое размером 640 КБ. Каждый слой имеет отдельные контроллеры. Каждое ядро имеет независимый доступ к каждому контроллеру. Слои – десятипоточные, ассоциативные. Десятипоточная ассоциативность (по сравнению с восьмипоточной на POWER4) позволяет снизить замусориванние кэша путем предоставления болльшего количества мест для хранения данных на каждой линии.
L3 кэш - 36 МБ, доступный обоим ядрам на процессорном чипе POWER5. Он обеспечивает полную аппаратную когерентность с аппаратурой системы и может обеспечивать интервенцию данных в ядра на других процессорных чипах POWER5. Логически, L3 – встроенный (inline) кэш. L3 кэш – не подмножество L2 кэша; одна и та же строка никогда не находится в них обоих одновременно. L3 кэш реализован как внешний, отдельный MLD чип, но его каталог находится на процессорном кристалле. Это помогает процессору проверять каталог после промаха по L2 без дополнительной задержки. L3 кэш в POWER5 находится на процессорной стороне фабрики. Этот дизайн позволяет обслуживать промахи по L2 кэшу чаще, избегая трафика на междучипном соединении.
Контроллер памяти также находится на чипе POWER5, что позволяет снизить задержки при доступе к памяти.

Процессор POWER4 поддерживает максимально 32-х процессорное симметричное мультипроцессирование. Большее количество процессоров увеличивает межпроцессорное взаимодействие, увеличивая тем самым более высокий уровень трафика.Это может негативно повлиять на масштабируемость системы. Перемещение L3-кэша на процессорную сторону фабрики позволяет процессору POWER5 обслуживать промахи по L2 более часто, с попаданиями в L3 кэш, избегая лишнего трафика на межпроцессорном соединении.Это обеспечивает больший уровень масштабирования.Сейчас системы на базе POWER5 поддерживают 64 процессора.
POWER4 содержит на чипе L2 кэш 1.41 МБ. Чип POWER4+ схож по дизайну с POWER4, но сделан по технологии 130 нм, в отличие от POWER4 (180 нм). POWER4+ содержит на чипе L2-кэш 1.5 МБ. POWER4 и POWER4+ имеют L3 кэш размером 32 МБ.

Микропроцессор POWER4 – высокочастотный, со спекулятивной
суперскалярностью, с возможностью выполнения инструкций в
другом порядке. Восемь независимых модулей выполнения
инструкций (
Чтобы загрузить их работой, каждый процессор может выбирать до восьми инструкций за такт и может диспетчеризировать и завершать до пяти инструкций за такт. Процессор способен отслеживать около 200 инструкций в каждый момент времени. Инструкции могут выполняться в порядке, отличном от начального, при этом отслеживвается их логический порядок. Инструкции могут выполняться спекулятивно для увеличения производительности, когда может быть сделано точное предсказание логического ветвления.

На современных процессорах находится большое количество специализированных модулей исполнения, каждый из них способен выполнять небольшую часть общего набора инструкций – часть выполняют целочисленные операции, часть – операции с плавающей точкой, и т.д. Эти модули способы работать параллельно, так, что несколько инструкций программы могут быть выполнены одновременно.
Однако, обычные процессоры выполняют инструкции из одного
потока. Несмотря на улучшения микроархитектуры, утилизация
модулей исполнения остается низкой. В среднем, она
составляет 25%. Для увеличения утилизации модулей
исполнения, разработчики используют параллелизм на уровне
нитей, при котором физический процессор выполняет
инструкции из разных нитей. Для операционной системы такое

При кропноблочной (
Крупноблочная многопоточность была представлена в серии процессоров IBM Star (например, RS64-IV, в системе S85), чтобы улучшить производительность системы для многих задач. Многопоточный процессор улучшает использование ресурса ядра процессора, выполняя несколько аппаратных потоков параллельно. В линии Star одновременно выполнялось два параллельных потока.
Процессор (например, RS64-IV) способен сохранять контекст двух нитей
Дает преимущество только при более, чем двухкратном превышении количества активных нитей количества процессоров
AIX должен создать нить-"пустышку" при нехватке реальных нитей
Ненужные переключения на нити-"пустышки" могут снизить производительность на ~20%
Основная идея состоит в том, что, когда одна или более нитей (потоков) процессора остановлены на большое временя ожидания (например, при промахе в кэш), другие работают на ядре. Однако, ОС AIX должна была знать о различии между логическими и физическими процессорами и отвечала за то, что каждый логический процессор имел диспетчеризируемую нить - даже создавая нити – "пустышки" (idle).
Необходимо отметить, что крупноблочная многопоточность
широко никогда не использовалась клиентами. Частично это было
вследствие того, что это не было активизировано по умолчанию и
требовало, перезагрузки для активизации. Другой причиной было
то, что прирост производительности был произвольным, и мог,
реально, иметь отрицательную величину. Для рабочих нагрузок с
высокими соотношениями нить/процессор (например,
При других нагрузках, например, системах бизнес-аналитики (BI),
где соотношение нить/процессор - <2:1, AIX вынужден создавать
фиктивные потоки. Переключение на\из этих фиктивных потоков
занимает приблизительно шесть процессорноых тактов, тогда как
без крупномоблочной многопоточности AIX вообще не
производил бы переключение контекста. Другой недостаток
крупноблочной многопоточности состоял в том, что он отключал
динамическое освобождение процессоров (Dynamic CPU

Вариант крупномоблочной многопоточности - детальная
многопоточность. Машины этого класса выполняют потоки в
последовательных циклах, циклическим способом. Этот дизайн
требует дублирования аппаратных средств. Когда поток
сталкивается с

Ядро процессора POWER5 поддерживает как многопоточный
режим (
Все задержки в POWER5, включая ошибки модуля предсказания
переходов и время ожидания загрузки с удачным обращением в кэш
данных L1, являются такими же, как в POWER4. Идентичная
конвейерная структура позволяет оптимизации, разработанной для
POWER4, работать на POWER5. В режиме
В однопоточном режиме, POWER5 использует только одну программу и может выбрать команды для этой нити каждый такт. Он может выбирать до восьми команд из кэша инструкций каждый такт.
Некоторые различия:
В процессоре 120 регистров общего назначения (GPR) и 120
регистров с плавающей точкой (
В однопоточном режиме, POWER5 делает все физические регистры доступными единственной нити, позволяя более высокий параллелизм на уровне инструкций.
L1 кэш инструкций и данных имеет тот же самый размер, как и в POWER4 - 64 КБ и 32 КБ - но их ассоциативность удвоилась.

В режиме
Дизайн POWER5 реализует двухпоточный
Каждый чип виден программному обеспечению как 4-way SMP
Приоритеты нитей контролируются аппаратурой, гипервизором или ОС
Динамическое переключение между одно- и много-поточным режимом
Какие рабочие нагрузки могут получить выигрыш от
Это - очень трудный вопрос, потому что преимущество одновременной многопоточности зависит от рабочей нагрузки. Большинство измерений коммерческих рабочих нагрузок показывает увеличение на 25-40 %, (некоторые – больше). Эти измерения были проведены на выделенном разделе. Одновременная многопоточность дает выигрыш и разделам в общем пуле
Можно также ответить со следующими общими соображениями. Любая
рабочая нагрузка, где большинство индивидуальных программных потоков
сильно использует любой ресурс в процессоре или памяти, извлечет немного
выгоды из одновременной многопоточности. Например, рабочие нагрузки,
которые выполняют большое количество операций плавающей точкой,
вероятно, извлекут немного пользы от одновременной многопоточности и -
что наиболее вероятно, даже потеряют в производительности. Они имеют
тенденцию сильно использовать модули выполнения с плавающей точкой или
полосу пропускания памяти, в то время как рабочие нагрузки, которые имеют
очень высокие количество тактов на инструкцию (CPI), имеют тенденцию
использовать процессор и ресурсы памяти плохо и обычно получают самую
большую выгоду от одновременной многопоточности. Эти большие CPI
обычно вызываются большим количеством неудачного обращения в кэш.
Большие коммерческие рабочие нагрузки типично имеют эту характеристику,
хотя это несколько зависит от того, совместно ли используют две нити
инструкции или данные, или же они полностью различны. Рабочие нагрузки,
которые совместно используют команды или данные, например, работающие
в пределах одного приложения, имеют больше выгоды от

Нити разделяют много ресурсов
Повышение производительности достигается балансировкой ресурсов между нитями
Цель динамической балансировки ресурсов состоит в том, чтобы гарантировать, что эти потока, выполняющиеся на одном процессоре, равномерно загружают систему. Динамическая балансировка ресурсов контролирует ресурсы, чтобы определить, является ли один поток сильно загружающим их. Например, если один поток сталкивается с множественными промахами по L2 кэшу, зависимые команды могут простаивать в очередях, замедляя другой поток. Чтобы предотвращать это, динамическая балансировка ресурсов приостанавливает такой поток.

Ситуации, когда предпочтительнее несбалансированное выполнение
Аппаратный/программный контроль приоритета нити
Настраиваемый приоритет нитей позволяет программному обеспечению определять, когда один поток должен иметь большую (или меньшую) долю ресурсов выполнения. (Все программные уровни - операционные системы, микропрограммные средства, и приложения - могут установить приоритет потока. Некоторые уровни приоритетов зарезервированы для установики только привилегированной инструкцией.)

Однопоточный режим выполнения
(
Вычислительные задачи получают
минимум преимуществ в
Определяется динамически на каждый процессор
Не все приложения извлекают выгоду из


Научные открытия предоставляют базу новым технологиям, которые могут быть реализованы в новых и лучших продуктах, способных помочь клиентам решить бизнес-проблемы.
У IBM имеется богатый опыт открытий и инноваций, получивший международное признание. В дополнение к пяти Нобелевским Премиям, исследователи IBM получили пять Американских Медалей за Технологии (U.S. National Medals of Technology), пять Национальных Медалей за Научные Достижения (National Medals of Science) и 19 членств в Национальной Академии Наук (National Academy of Sciences). IBM Research имеет более 40 членов National Academy of Engineering.
В течение лет IBM регулярно получает патенты - всего более 25000 патентов – примерно на 7000 больше, чем ближайший конкурент. Но что более важно, чем статистика – это эффект, который эти патенты и открытия дают на рынке, и то, что они делают нечто действительно инновационное. Возможность создавать улучшенные технологии быстрее дает IBM значительное преимущество. За последние 10 лет, такие прорывы, как медные чипы, Web-кэширование и кремниево-германиевый сплав, помогли клиентам IBM получить значительное преимущество.

IBM лидирует по количеству патентов в течение последних 12 лет, значительно опережая ближайших конкурентов. При этом большая часть запатентованных технологий внедряется в промышленное производство в год их изобретения.
Значительную долю от общего числа патентов IBM составляют
патенты, которые были получены за технологии изготовления и
сборки полупроводниковых микросхем, разработанные
подразделением IBM

Copper Circuitry for Silicon Wafers
Медь – лучший электрический проводник, чем алюминий

SOI Silicon-On-Insulator
Тонкий слой SiO2 размещается под кремниевой поверхностью для изоляции миллионов транзисторов от электрических помех
Эти технологии позволяют увеличить количество транзисторов на чипе, повысить тактовую частоту, снизить электропотребление и повысить надежность процессоров.
В 1990 г. корпорация IBM начала выпуск первых систем RS/6000 $$\text{\textregistered}$$ на базе процессора POWER. С тех пор процессоры, созданные по технологии Power Architecture, не раз признавались лучшими в отрасли, а список используемых в них инновационных технологий становился все больше и больше. К таким крупным достижениям можно отнести технологию использования медных соединительных проводников, технологию "кремний на изоляторе", а также технологии применения двух ядер на одном кристалле и многопоточной обработки. В результате этих инноваций современные процессоры POWER5+ продолжают удерживать лидерство по показателям производительности.

John Cocke (30 мая 1925 – 16 июля 2002) – американский ученый, получивший наибольшее признание за его вклад в компьютерную архитектуру и оптимизацию компиляторов. Он признается многими как "отец RISC-архитектуры".
1980: IBM строит первый прототип компьютера на базе RISC (Reduced Instruction Set Computer) архитектуры. Основываясь на предложениях ученого Джона Кока (John Cocke) в начале 70-х, RISC-концепции упростили инструкции, выполняемые на процессорах. Сейчас RISC-архитектура – основа большинства рабочих станций и UNIX серверов и часто видится основной компьютерной архитектурой будущего.
1990: IBM анонсирует свою новыю линию компьютеров - RISC System -
RS/6000, которая сейчас называется IBM eServer pSeries (новое
название – IBM System p), под управлением AIX V3. Системная
архитектура получила название POWER (POWER1) -

Производительность компьютера зависит не только от производительности и количества процессоров, но и от множества других факторов, включая, например, производительность операционной системы.

На одном кристалле POWER4 и POWER5 находится два процессора, каждый со своим L1 кэшем и с общим L2 кэшем.
Развитие процессоров POWER применительно к серверам pSeries, а также IBM eServer i5 и iSeries $$\text{\texttrademark}$$ до 2007 г. предполагает усовершенствование вычислительных возможностей процессора POWER5, что позволит заказчикам превзойти доступные на сегодняшний день уровни загрузки вычислительных ресурсов и продуктивности.
На новом заводе впервые в мире (источник:
http://www.gorr.state.ny.us/gorr/10_10_00gov_ibm.htm) были
применены уникальные технологии IBM по производству
полупроводниковых кристаллов, такие как использование
медных соединительных проводников и технология "кремний
на изоляторе" (

В однопроцессорной системе на кристалле находится один процессор.

МCM используется при построении систем старшего уровня.

32-х процессорная система состоит из 4-х

На
Процессор POWER5 поддерживает 64-битную архитектуру
PowerPC. Один кристалл содержит два одинаковых
Инновационный дизайн. Высокая эффективность



Предоставляя одно- и много-поточное выполнение, POWER5 обеспечивает более высокую производительность в однопоточном режиме, чем его предшественник POWER4 на такой же тактовой частоте. Улучшения включают динамическую балансировку ресурсов для эффективного выделения системных ресурсов каждой нити, контролируемые программно приоритеты нитей и динамическое управление питанием для снижения энергопотребления без влияния на производительность.

POWER4 415mm2 115W @1.1
POWER4+ 267mm2 75W @ 1.2
POWER5 389mm2 167W @ 1.65
Процессор POWER5 был разработан с учетом двоичной и структурной совместимости с системами POWER4 для обеспечения поддержки всех существующих приложений.

Каждое
SMPLink – технология соединения без коммутации с очень малой задержкой, которая позволяет узлам быть соединенными как плоская SMP-система. Порты SMPLink находятся непосредственно на чипе POWER5. При подключении, SMPLink предоставляет прямое соединение между каждым чипом POWER5.
С внедрением

Улучшенный дизайн L1 кэша
Больший объем L2 кэша
Улучшенный дизайн L3 кэша
Контроллер каталога и памяти L3 – на чипе
Улучшенные алгоритмы
L1 кэш инструкций – двухпоточный, ассоциативный, с политикой замещения
L2 кэш доступен обоим ядрам на чипе. Он поддерживает полную аппаратную когерентность с системой и может поддерживать интервенцию данных в ядра на других чипах POWER5.
1.88 МБ (1920 КБ) L2 кэш физически реализован тремя слоями, каждое размером 640 КБ. Каждый слой имеет отдельные контроллеры. Каждое ядро имеет независимый доступ к каждому контроллеру. Слои – десятипоточные, ассоциативные. Десятипоточная ассоциативность (по сравнению с восьмипоточной на POWER4) позволяет снизить замусориванние кэша путем предоставления болльшего количества мест для хранения данных на каждой линии.
L3 кэш - 36 МБ, доступный обоим ядрам на процессорном чипе POWER5. Он обеспечивает полную аппаратную когерентность с аппаратурой системы и может обеспечивать интервенцию данных в ядра на других процессорных чипах POWER5. Логически, L3 – встроенный (inline) кэш. L3 кэш – не подмножество L2 кэша; одна и та же строка никогда не находится в них обоих одновременно. L3 кэш реализован как внешний, отдельный MLD чип, но его каталог находится на процессорном кристалле. Это помогает процессору проверять каталог после промаха по L2 без дополнительной задержки. L3 кэш в POWER5 находится на процессорной стороне фабрики. Этот дизайн позволяет обслуживать промахи по L2 кэшу чаще, избегая трафика на междучипном соединении.
Контроллер памяти также находится на чипе POWER5, что позволяет снизить задержки при доступе к памяти.

Процессор POWER4 поддерживает максимально 32-х процессорное симметричное мультипроцессирование. Большее количество процессоров увеличивает межпроцессорное взаимодействие, увеличивая тем самым более высокий уровень трафика.Это может негативно повлиять на масштабируемость системы. Перемещение L3-кэша на процессорную сторону фабрики позволяет процессору POWER5 обслуживать промахи по L2 более часто, с попаданиями в L3 кэш, избегая лишнего трафика на межпроцессорном соединении.Это обеспечивает больший уровень масштабирования.Сейчас системы на базе POWER5 поддерживают 64 процессора.
POWER4 содержит на чипе L2 кэш 1.41 МБ. Чип POWER4+ схож по дизайну с POWER4, но сделан по технологии 130 нм, в отличие от POWER4 (180 нм). POWER4+ содержит на чипе L2-кэш 1.5 МБ. POWER4 и POWER4+ имеют L3 кэш размером 32 МБ.

Микропроцессор POWER4 – высокочастотный, со спекулятивной
суперскалярностью, с возможностью выполнения инструкций в
другом порядке. Восемь независимых модулей выполнения
инструкций (
Чтобы загрузить их работой, каждый процессор может выбирать до восьми инструкций за такт и может диспетчеризировать и завершать до пяти инструкций за такт. Процессор способен отслеживать около 200 инструкций в каждый момент времени. Инструкции могут выполняться в порядке, отличном от начального, при этом отслеживвается их логический порядок. Инструкции могут выполняться спекулятивно для увеличения производительности, когда может быть сделано точное предсказание логического ветвления.

На современных процессорах находится большое количество специализированных модулей исполнения, каждый из них способен выполнять небольшую часть общего набора инструкций – часть выполняют целочисленные операции, часть – операции с плавающей точкой, и т.д. Эти модули способы работать параллельно, так, что несколько инструкций программы могут быть выполнены одновременно.
Однако, обычные процессоры выполняют инструкции из одного
потока. Несмотря на улучшения микроархитектуры, утилизация
модулей исполнения остается низкой. В среднем, она
составляет 25%. Для увеличения утилизации модулей
исполнения, разработчики используют параллелизм на уровне
нитей, при котором физический процессор выполняет
инструкции из разных нитей. Для операционной системы такое

При кропноблочной (
Крупноблочная многопоточность была представлена в серии процессоров IBM Star (например, RS64-IV, в системе S85), чтобы улучшить производительность системы для многих задач. Многопоточный процессор улучшает использование ресурса ядра процессора, выполняя несколько аппаратных потоков параллельно. В линии Star одновременно выполнялось два параллельных потока.
Процессор (например, RS64-IV) способен сохранять контекст двух нитей
Дает преимущество только при более, чем двухкратном превышении количества активных нитей количества процессоров
AIX должен создать нить-"пустышку" при нехватке реальных нитей
Ненужные переключения на нити-"пустышки" могут снизить производительность на ~20%
Основная идея состоит в том, что, когда одна или более нитей (потоков) процессора остановлены на большое временя ожидания (например, при промахе в кэш), другие работают на ядре. Однако, ОС AIX должна была знать о различии между логическими и физическими процессорами и отвечала за то, что каждый логический процессор имел диспетчеризируемую нить - даже создавая нити – "пустышки" (idle).
Необходимо отметить, что крупноблочная многопоточность
широко никогда не использовалась клиентами. Частично это было
вследствие того, что это не было активизировано по умолчанию и
требовало, перезагрузки для активизации. Другой причиной было
то, что прирост производительности был произвольным, и мог,
реально, иметь отрицательную величину. Для рабочих нагрузок с
высокими соотношениями нить/процессор (например,
При других нагрузках, например, системах бизнес-аналитики (BI),
где соотношение нить/процессор - <2:1, AIX вынужден создавать
фиктивные потоки. Переключение на\из этих фиктивных потоков
занимает приблизительно шесть процессорноых тактов, тогда как
без крупномоблочной многопоточности AIX вообще не
производил бы переключение контекста. Другой недостаток
крупноблочной многопоточности состоял в том, что он отключал
динамическое освобождение процессоров (Dynamic CPU

Вариант крупномоблочной многопоточности - детальная
многопоточность. Машины этого класса выполняют потоки в
последовательных циклах, циклическим способом. Этот дизайн
требует дублирования аппаратных средств. Когда поток
сталкивается с

Ядро процессора POWER5 поддерживает как многопоточный
режим (
Все задержки в POWER5, включая ошибки модуля предсказания
переходов и время ожидания загрузки с удачным обращением в кэш
данных L1, являются такими же, как в POWER4. Идентичная
конвейерная структура позволяет оптимизации, разработанной для
POWER4, работать на POWER5. В режиме
В однопоточном режиме, POWER5 использует только одну программу и может выбрать команды для этой нити каждый такт. Он может выбирать до восьми команд из кэша инструкций каждый такт.
Некоторые различия:
В процессоре 120 регистров общего назначения (GPR) и 120
регистров с плавающей точкой (
В однопоточном режиме, POWER5 делает все физические регистры доступными единственной нити, позволяя более высокий параллелизм на уровне инструкций.
L1 кэш инструкций и данных имеет тот же самый размер, как и в POWER4 - 64 КБ и 32 КБ - но их ассоциативность удвоилась.

В режиме
Дизайн POWER5 реализует двухпоточный
Каждый чип виден программному обеспечению как 4-way SMP
Приоритеты нитей контролируются аппаратурой, гипервизором или ОС
Динамическое переключение между одно- и много-поточным режимом
Какие рабочие нагрузки могут получить выигрыш от
Это - очень трудный вопрос, потому что преимущество одновременной многопоточности зависит от рабочей нагрузки. Большинство измерений коммерческих рабочих нагрузок показывает увеличение на 25-40 %, (некоторые – больше). Эти измерения были проведены на выделенном разделе. Одновременная многопоточность дает выигрыш и разделам в общем пуле
Можно также ответить со следующими общими соображениями. Любая
рабочая нагрузка, где большинство индивидуальных программных потоков
сильно использует любой ресурс в процессоре или памяти, извлечет немного
выгоды из одновременной многопоточности. Например, рабочие нагрузки,
которые выполняют большое количество операций плавающей точкой,
вероятно, извлекут немного пользы от одновременной многопоточности и -
что наиболее вероятно, даже потеряют в производительности. Они имеют
тенденцию сильно использовать модули выполнения с плавающей точкой или
полосу пропускания памяти, в то время как рабочие нагрузки, которые имеют
очень высокие количество тактов на инструкцию (CPI), имеют тенденцию
использовать процессор и ресурсы памяти плохо и обычно получают самую
большую выгоду от одновременной многопоточности. Эти большие CPI
обычно вызываются большим количеством неудачного обращения в кэш.
Большие коммерческие рабочие нагрузки типично имеют эту характеристику,
хотя это несколько зависит от того, совместно ли используют две нити
инструкции или данные, или же они полностью различны. Рабочие нагрузки,
которые совместно используют команды или данные, например, работающие
в пределах одного приложения, имеют больше выгоды от

Нити разделяют много ресурсов
Повышение производительности достигается балансировкой ресурсов между нитями
Цель динамической балансировки ресурсов состоит в том, чтобы гарантировать, что эти потока, выполняющиеся на одном процессоре, равномерно загружают систему. Динамическая балансировка ресурсов контролирует ресурсы, чтобы определить, является ли один поток сильно загружающим их. Например, если один поток сталкивается с множественными промахами по L2 кэшу, зависимые команды могут простаивать в очередях, замедляя другой поток. Чтобы предотвращать это, динамическая балансировка ресурсов приостанавливает такой поток.

Ситуации, когда предпочтительнее несбалансированное выполнение
Аппаратный/программный контроль приоритета нити
Настраиваемый приоритет нитей позволяет программному обеспечению определять, когда один поток должен иметь большую (или меньшую) долю ресурсов выполнения. (Все программные уровни - операционные системы, микропрограммные средства, и приложения - могут установить приоритет потока. Некоторые уровни приоритетов зарезервированы для установики только привилегированной инструкцией.)

Однопоточный режим выполнения
(
Вычислительные задачи получают
минимум преимуществ в
Определяется динамически на каждый процессор
Не все приложения извлекают выгоду из

Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.