Введение в отказоустойчивые технологии высокопроизводительных вычислительных систем (суб)микронного, супрамолекулярного и нанометрового диапазона

Современные вычислительные технологии и их аппаратные платформы

Показывать лекцию целиком

6.1. Особенности технологий, основанных на (сверх)массовом параллелизме

С момента зарождения и по настоящий день в развитии вычислительной техники решающую роль играют военные программы, которые консолидируют финансовые, интеллектуальные, материальные и технические ресурсы общества для решения задач выживания конкретного сообщества людей. В частности, с середины 80-х годов прошлого столетия DARPA [132] приступило к масштабным исследованиям в области беспилотных систем военного назначения в широком классе технотронных комплексов военного назначения, обеспечивающих нужды наземных, морских и воздушных вооружений и военной техники (ВВТ). (DARPA - Агентство по прорывным исследовательским проектам в области обороны - США.)

Под технотронными комплексами принято понимать автоматизированные технические средства, функционирование которых в принципе невозможно без использования вычислительной техники.

Основная направленность исследований по программам DARPA - это максимальная роботизация ВВТ "поля боя", тесно взаимодействующих с удаленными, наземными и аэрокосмическими человеко-машинными комплексами разведки и оперативного управления.

Основная цель - это максимальное снижение потерь живой силы по крайней мере в локальных военных конфликтах с технически отсталым противником.

Необходимое условие реализации - это создание интеллектуальных, высокопроизводительных, отказоустойчивых, защищенных от несанкционированного доступа, многоуровневых, неоднородных и распределенных ВС, построенных на принципах модульности и открытости их компонент, обеспечивающих как эволюционное развитие ВВТ, так и оперативное межвидовое взаимодействие непосредственно на "поле боя".

С учетом постоянной диспропорции между предоставляемой и требуемой производительностью, интеллектуальностью, отказоустойчивостью и т. д. (обычно 1/100) при создании таких ВС приходится использовать комплекс интенсивных факторов системотехнического уровня организации вычислений, которые поддерживаются достаточно специфическими технологиями проектирования и использования комплектующих сверх-или ультра-БИС и вычислительных устройств на их основе:

  • Кремниевая компиляция [98, 99, 134] - используется для создания программируемых и заказных СБИС или УБИС.
  • ПЛИС -технология [70, 135-137] - обеспечивает прямое отображение основных, интерфейсных и управляющих функций на (полу) заказные СБИС или УБИС ( ПЛИС - программируемые логические интегральные схемы).
  • Бит-процессорная технология [138-141] - обеспечивает отображение функций пользователя в "терминах" микропрограммного уровня организации вычислений в (Б)ВС с массовым параллелизмом, повышенной живучести и вычислительной устойчивости.
  • Технология систолических матриц [70, 142-149] - обеспечивает прямое отображение функций пользователя на матрицу алгоритмически ориентированных операционных устройств.
  • ЦПОС -технология [70, 150-158] - обеспечивает отображение проблемно-ориентированных функций пользователя в "терминах" языка низкого уровня ( ЦПОС - цифровой процессор обработки сигналов).
  • RISC -технология [159-168] - обеспечивает отображение проблемно-ориентированных функций пользователя в "терминах" языка высокого уровня многопроцессорных (Б)ВС ( RISC - редуцированная система инструкций на микропрограммном уровне управления).
  • CISC -технология - обеспечивает отображение функций пользователя в "терминах" языка высокого уровня в ВС с расширенной гарвардской архитектурой, в которой имеются локальные и глобальные шины обмена данными, командами и адресами, многоуровневая память и т. п. ( CISC - расширенная система инструкций на микропрограммном уровне управления).
  • Перечисленные технологии можно разбить на две группы (рис. 6.1):

  • (полу)прямого отображения реализуемых функций на кремниевые структуры, к которым относятся кремниевая компиляция и ПЛИС-технология;
  • (микро)программная реализация функций, создаваемых блоков и устройств ВС, что не исключает использование первых двух при создании сверх- и/или ультра-БИС, поддерживающих соответствующий (микро)программный уровень управления в последних технологиях. ПЛИС -технология является развитием технологии программируемых
  • логических матриц (ПЛМ) и вентильных матриц, которые настраиваются на функции пользователя либо на одной из последних фаз изготовления кристалла (например, металлизация связей или вскрытие контактных окон между слоями металлизации), либо по технологии (П)ПЗУ (реализуемое пользователем электрическое и, в частности, "флэш-программирование"). Бит-процессорная технология практически единственная, где отечественная микроэлектроника и вычислительная техника имеет перед

    (рис 6.1) Современные технологии компиляции

    зарубежными технологиями определенные приоритеты, так как ориентирована на МКМД-, а не на ОКМД-режим распараллеливания вычислений (МКМД - "множество команд - множество данных", ОКМД - "одна команда - множество данных").

    Для бит-процессорной технологии характерны:

  • высокая структурно-функциональная гибкость, реализуемая на микропрограммном уровне управления, доступном разработчику любого уровня иерархии ВС;
  • массовый ( $$10^{3}-10^{5}$$ ) векторно-конвейерный параллелизм по ассоциативно взаимодействующим потокам команд и данных;
  • простота процессорного элемента ( $$< 10^{3}$$ вентилей), обеспечивающая его проектную и диагностическую "прозрачность", что в сочетании с высоким уровнем топологической мультипликации (102-103 ячеек) позволяет достичь наиболее высоких уровней интеграции в сверх-, ультра-БИС и на целой пластине, не выдвигая завышенных требований к "интеллектуальным" и технологическим компонентам САПР.
  • Для систолических технологий характерно сочетание "алгоритмически ориентированного" задания функций, реализуемых отдельным элементарным вычислителем, сверхмассового ОКМД-параллелизма и (полу) заказной аппаратной реализации.

    ЦПОС -технология первоначально была ориентирована на создание и использование программируемых однокристальных средств цифровой векторно-матричной обработки сигналов с модифицированной фон-неймановской архитектурой. Поэтому в первых ЦПОС был аппаратно реализован арифметический сопроцессор плавающей запятой, исполняющий в одном цикле базовую операцию векторно-матричной обработки в составе двух ассемблерных команд: "умножение + суммирование с накоплением", а внутренние шины команд и данных разделены, что соответствует гарвардской архитектуре.

    По мере расширения конструктивно-технологических возможностей микроэлектроники в ЦПОС появились независимые адресные устройства и шины, а к концу 80-х годов на их основе стали строить многопроцессорные ВС со специализированными интерфейсами, что делает такие ВС эффективными только в определенных областях применения.

    Основное системное ограничение, регламентирующее темп обработки данных (темп реального времени) в однокристальных ЦПОС, вытекает из теоремы Котельникова и фон-неймановской организации вычислений, которые в совокупности требуют, чтобы программа обработки завершилась за время формирования одного отсчета сигнала. В результате при относительно несложной программе обработки из 10^{3} реально исполненных одноцикловых инструкций темп обработки данных в ЦПОС, работающих

    на тактовой частоте 0,3-1 ГГц, находится в пределах 100-300 кГц, что ограничивает спектр обрабатываемых сигналов ультразвуковым диапазоном.

    В RISC -технологии основная ставка делается на снижение аппаратно-временных системных издержек в ВС с высоким уровнем (102-103) распараллеливания вычислений, что достигается эффективной компиляцией с языка высокого уровня на уровень сокращенной системы команд ассемблерного уровня с постоянным циклом исполнения. В результате освобождается площадь кристалла для расширенной системы внутренних регистров, значительно упрощается устройство и процесс асинхронного управления, а значит, и повышается скорость обработки. При этом возрастает частота обращений к памяти, но падает продолжительность цикла обращения к ней, которое в RISC -процессорах находится в соотношении 2:1 ко времени выполнения команд. Для сравнения, в CISC -процессорах такое соотношение составляет 5:1.

    Чтобы сохранить соотношение 2:1 в многопроцессорных RISC -системах, их память должна быть распределенной, а чтобы повысить эффективность межпроцессорного обмена, чаще всего прибегают к сети, построенной по типу "ножка в ножку" с ближайшими соседями. Базовые положения этой технологии были апробированы в транспьютерных ВС, управление которыми обычно ведется методом волнового фронта, который представляет собой частный случай управления потоком данных.

    Существенно, что бит-процессорная, ЦПОС - и RISC -технологии реализуются через инструментальные кросс-системы и, как правило, не имеют собственных операционных систем, а в ответственных случаях эксплуатации и боевого применения поддерживаются наиболее устойчивыми к внешним воздействующим факторам КНД- и сапфировыми технологиями изготовления элементной базы [136] (КНД - кремний на диэлектрике).

    Современные CISC -технологии базируются на концепции языков высокого уровня, где аппаратные платформы строятся исходя из:

  • повышения эффективности выполнения программ, написанных на языках высокого уровня;
  • уменьшения нагрузок на компиляторы за счет перераспределения части их функций в сторону аппаратуры;
  • увеличения надежности программного обеспечения. Поставленные цели в CISC -технологии достигаются благодаря сближению структуры языка высокого уровня со структурой операций, реализуемых на уровне машинных команд, и со структурой управляющей информации.
  • Из приведенных данных можно заключить:

  • Современные технологии погружения задач пользователей в аппаратуру (Б)ВС исходят из их формализованной постановки, что требует опережающих, комплексных, фундаментальных исследований предметной области создания и использования ВВТ и средств управления ими, включая и вычислительную технику.
  • В зависимости от соотношения между требуемой и предоставляемой пропускной способностью (Б)ВС в современных технологиях погружения задач пользователей на уровень аппаратуры задействован широкий спектр методов и приемов от прямого отображения структуры аппаратуры в структуру языка ( CISC -технология) до прямого отображения структуры задачи в вентильную структуру заказной сверх- или ультра-БИС (кремниевая компиляция).
  • С позиций "быстрого" и "бездефектного" проектирования аппаратуры кремниевая компиляция [98, 99, 137, 153] является универсальным средством, используемым во всех технологиях, которые в этом смысле отличаются только уровнем детализации в стандартизованных спецификациях реализуемых аппаратных проектов (рис. 6.2):
  • в CISC -, ЦПОС - и RISC -технологиях - с точностью до списка стандартных команд ассемблера (слов-команд);
  • в ПЛИС - и бит-матричных технологиях - с точностью до однобитных и булевых операций.
  • Одно из главных достоинств кремниевой компиляции состоит в том, что она служит базой для комплексной системы диагностики, перекрывающей весь жизненный цикл от разработки средств вычислительной техники до ее эксплуатации и боевого применения в составе технотронных комплексов ВВТ, так как встроенные средства диагностики являются неотъемлемыми атрибутом сверх- и ультра-БИС, причем создание средств диагностики должно вестись нисходящим проектированием от задач, решаемых пользователем, и ограничений их правильного решения со стороны условий эксплуатации и боевого применения ВВТ и до аппаратурных блоков обнаружения и парирования отказов, которые вступают в конкуренцию за площадь кристаллов с основными функциональными блоками.
  • Современные кремниевые компиляторы специфицируют проект с точностью до маршрутной карты выращивания твердотельных или оптоэлектронных вентилей и обеспечивают выход на серийный выпуск сверх- или ультра-БИС в течение 3-6 месяцев. Несмотря на такую относительно высокую инерционность реализации проекта, кремневую компиляцию можно взять за основу перспективных технологий синтеза вычислительных супрамолекулярных соединений, в которых темп структурно-функциональной реконфигурации может быть приближен к темпу реального времени.
  • В средней перспективе структурно-функциональную реконфигурацию вычислительных (био)кристаллов и супрамолекулярных соединений можно проводить на основе более мобильных (рис 6.2) Спецификация стандартных технических решений современных копьютерных проектов
  • С учетом того, что система рис. 6.1 на всех этапах формализации и погружения задач пользователя на аппаратный уровень их реализации поддерживается (мини)супер-ЭВМ и рабочими станциями, оснащенными интерактивными программными оболочками, кремниевая компиляция является логическим завершением сквозной индустриальной технологии проведения фундаментальных и прикладных исследований с минимальным циклом внедрения их результатов в производство сложных технотронных изделий военного назначения.
  • Одним из решающих факторов минимизации цикла освоения в промышленности результатов фундаментальных и прикладных исследований служит интегрированная система диагностики технотронных изделий. Разработка таких диагностических систем является наиболее время- и трудоемким этапом приборных ОКР и должна вестись параллельно и одновременно с постановкой задач предметной области, но с учетом вариации всех системотехнических и физико-технических параметров, прямо или косвенно влияющих на работоспособность технотронных систем двойного назначения.
  • 6.2. RISC-архитектуры как компромисс между системотехническими требованиями и технологическими возможностями микроэлектроники

    История развития вычислительной техники связана с постоянным стремлением создателей компьютеров повысить их производительность.

    В 1949 году был создан первый компьютер EDSAC. Он мог выполнять около 100 арифметических операций в секунду при тактовой частоте 50 000 Гц. Производительность современных компьютеров возросла в десятки миллионов раз, достигнув миллиардов операций в секунду.

    Работы велись и ведутся в двух направлениях:

  • совершенствуется технология производства элементной базы, в результате сокращаются топологические размеры, растет степень интеграции, растут тактовые частоты;
  • создаются новые архитектуры, обеспечивающие более эффективную организацию вычислительного процесса.
  • Если посмотреть формально, то основной вклад в повышение производительности современных компьютеров обеспечен за счет новых архи-

    тектурных решений. Вклад технологической составляющей, связанной с ростом тактовой частоты, достаточно скромен.

    При этом нельзя забывать, что совершенствование структуры и архитектуры компьютеров невозможно без технологического прогресса в области микроэлектроники.

    По мере развития технологий, обеспечивших стремительный рост степени интеграции, микропроцессорная техника прошла путь от реализации на одной микросхеме отдельных элементов и узлов компьютера до создания на одном кристалле многопроцессорной системы.

    В настоящее время одним и важнейших критериев при определении архитектуры проектируемого процессора является соответствие предъявляемых ею системотехнических требований технологическим возможностям микроэлектроники.

    Одним из архитектурных решений, оказавшим существенное влияние на развитие вычислительной техники в последние три десятилетия, стала RISC (reduced instruction set computer) архитектура.

    История ее создания показывает с одной стороны, какую роль в развитии вычислительной техники могут сыграть достаточно простые архитектурные решения, а с другой стороны, какое значение в реализации научно-технического проекта имеют своевременное финансирование и его успешная коммерциализация.

    Далее сделаем небольшой экскурс в историю создания RISC-архитектуры. В его основу положены статьи Леонида Черняка [304,305] и Сергея Орлова [306].

    Исторически первой появилась архитектура, основанная на полном наборе команд, с появлением RISC архитектуры ее стали называть CISC (complex instruction set computer).

    Она характеризуется наличием большого числа сложных команд. Это число достигает нескольких сотен. Команды не имели фиксированной длины. Использовалась сложная система адресации. Все это вынуждало использовать достаточно сложные схемотехнические решения. Архитектура сформировалась эволюционно. Ее особенности были обусловлены стремлением экономить наиболее дорогостоящие ресурсы, в частности оперативную память. На начальном этапе развития вычислительной техники CISC- архитектура была доминирующей [159,160].

    Появление интегральных схем существенно изменило как технические характеристики используемой при проектировании процессоров элементной базы, так и стоимость вычислительных ресурсов. Изменилась шкала ценностей: основным приоритетом стало быстродействие. Это вызвало потребность в новых архитектурных решениях.

    Ответом на этот вызов стало появление RISC-архитектуры. Понятие RISC в его современном понимании стало результатом выполнения трех

    исследовательских проектов по созданию процессоров: процессора 801 компании IBM, процессора RISC университета Беркли и процессора MIPS Стенфордского университета.

    RISC-архитектура предполагает реализацию при проектировании процессоров следующего принципа: более компактные и простые инструкции выполняются быстрее.

    Этот принцип был сформулирован в 1975 году группой сотрудников IBM под руководством Джона Кока [161], работавшей над созданием специализированного процессора для управления телефонной станцией. В качестве прототипа использовалась ЭВМ IBM/360. При анализе ее работы было установлено, что для решения поставленной задачи используется не весь набор команд процессора. В результате возникла идея сократить набор команд процессора.

    В итоге появился проект универсального вычислительного устройства IBM 801 Project. В 1986 году на основе этого проекта 801была разработана рабочая станция IBM RT PC, а в 1990 году была создана рабочая станция RS/6000 на базе процессора POWER (Performance Optimized With Enhanced RISC) [304].

    В 1980 году к идее сокращения числа команд процессора также пришли ученые из Стэндфордского университета и университета Беркли.

    Им удалось получить финансирование своих исследований в рамках программы DARPA VLSI Program, целью которой была разработка универсальных наборов для создания компьютеров из готовых микросхем.

    В Беркли разрабатывался однокристальный процессор, насчитывающий примерно 40 тыс. транзисторов и обеспечивающий программирование на языке Си и работу в среде ОС Unix. Он должен был составить конкуренцию компьютеру VAX-11/780 корпорации DEC. Проектом руководил Д. Паттерсон.

    В итоге в 1984 году был создан 32-разрядный процессор RISC-II с 138 регистрами, работающий на частоте 3 МГц, который на целочисленных операциях по производительности превосходил VAX.

    В Стэнфорде проектом руководил Д. Хеннесси. В качестве прототипа использовался компьютер PDP-10 компании DEC.

    Успех RISC - архитектура во многом обусловлен ее широкой коммерциализации. Разработкой процессоров с этой архитектурой занимались компании MIPS Technology (MIPS), Hewlett - Packard (PA RISC), Sun Microsystem (SPARC), Motorola, Apple, IBM (PowerPC) и др.

    Были сформированы базовые принципы RISC-архитектур:

  • ограниченный набор простых команд, выполняемых за один такт;
  • использование команд "регистр-регистр";
  • доступ к памяти с помощью команд загрузки и выгрузки регистров;
  • аппаратное управление;
  • фиксированный формат и длина команд;
  • ограниченное количество методов адресации.
  • конвейерное выполнение команд
  • наличие большого числа регистров общего назначения;
  • Этот список можно было бы дополнять. Необходимо подчеркнуть еще раз, что в основе всего лежит идея использования небольшого числа простых команд, позволившая существенно упростить устройство управления процессора, благодаря чему появилась возможность перераспределить площадь кристалла между функциональными устройствами процессора (увеличив, в частности сверхоперативную память).

    Один из наиболее значимых результатов продвижения на рынок процессоров RISC-архитектуры - это известная PowerPC, которая является детищем альянса Apple, IBM и Motorola(AIM).

    Это самый типичный, если не классический RISC-процессор. Существуют 32- и 64-разрядные версии PowerPC (причем 64-разрядные совместимы с 32-разрядным кодом), а равно и ряд стандартизованных расширений (набора инструкций AltiVec).

    Достаточно долго RISC и CISC-архитектуры противопоставлялись друг другу. Но уже сегодня можно сказать, что грань между ними практически стерлась.

    Ярким примером объединения идеи CISC- и RISC-процессоров является методика построения процессоров, основанная на концепции EPIC.

    Основные принципы архитектуры EPIC были разработаны в университете Иллинойса. Архитектура EPIC объединяет различные технологические решения, которые обеспечивают существенное повышение скорости обработки и решение некоторых проблем трансляции программ. К этим решениям относятся:

  • поддержка явно выделенного компилятором параллелизма;
  • наличие большого регистрового файла;
  • наличие предикатных регистров;
  • спекулятивная загрузка данных из оперативной памяти;
  • поддержка предикатного выполнения команд;
  • аппаратная поддержка программной конвейеризации;
  • механизм переименования регистров;
  • наличие стека регистров;
  • использование поддержки компилятора для предсказания инструкций;
  • поддержка инструкций циклического выполнения команд.
  • Эта концепция была реализована компанией Intel в процессоре Itanium.

    В заключении следует отметить.

  • RISC-архитектура является хорошей иллюстрацией того, что любая предлагаемая архитектура должна соответствовать имеющимся технологиям.
  • Упех RISC-технологий был обусловлен максимальной консолидацией финансовых и интеллектуальных ресурсов США под эгидой Агентства по прорывным исследовательским проектам в области обороны, успешное продвижение инновационной технологии обеспечила коммерциализация инновационного проекта, изменившего стратегию создания изделий вычислительной техники.
  • 6.3. Особенности нейрокомпьютерных технологий

    На современном этапе развития вычислительной техники единственной альтернативой кремниевой компиляции является нейрокомпиляция, специфика которой в основном диктуется используемой элементной базой, которая:

  • представляет собой не логические вентили, реализующие базисные логические (булевы) функции, а многофункциональные или универсальные модули, которые оперируют в общем случае с многозначным входным и выходным алфавитом и модели которых не претерпели кардинальных изменений начиная с работ Мак-Каллока - Питтса и Ф. Розенблатта (начало 50-х годов прошлого столетия);
  • для реализации даже элементарных булевых функций использует более "сложные" арифметико-логические преобразования, что меняет на противоположное отношение "простой-сложный" между вентилями и модулями;
  • базируется на методах пороговой логики, основанных на прямой подстановке значений выходных сигналов в зависимости от принадлежности "взвешенной" суммы входных сигналов тому или иному пороговому интервалу.
  • В результате "программирование" нейрокомпьютера представляет собой синтез схем из нейроподобных элементов и в общем случае сводится к поиску:

  • для каждого элемента сети значений вектора порогов и весового вектора;
  • структуры связей в сети Мак-Каллока - Питтса или "нулевых" весовых коэффициентов в сети Ф. Розенблатта, элементы которой соединены между слоями по схеме "каждый с каждым".
  • В случае сетей с ограниченным количеством нейроподобных элементов к этим задачам добавляется еще разбиение всей функции на итеративно реализуемые подфункции.

    Сам синтез осуществляется через "обучение" нейросети "материнской" нейро-ЭВМ, формирующей на основе обучающей выборки и алгоритмов поиска пороговых и весовых векторов для "дочерней" нейро-ЭВМ (рис. 6.3).

    и/или энергии, кодирующими входные, промежуточные и результирующие потоки данных; $$T_{d}$$ - время жизни или удержания в рабочем состоянии проблемно-ориентированного (суб)процессора, которое в общем случае удовлетворяет неравенству $$T_{d} < r * n * N * \tau_{c}$$.

  • Дуальное ассоциативное взаимодействие потоков инструкций и данных приобретет вероятностный характер как с точки зрения пространственно-временной фиксации потоков инструкций, так и с точки зрения законов их взаимодействия с пространственно-временными потоками данных, так как в квантовых системах преобразования носят нелинейный характер и сами изменяются под воздействием преобразуемых потоков данных.
  • "Медленное" управление трансформируется в синтез вычислителя-потомка за счет деструкции "рабочего тела" вычислителя-предка как при переходе от одного поток-оператора к другому, так и при регенерации вычислителя-предка при $$T_{d} < r*n* N* \tau_{c}$$.

    "Быстрое" управление трансформируется в параметрическую адаптацию (упругую деформацию) структурно-функциональной схемы нанометрового или супрамолекулярного вычислителя под воздействием внешних управляющих сигналов, отличных по (био)физической или (био)химиче-ской модальности или по частотному спектру от сигналов, кодирующих потоки преобразуемых данных.

    "Сверхбыстрое" ассоциативное управление будет носить не только и не столько позитивный, сколько негативный характер, что сведет синтез такого управления не столько к созданию схемо- и системотехнических условий для его реализации, сколько к блокаде уже существующих локальных и глобальных паразитных ассоциаций.

    Таким образом, МКМД-бит-потоковые вычислительные технологии в современных условиях способны компенсировать технологическое отставание за счет более интенсивного использования системотехнических факторов организации вычислений. Благодаря этому они способны обеспечить паритет с зарубежными БВС по пропускной способности по потокам команд и данных, а по точности вычислений и по отказоустойчивости, как будет показано далее, они способны превзойти лучшие зарубежные образцы.

    Более того, МКМД-бит-потоковые вычислительные технологии обеспечивают минимальные системные издержки на реорганизацию вычислений и поддерживающие их программно-аппаратные инструментальные средства при переходе к нанометровой или супрамолекулярной элементной базе. Объясняется это тем, что в МКМД-бит-потоковых вычислительных технологиях:

    (рис 6.3) Структурно-функциональная схема работы нейро-ЭВМ

    Поэтому собственный "интеллект" нейрокомпьютерной системы сосредоточен в "материнской" нейро-ЭВМ и представлен:

  • средствами генерации обучающих последовательностей, содержащих входные воздействия и "правильные" реакции;
  • средствами поиска адекватных реакций нейросети, причем стратегия и алгоритмы поиска, а также обучающие последовательности выбираются или создаются "естественным интеллектом", от которого в конечном счете и зависит эффективность обучения.
  • При этом не исключается адаптация нейросети на заранее заданное множество задач, решаемых в режиме разделения времени, за счет

    модификации весовых коэффициентов, порогов и связей в "дочерней" нейросети. Такая перестройка нейросети инициируется либо извне, либо за счет интеллектуального блока собственных нужд, осуществляющего анализ летной, боевой и технической обстановки и вырабатывающего или выбирающего одну из возможных адекватных реакций на прогнозируемое или состоявшееся их изменение.

    Разделение на "материнскую" и "дочернюю" нейро-ЭВМ объясняется тем, что процессы обучения еще достаточно продолжительны во времени (единицы и десятки часов) и потребляют несравненно больший аппаратурный ресурс, чем порождаемые "дочерние" нейро-ЭВМ.

    Если отвлечься от методов и параметров настройки нейросети, то в современных компьютерных технологиях представлены практически все структурно-функциональные компоненты нейрокомпьютерных технологий:

  • Режим разделения времени между "обучением" и настройкой нейро-сети и ее использованием при решении задач наиболее полно представлен в бит-процессорных, систолических и ПЛИС -технологиях, что, по всей видимости, свойственно всем системам со (сверх)массо-вым параллелизмом.
  • Многофункциональные модули, "неэкономно" расходуемые на реализацию даже элементарных булевых функций, составляют основу бит-процессорных и ПЛИС -технологий.
  • Функции "материнской" нейро-ЭВМ широко представлены кросс-средствами и интеллектуальными интерактивными программными оболочками в бит-процессорных, систолических, ПЛИС -, ЦПОС - и RISC -технологиях.
  • Принцип "одна инструкция - один процессор" и вытекающий из него (сверх)массовый параллелизм является базовым для МКМД-бит-процессорных матриц и (полу)заказных спецпроцессоров, реализуемых по ПЛИС -технологии и кремниевой компиляцией. Отсюда следует, что нейрокомпьютерные технологии интегрируют в себе
  • практически полный спектр атрибутивных свойств современных компьютерных технологий, определяющих потребительские свойства БВС военного назначения с наиболее экстремальными и противоречивыми по современным меркам требованиями к производительности (пропускной способности по потокам команд), отказоустойчивости и вычислительной устойчивости.

    Принципиальное отличие нейрокомпьютерных от традиционных компьютерных технологий проектирования и использования ЭВМ состоит в следующем:

  • Настройка нейрокомпьютера не требует формализованной постановки задач пользователя, и для его "обучения" достаточно использовать существенно неполные, но репрезентативные выборки данных, полученные специалистами предметной области либо экспериментальным путем, либо имитационным моделированием, что типично для систем реального времени военного назначения, особенно на этапах доводки.
  • Нейрокомпьютер изначально ориентирован не на вычисления, а на прямое отображение входных воздействий сети в ее выходные реакции, даже если сеть используется в итеративном режиме.
  • Методы и алгоритмы "обучения" нейросетей инвариантны задачам пользователя и при настройке на разные классы задач могут отличаться только временем поиска параметров и объемами "дочерней" нейросети.
  • Погружение задач пользователя на нейросетевой уровень реализации не требует поиска их булева представления и может быть остановлен на уровне множества функций, описывающих пространственно-временные и физико-химические процессы в квантовых системах (рис. 6.4).
  • (рис 6.4) Структурно-функциональная схема нейрокомпиляции

    Из приведенных данных можно заключить:

  • К утверждениям о том, что нейрокомпьютеры обеспечивают наиболее высокое соотношение "производительность/стоимость", следует относиться с определенной осторожностью, так как при определении этого показателя качества сторонники нейрокомпьютерных технологий учитывают только аппаратно-временные затраты на "дочернюю" нейро-ЭВМ и не учитывают затраты на "обучение" "материнской" нейро-ЭВМ.
  • Высокий уровень аппаратно-временных затрат на "материнскую" нейро-ЭВМ вынуждает использовать современные "дочерние" нейро-ЭВМ в проблемно- или алгоритмически ориентированных (суб)процессорных трактах с заранее фиксированным множеством ответных реакций на изменения боевой, воздушной и технической обстановки. В результате по реально используемой структурно-функциональной гибкости нейрокомпьютерные (суб)процессорные тракты остаются пока еще сопоставимыми с обычными компьютерами, работающими под управлением оттранслированного программного обеспечения.
  • Циклы (пере)обучения современных нейро-ЭВМ составляют от единиц до десятков часов, что не позволяет включить задачи (пере) обучения в контур реального времени технотронных комплексов двойного назначения. Более того, психофизиологические и нейрофизиологические данные указывают на серьезную опасность решения задач (пере)обучения в условиях активного противодействия "противника", который может спровоцировать кривую обучения с помощью случайной обучающей выборки, что приведет к полной потере управляемости технотронных комплексов двойного назначения.
  • Переход к нейрокомпьютерным технологиям не снижает требований к качеству и глубине физико-технических и математических исследований предметной области, так как от этих исследований зависят качество и корректность отбора обучающей выборки, стратегии и алгоритма поиска, критерии адекватного останова алгоритмов поиска параметров настройки "дочерней" нейро-ЭВМ и т. п.
  • Тем не менее, качественные изменения в нейрокомпьютерной технологии погружения задач пользователя на аппаратный уровень исполнения проявляются начиная с глобальных этапов проектирования технотронных комплексов двойного назначения.

    В традиционных компьютерных технологиях на первом этапе обычно проводится статистическая обработка результатов экспериментов, которая завершается построением или уточнением аналитической модели.

    На втором этапе, который существенно отстоит по времени от первого, осуществляется поиск "оптимального" представления аналитической модели предметной области в структурно-операционном базисе используемой ЭВМ. Сформированная таким образом вычислительная модель предметной области, как правило, отличается от "усредненной" аналитической модели по темпу реального времени, времени задержки, характеристикам вычислительной устойчивости, зависящим от точности обработки потоков данных, и т. д.

    В результате технотронные системы двойного назначения оказываются "оптимальными в среднем" и для достаточно широкого комплекса внешних условий, который в реальной боевой и технической обстановке реализуется с достаточно низкой вероятностью, что приводит к недоиспользованию тактико-технических характеристик технотронных комплексов двойного назначения.

    Адаптивные технотронные системы потенциально способны изменять стратегию, критерии оценки качества и сами алгоритмы управления ресурсами технотронных комплексов двойного назначения в зависимости от этапов ведения боевых действий, решаемых комплексов задач, действующих векторов ограничений и т. д. Однако чтобы в полной мере использовать возможности адаптивного управления ресурсами комплексов двойного назначения, их технотронные системы дол жны в реальном времени синтезировать или хотя бы компоновать вычислительные алгоритмы и программы, что неосуществимо современными инструментальными средствами.

    Переход к нейрокомпиляции позволяет включить синтез нейро-вычислителей в общий контур оптимизации технотронных комплексов двойного назначения, а усредняющую обработку распределить между этапом статистической обработки эмпирических данных и этапом статистической оптимизации самой нейросети в соответствии со стратегией и алгоритмами ее адаптации под реальные условия эксплуатации и (боевого) применения технотронных комплексов двойного назначения.

    Однако темп обучения современных нейрокомпьютеров пока еще таков, что глубокая структурно-функциональная адаптация нейросетей может быть проведена (территориально удаленным) квалифицированным персоналом в условиях предбоевой подготовки, когда уже достаточно четко очерчен "сценарий боя" и условия его проведения.

    Такая предбоевая адаптация технотронных комплексов двойного назначения служит еще одним доводом в пользу выделения средств вычислительной техники в самостоятельный вид боевого обеспечения.

    Таким образом, пока не будет совершен качественный скачок в области обучающих нейрокомпьютерных систем, главное позитивное влияние нейрокомпьютерных технологий можно ожидать в области погружения задач пользователя либо на уровень аппаратурной реализации, либо на уровень технологических процессов изготовления элементной базы, так как в этом случае отпадают интеллектуально- и времяемкие этапы формализации задач и алгоритмов и их бездефектного программирования, а само погружение можно будет осуществлять в темпе предбоевой подготовки.

    6.4. Роль и место нейроподобных вычислительных систем в технотронных комплексах двойного назначения

    Как и любая вычислительная математика, современная нейромате-матика развивается в двух направлениях:

  • совершенствование методов и алгоритмов "обучения" нейросетей, что соответствует развитию системных программных платформ традиционной вычислительной техники;
  • повышение эффективности использования нейросетевых алгоритмов (в том числе управления и адаптации нейросетей) при решении задач предметной области.
  • Если выбраны множество обучающих выборок и способы вычисления суммарной оценки, то задача обучения нейросети превращается в задачу многомерной оптимизации, где отечественная наука имеет достаточно высокие приоритеты перед зарубежной.

    Однако зарубежные ученые имеют несопоставимое преимущество в получении индустриальными методами экспериментальных обучающих выборок и полунатурной имитации процессов предметной области за счет широкого спектра доступных им интеллектуальных мини-супер-ЭВМ и рабочих станций с быстро модифицируемыми устройствами сопряжения с объектом. В результате можно ожидать, что отечественные нейрокомпьютеры будут выигрывать у зарубежных по скорости сходимости алгоритмов обучения, но проигрывать по уровню адекватности и/или достоверности принимаемых решений.

    Отличительная особенность задач обучения нейросетей состоит в том, что их оптимизация базируется на поисковых методах и алгоритмах, которые хорошо поддаются распараллеливанию, как по многомерному аргументу, так и по частным критериям качества. Поэтому зарубежные исследователи имеют более широкие возможности в компенсации низкой скорости сходимости алгоритмов и поиска векторов настройки нейросетей за счет более высокого коэффициента распараллеливания вычислений.

    Современные исследования нейроматематики в военной области сконцентрированы на плохо формализуемых задачах эксплуатации и боевого применения ВВТ. Плохо формализуемыми считаются задачи подавления естественных и искусственных помех, учета маскирующего влияния местности и т. п. Для них характерна высокая зависимость законов управления от возмущающих факторов при фиксированных начальных и конечных состояниях объекта управления и "некорректность" системы ограничений на ресурсы управления, что достаточно типично для военной робототехники, систем вооружений, систем "слепого" захода на посадку на подвижное основание и т. д.

    Нейронные сети для решения задач на борту летательных аппаратов
    Название Разработчик Год разработки Применение Ограничения Примечание
    Теория адаптивного резонанса G.Carpenter S.Grossberg 1986-1987 Распознавание сложных и непривычных для людей образов (распечатки радиолокатора или сонара) Чувствительна к искажениям и изменению масштаба Очень сложная, применима для ограниченного круга задач
    Avalanch S.Grossberg 1967 Распознавание речи, обучение рук робота управляющим командам Точное воспроизведение моторных последовательностей, поэтому трудно менять скорость и интерполировать движения Совокупность сетей - ни одна отдельная сеть не может выполнить все перечисленные задачи
    Back propagation P.Werbos D.Parker D.Rumelhart 1974-1985 Синтез речи и текста, адаптивное управление Только контролируемое обучение, необходимость в наличии большого количества обучающих примеров Самая популярная сеть, хорошо работает, не вызывает затруднений при ее освоении
    Двунаправленная ассоциативная память B.Kosko 1985 Ассоциативная память Низкая плотность размещения информации в памяти, данные должны быть правильно закодированы Самая простая сеть, хорошее средство обучения, ассоциирует фрагментарные пары объектов с целыми парами
    Машины Больцмана и Коши J.Hinton T.Sejnowsky J.Hopkins H.Szu 1985-1986 Распознавание образов для радиолокаторов, сонаров и т. п. Машины Больцмана требуют много времени для обучения. Машины Коши генерируют шум в правильном статистическом распределении Простые сети, в которых функция шума используется для нахождения глобального минимума
    Brain State in a Box J.Anderson 1977 Извлечение знаний из баз данных Однократное принятие решения - без итеративного рассуждения Аналог двунаправленной ассоциативной памяти при дополнении фрагментарной входной информации
    Cerebellatron D.Mar J.AIbus A.Pillionez 1969-1982 Управление моторной функцией рук робота Требует сложного управления Аналогична Avalanch, может использовать несколько последовательностей команд с различными весами для гладкой интерполяции движений
    Counter propagation R.Hecht-Nielsen 1986 Сжатие изображения, статический анализ Для высокой точности требуется большое количество обрабатываемых элементов Действует как самопрограммируемая просмотровая таблица, аналогична Back propagation, но проще и менее производительна
    Hopfield J.Hopfield 1982 Восстановление полной информации и образов по фрагментам Не обучается, и веса должны быть установлены заранее Возможна реализация сети большой размерности
    Madaline B.Widrow 1960-1962 Адаптивное реагирование на активные помехи РЛС (адаптивные модемы и эквалайзеры) Предполагает линейное соотношение между входом и выходом
    Неокогнитрон K.Fukushima 1978-1984 Распознавание написанных от руки знаков Требует очень большого количества обрабатываемых элементов и соединений Самая сложная из разработанных сетей, невосприимчива к различиям в масштабе, поворотам, способна распознавать сложные буквы
    Персептрон F.Rosenblatt 1957 Распознавание печатных знаков Не может распознавать сложные знаки, чувствительна к различиям в масштабе, искажениям Самая старая, аппаратные средства на ее основе практически не используются
    Самоорганизующаяся проекция T.Kohonen 1980 Проецирует одну геометрическую область на другую (прямоугольную сетку на самолет) Требует продолжительного обучения Более эффективна, чем многие алгоритмические способы для расчета аэродинамического потока
    Нейрокомпьютеры в разработках военной техники США
    Тип и название нейросетевой системы Назначение Комментарий
    Нейросетевые алгоритмы, адекватные сети Хопфилда (программа фирмы Локхид) Управление лазерным оружием В нейрочипе находятся 256 нейронов с реализуемыми внутри кристаллов переключаемыми резисторами в диапазоне от 8 до 256 (8, 16, 32, 64, 128, 256 Ком). Нейрочип управляется с частотой 90 КГц. Изменение сопротивления от нейрочипа к нейрочипу 4 %, внутри нейрочипа 2 %. На плате размещаются 16 нейрочипов, реализующих 128 изменяющихся весовых коэффициентов. Находится в стадии разработки
    SIANN (Satellite Image Analysis using Neural Network) Обработка информации со спутников (распознавание классов поверхностей) Число итераций нейросети и время настройки при программировании алгоритма на ЭВМ VAX Station 3540:
    Обучающее множество Число признаков Число итераций Время настройки
    1 4 1790 5.6 мин
    2 5 2278 7.8 мин
    3 6 711 2.7 мин
    4 7 351 1.5 мин
    5 8 316 1.3 мин
    6 9 456 2.1 мин
    Зависимость вероятности ошибки от числа признаков, выбираемых для обучения нейросети при распознавании изображения
    Размер локального окна m Р/а t: Вероятность правильного распознавания
    2*2 0.5 0.9 96.0
    0.6 0.9 94.7
    0.8 0.9 96.7
    0.6 0.5 96.0
    0.6 1.0 96.7
    3*3 0.5 0.9 99.3
    0.6 0.9 100
    0.8 0.9 99.3
    0.6 0.5 99.3
    0.6 1.0 100
    4*4 0.5 0.9 95.3
    0.6 0.9 95.3
    0.8 0.9 95.3
    0.6 0.5 96.0
    0.6 1.0 95.3
    5*5 0.5 0.9 90.7
    0.6 0.9 94.7
    0.8 0.9 94.0
    0.6 0.5 94.0
    0.6 1.0 94.0
    Р/о. - отношение коэффициентов в итерационных процедурах: порогов и весовых коэффициентов нейронной сети m - длина волны (микроны)
    GRASS (Geographic Resurces Analysis Support System) Обработка изображений со спутников в интересах картографических систем Нейросетевой эмулятор - DYNA QBR
    ICARE (Image Cartography Expert) Обработка сложной географической информации, основанная на стандартной географической информации и экспертных знаниях Включает в себя нейросетевую систему для ускорения вычислений
    Нейросетевые алгоритмы распознавания типов облаков Распознавание классов облаков Используется пакет программ Professional 2 softwеre package фирмы Neural Ware, Inc
    Вероятность правильного распознавания: процент используемого архива изображений для обучения
    Номер обучающей выборки 10 % 20 %
    1 80 92.67
    2 84 93.30
    3 82.67 94.00
    4 81.33 94.67
    5 81.33 94.00
    6 82.69 94.00
    ТМАР (Teleoperated Mobile All-purpose Platform) Нейросистема управления наземным подвижным средством Разработана фирмой Martin Marietta Aero Naval System
    SNAP-1 Многопроцессорная нейросистема управления воздушным движением Вероятность правильного распознавания - 80 %
    Многослойная нейронная сеть типа персептрон лаборатории Air Force Wright Aeronautical Lab Система распознавания типа цели В качестве пространства признаков используются моменты Зернике или дискриминанты Фишера:
    Поле признаков Число нейронов Общее число итераций Вероятность правильного распознавания
    Слой: 1 2
    Моменты Зернике 22 20 060 26 650 86.4
    Дискреты Фишера 4 100 300 3110 59.1
    FFNNP (Feed-Forward Neural Network Pipeline) Распознавание танков Лаборатория Sanada Nat Labs, СНА. Время распознавания 4с, точность 91 %, 2.5 млрд. соединений в секунду
    IPF (Interpolative Probability Field) Нейросетевая система сопровождения многих целей Фирма TRW.

    Достигнутые к концу прошлого столетия результаты исследований нейрокомпьютерной техники в военной области сведены в табл. 6.1 и 6.2 [84], из которых видно:

  • Прикладная военная нейроматематика является естественным продолжением дискретной математики систем цифровой обработки сигналов и изображений, причем она расширяет не столько спектр решаемых задач, что определяется "сценариями" эксплуатации и боевого применения ВВТ, сколько сами условия эксплуатации и боевого применения технотронных комплексов ВВТ, поведение которых описывается нестационарными случайными процессами и существенно нелинейными алгоритмами решения задач управления и оценки ситуации.
  • Пока не преодолена высокая проблемная и алгоритмическая ориентированность нейросетей даже внутри одного класса задач эксплуатации и боевого применения ВВТ.
  • При оценке пропускной способности нейрокомпьютеров для систем реального времени необходимо учитывать не только временные издержки этапа обучения, но и составляющие единицы минут временные издержки на (пере)настройку нейросети, что приводит к нелинейному перераспределению затрат в пространстве "аппаратура - время" в задачах с итеративным использованием нейросетей.
  • Для повышения вероятности принятия правильных решений в ней-росети, как правило, требуется еще и предобработка потоков входных данных, приводящая входную информацию к "масштабам" и "углам зрения", соответствующим условиям получения обучающей выборки.
  • С середины 80-х годов прошлого столетия США сконцентрировали свои усилия на исследовании нейрокомпьютерных технологий для аэрокосмических комплексов наблюдения за земной поверхностью, сопровождения и распознавания целей, а также управления лазерным оружием. В совокупности с роботизированными системами "поля боя" это позволит им в ближайшей перспективе создать первые комплексные беспилотные системы ВВТ, оперативное управление которыми ведется из удаленных центров.
  • Аппаратные платформы нейрокомпьютерных технологий развиваются менее интенсивно по сравнению с нейроматематикой [169], что видно из данных табл. 6.3 [170, 171].

    Характеристики цифровых нейрочипов
    Фирма, тип Конфигурация CPS CPSPW CPPS CUPS Patterns/s
    Nuralogix, NLX-420 32-16, 8 bit mode 10M 20K 640M na 20K
    Hecht-Nielson, 100NAP 4 chips, 2 M wts,16 bit mantissa 250M 125 256G 64M na
    Hitachi, WSI 576 neuron Hopfield 138M 3.7 9.9G na na
    Inova, N64000 64-64-1, 8 bit mode 871M 3.4K 128K wts 55.7G 220M 100K
    IBM, ZISC036 64 8 bit elements input vectors na na na na 250K
    MCE, MT19003 4-4-1 32 MHz 32M 32M 6.8G na 140K
    Micro Devices, MD-1220 8-8 819M 1.1M 142M na 139K
    Nestor/ Intel 256 5 bit elements input vectors na na na na 40K
    Philips, Lneuro-1 1 chips, 8 bit mode 26M 26K 1.6G 32M na
    Siemens, MA-16 1 chips, 25 MHz 400M 15M 103G na 40K
    RC Module NM 6403 8 bit mode, 50 MHz 1200M 150M 76.8G na na

    Современные нейрочипы используют достаточно широкий спектр моделей формальных нейронов ( ФН), изготавливаются по субмикронным нормам, и их работа характеризуется достаточно специфической системой параметров, ориентированной на оценку коммутационных возможностей и возможностей взвешенного суммирования входных возбуждений, как по показателям точности, так и по показателям быстродействия (табл. 6.3):

  • количеством соединений в секунду ( $$CPS$$ ), измеряемых количеством умножений с накоплением в секунду;
  • взвешенным на один синапс количеством соединений в секунду ( $$CPSPW = CPS/N_{w}$$, где $$N_{w}$$ - количество синапсов ФН);
  • количеством соединений примитивов в секунду ( $$CPPS = CPS*B_{w}*B_{s}$$, где $$B_{w}$$ и $$B_{s}$$ - разрядность весов и синапсов);
  • количеством модификаций в секунду ( $$CUPS$$ ), которое характеризует возможности подсистемы ввода-вывода нейрочипа.
  • Из данных табл. 6.3 следует:

  • Количество ФН на одном чипе находится в пределах десятков и сотен, а количество входов у каждого - в пределах десятков.
  • Тактовая частота далеко не рекордная (25-50 МГц), но физическая производительность ( $$CPS$$ ) - на порядок выше за счет коэффициентов распараллеливания и составляет 108-109 операций/с.
  • Однокристальный отечественный нейроэмулятор NM6403 на основе 32-разрядного RISC -ядра и 64-разрядного векторного сопроцессора с программируемой (расщепляемой) разрядностью обеспечивает максимальную из приведенных физическую производительность. Отсутствие данных о двух его подсистемах ввода-вывода не позволяет судить о его реальной пропускной способности и ее зависимости от топологии нейросети.
  • Технические расчеты [172] показывают, что наибольший уровень функциональной интеграции достигается в сетях на ассоциативных ФН, которые при 0,2 мкм топологических нормах позволяют создать в одном чипе ~104 ФН с числом входов ~102 у каждого. При использовании вертикально интегрированных вентилей и 0,1 мкм технологии можно создать на одном чипе сеть из ~106 ассоциативных ФН с ~102 входов у каждого.

    Однако реальный прирост уровня функциональной интеграции ассоциативных ФН по отношению к обычным ФН можно оценить только после сравнения функционального разнообразия, достигаемого в каждой сети. Это можно объяснить следующими причинами:

  • Обучающие алгоритмы "материнской" нейро-ЭВМ хорошо эмулируются на ЦПОС - и RISC -процессорах, что показывает опыт использования нейрочипа отечественной разработки RC Module NM 6403 [171]. Это нейрочип по существу является спаренным процессором цифровой обработки сигналов, и тем не менее при решении задач "материнской" нейро-ЭВМ он получил высокую оценку не только у нас в стране, но и за рубежом, что не характерно для отечественной микроэлектроники и вычислительной техники.
  • Произвольно коммутируемые нейросети Мак-Каллока - Питтса и персептронные сети Ф. Розенблатта требуют разветвленной системы связей, которая реализуема средствами оптоэлектроники, а в микроэлектронном исполнении здесь возникают серьезные проблемы устойчивого обмена информацией через гальванические шины произвольной конфигурации, особенно в диапазоне гигагерцовых частот и выше. Однако оптоэлектронные вентили на 2-3 порядка пока еще превосходят микроэлектронные вентили по потребляемой мощности, а смешанные опто- и микроэлектронные технологии находятся еще в стадии лабораторных исследований.
  • Из приведенных данных можно заключить:

  • Инерционность этапов обучения и настройки нейрокомпьютеров еще такова, что они способны решать в основном плохо формализуемые задачи на этапах планирования и подготовки боевых действий. Такой скорости обучения (порядка единиц часов) достаточно для оперативной адаптации космических средств разведки к сезонным, погодным и климатическим условиям района боевых действий, а роботизированных комплексов "поля боя" еще и "сценариям" ведения боевых действий при наличии стратегической и оперативно-тактической инициативы по отношению к "противнику".
  • Нейрокомпьютерные технологии в ближайшей перспективе не выйдут за рамки задач эксплуатации и боевого применения, возлагаемые на современные системы цифровой обработки сигналов и изображений [173, 174]. При этом переход к нейроподобным вычислительным технологиям способен повысить уровень адаптации алгоритмов к плохо прогнозируемым и формализуемым погодным и климатическим условиям и увеличить на 1-2 порядка темп обработки в реальном времени потоков данных за счет сверхвысоких (~106-109) коэффициентов распараллеливания вычислений, что труднодостижимо на основе ЦПОС.
  • Высокий допустимый уровень распараллеливания алгоритмов обучения нейрокомпьютеров обуславливает создание если и не самообучающихся, то по крайней мере взаимно обучающихся нейросетей.
  • Такой нейроподобный самообучающийся комплекс должен содержать 3 нейро-ЭВМ, одна из которых является обучаемой, а две другие осуществляют адаптивную генерацию обучающих выборок и оценку адекватности реакции обучаемой нейросети.

    6.5. Принципы и методы МКМД-бит-потоковой организации вычислений

    МКМД-бит-потоковая вычислительная технология разработана в 80-х годах прошлого столетия по заказу МО СССР для решения задач эксплуатации и боевого применения ВВТ с экстремальными и противоречивыми требованиями по производительности и отказоустойчивости. В частности, время жизни (10 лет) разведывательных и связных комплексов космического базирования уже тогда превосходило более чем на 1 порядок время безотказной работы комплектующих СБИС (10 тыс. часов) в условиях жестких электромагнитных и радиационных космических воздействий. Такое требование кардинальным образом изменило сам подход к построению систем обеспечения живучести БВС, которая должна парировать в темпе близком к реальному времени множественные отказы аппаратуры, так как доминирующие до сих пор схемы многократного мажоритарного резервирования способны парировать только одиночные отказы аппаратуры.

    МКМД-бит-потоковая вычислительная технология базируется на следующих принципах и методах [138]:

  • Принцип "одна инструкция - один процессор" строго выдерживается на всех уровнях управления, включающих:
  • бит-процессорный с "глубиной" взаимодействия до двух смежных по времени и/или пространству бит из циклически обрабатываемых потоков данных;
  • слов-процессорный с "глубиной" взаимодействия до двух смежных по времени и/или пространству $$n$$ -разрядных операндов из циклически обрабатываемых потоков данных;
  • поток-процессорный с "глубиной" взаимодействия до $$m*N $$ смежных по времени и/или пространству слов из циклически обрабатываемых потоков данных, где коэффициент векторизации $$m = 1$$, $$N $$ по потокам данных, а также параметры самих потоков данных $$n $$ и $$N $$ задаются пользователем.
  • Программирование бит-матрицы ведется в режиме разделения времени с обработкой, а закрепленные за каждым бит-процессором индивидуальные бит-инструкции не изменяются в течение как минимум одного цикла формирования $$n*N$$ -битного потока результирующих данных.
  • Процессы обработки и передачи данных совмещены по времени и аппаратуре, а их скорости равны, причем циклическая обработка потоков данных ведется в конвейерной арифметике, младшим разрядом вперед и требует постоянно обнуляемого старшего буферного разряда, препятствующего "паразитному" распространению "единицы переноса" между словами промежуточных или результирующих потоков данных.
  • Весь (сверх)большой коллектив (103-105) бит-процессоров работает синхронно.

    Из приведенных данных следует, что в МКМД-бит-потоковых вычислительных технологиях:

  • Фазы изготовления бит-матричных СБИС, (микро)программного конструирования и использования проблемно- или алгоритмически ориентированных (суб)процессоров разделены во времени, а полный цикл их работы включает этапы загрузки микропрограмм в бит-матрицу с временем $$T_{p}$$, вхождения в конвейер с временем $$T_{0}$$ и собственно обработку потоков данных с временем $$T_{d}$$, которые должны удовлетворять системообразующему неравенству:$$T_{p}+T_{0} << T_{d} = r*n*N*\tau_{c},$$

    где $$r $$ - количество циклов обработки $$N$$ -словного потока $$n$$ -битных данных, а $$\tau_{c}$$ - цикл работы бит-процессора и всей бит-матрицы.

  • Вычислительный процесс представляет собой ассоциативное взаимодействие пространственно фиксированного потока бит-инструкций с пространственно-временными потоками бит-данных, причем правила взаимодействия можно модифицировать в (квази)реальном масштабе времени по параметрам $$(r, n, N)$$ и направлениям распространения данных между инициализированными операционными устройствами.
  • Управление вычислительным процессом осуществляется на трех уровнях с разным латентным периодом:
  • "медленное" (с временем реакции $$T^{1}_{u}= T_{p}+ T_{0})$$, когда отвечающая активизированному поток-оператору микропрограмма загружается в бит-матрицу, превращая ее в проблемно-ориентированный (суб)процессор;
  • "быстрое" (с временем реакции $$T^{2}_{u}= n_{u}*N_{u}* \tau_{c}+ T_{0})$$, когда с помощью $$N_{u}$$ внешних $$n_{u}$$ -разрядных переменных задаются или модифицируются направления распространения и параметры $$(r, n, N)$$ обработки потоков данных, что превращает проблемно-ориентированный в алгоритмически ориентированный (суб)процессор;
  • "сверхбыстрое" (с временем реакции $$T ^{3}_{u}\to \tau_{c}$$ ), когда с помощью содержимого одного или нескольких бит обрабатываемых или специально сформированных промежуточных данных меняются реализуемые бит-процессорами функции.
  • Соотношение (6.1) говорит о том, что системные временные издержки инициализации МКМД-бит-потоковых (суб)процессоров должны быть пренебрежимо малыми по сравнению со временем их использования, и достигается оно за счет:

  • распараллеливания шин ввода (микро)программ, что обеспечивает минимизацию $$T_{p}$$ ;
  • выбора потоковых алгоритмов работы (суб)процессоров, что обеспечивает минимизацию $$T_{0}$$,
  • а также выбора параметров потоков данных $$(n, N)$$ и количества циклов $$r $$ их "непрерывной" обработки.

    Из приведенных данных видно: принципы и методы МКМД-бит-потоковой организации вычислений инвариантны аналоговой и цифровой формам представления обрабатываемых данных. Это позволяет рассматривать их и как прототип организации вычислений в реальных нейронных ансамблях, и как детерминированный вариант нанометровых или супра-молекулярных вычислительных технологий.

    Первое положение подтверждается тем, что в реальных нейросетях на равных используется как дискретная "спайковая" активность, так и непрерывная электроэнцефалографическая активность и вызванные потенциалы.

    Второе положение подтверждается тем, что в нанометровых и супрамолекулярных вычислительных технологиях в качестве "рабочего тела" выступают квантовые (суб)системы, которые имеют двойственную природу и могут вести себя в пространстве и во времени и как непрерывные (аналоговые), и как дискретные (цифровые) с дискретными или непрерывными спектрами поглощения и излучения, а в общем случае - перераспределения энергии в системе. Поэтому в нанометровых или супрамолекулярных вычислительных технологиях используемые физико-технические процессы станут определять спектр допустимых архитектур, где:

  • Неравенство (6.1) сохранит свое системотехническое значение, а его параметры приобретут следующий физический смысл:
  • $$T_{p}$$ - время синтеза вычислителя-потомка из "рабочего тела" вычислителя-предка, возможно, и с дифференцированным обменом массой с "окружающей средой", что свойственно полуоткрытым (био)физическим, (био)химическим и биологическим системам;
  • $$T_{0}$$ - время установления "устойчивого" взаимодействия квантового "рабочего тела" вычислителя-потомка с потоками "свободной" массы
  • обработка ведется не в ассоциативной памяти (бит)данных,как это имеет место в классических ассоциативных архитектурах [46, 116, 175], а в ассоциативной памяти (бит)инструкций,"содержимое" которой может модифицироваться под воздействием преобразуемых потоков данных, что не исключает использование в их работе традиционных DD-ассоциативных конструкций, обеспечивающих соответственно доступ и обработку данных в зависимости от их содержимого;
  • организация вычислений достаточно адекватна детерминированным системотехническим условиям работы перспективных нанометро-вых и супрамолекулярных вычислителей;
  • пользователю доступны практически все уровни распараллеливания вычислений: бит-, слов-, поток- и задач-процессорный, что позволяет максимально интенсифицировать использование имеющегося однородного аппаратурного ресурса, перераспределяя его как между операционными, управляющими, адресными, интерфейсными и диагностическими функциями в зависимости от требований активного поток-оператора, так и по задачам, решаемым на различных уровнях организации вычислительного процесса.
  • 6.6. Факторы, ограничивающие коэффициент распараллеливания вычислений

    Условия эксплуатации технотронных комплексов космического базирования, ориентированных на решение глобальных задач телекоммуникаций и связи, разведки полезных ископаемых, мониторинга земной и водной поверхности для нужд экологии, сельского хозяйства, добычи рыбы и т. д., таковы, что к их вычислительным системам предъявляется наиболее полный и противоречивый перечень требований. В результате, который качество бортовых вычислительных систем (БВС) оценивается наиболее комплексным показателем [173]:

    $$R=\cfrac{V_{эфф}*T_0*n*Q}{G*W},$$

    который учитывает:

  • $$V_{эфф}$$ - эффективную производительность БВС (операций/с);
  • $$T _{0}$$ - время наработки на 1 отказ (часов);
  • $$n $$ - разрядность арифметики (бит);
  • $$Q$$ - объем оперативной памяти (байт);
  • $$G$$ - вес или массу вычислителя (кг или дм3);
  • $$W$$ - потребляемую или излучаемую энергию (Вт).
  • Эффективная производительность однородных параллельных БВС определяется:

    $$V_{эфф}=\beta*\gamma*P_{физ}$$

    где:

  • безразмерный коэффициент $$\beta\le 1$$ характеризует системные аппаратно-временные издержки на организацию вычислений в (сверх)многопроцессорной БВС;
  • $$\gamma > 1$$ представляет собой коэффициент распараллеливания физических возможностей (сверх)многопроцессорной БВС, в которой каждый процессор способен выполнить все операции со скоростью $$P_{физ}$$ операций/с.
  • Как показывает опыт, с ростом коэффициента распараллеливания вычислений возрастают и системные аппаратно-временные издержки, которые в основном связаны с динамическим управлением вычислительными ресурсами и связанными с этим простоями аппаратуры. В случае БВС аэрокосмического базирования $$\gamma$$ (102-103), так как они решают задачи с экстремальными требованиями по производительности и пропускной способности по потокам данных, которые на 2-3 порядка превосходят предоставляемые. В частности, для проведения разведки подвижных наземных группировок средствами космического базирования требуется производительность порядка 1015 операций/с, что на 3 порядка превышает производительность существующих наземных супер-ЭВМ.

    Чтобы упростить процедуру оценки "сложности" алгоритмов решения задачи и вытекающей из этого потребной производительности обычно используют зависимость количества операций от размеров циклически обрабатываемых потоков данных в задачах-прототипах, которые разбиваются на несколько групп [70].

    К группе задач типа $$O(N) $$ в цифровой обработке сигналов и изображений относят те задачи, у которых количество операций линейно зависит от количества циклически обрабатываемых операндов $$N$$. Типичный представитель - это скалярное произведение двух векторов

    $$L^s=\sum_{s=1}^N{X^s*Y^s}$$

    К группе задач типа $$O(N^{2}) $$ относят те задачи, у которых количество операций квадратично зависит от количества циклически обрабатываемых операндов $$N$$. Типичный представитель - это сортировка методом "пузырька", в которой количество сравнений и транспозиций не может превышать значения $$N*(N+1)/2$$.

    К группе задач типа $$O(N^{3})$$ относят те задачи, у которых количество операций кубически зависит от количества циклически обрабатываемых операндов $$N$$. Типичный представитель - это умножение матриц, в котором количество операций умножения равно $$N^{3}$$, а сложений - $$N^{2}*(N+1)$$.

    Подавляющее большинство задач разведки подвижных наземных группировок аэрокосмическими средствами относится к группе $$O(N)$$, где $$N \approx (2^{6}-2^{8})$$ пикселей, которое расходуется на графическое представление эталонного описания объекта разведки.

    Из сказанного видно, что в БВС активно решаются задачи, требующие (сверх)высоких коэффициентов распараллеливания вычислений как по потокам команд, так и по потокам данных. Отсюда и вытекает задача эффективного управления ходом вычислительного процесса, так как с ростом коэффициента распараллеливания вычислений $$\gamma$$ резко возрастают системные аппаратно-временные издержки на управление в реальном времени ходом вычислительного процесса, что приводит к резкому падению коэффициента $$\beta$$ в (6.3).

    Объясняется это тем, что вычислительный процесс представляет собой взаимодействие двух, вообще говоря, неразличимых потоков, один из которых принято называть потоком инструкций, а другой - потоком данных. Последовательный характер алгоритмов решения задач вынуждает поочередно предоставлять аппаратный ресурс инициализированным инструкциям программы. В результате в любой (Б)ВС сосуществуют два взаимосвязанных процесса, один из которых является собственно вычислительным,а второй представляет собой процесс перечисления исполняемых потоков инструкций и преобразуемых ими потоков данных. Первый из этих потоков является упорядоченным только частично, так как в нем присутствуют операторы условных переходов, изменяющие порядок перечисления (инициализации) инструкций в зависимости от содержимого обрабатываемых или промежуточных данных.

    В системах реального времени операнды многомерного потока данных обычно упорядочены хронологически,их содержимое изменяется случайным образом, асинхронно по каждому измерению (измеряемой и контролируемой физической величине) и плохо прогнозируется. В результате предельную физическую производительность удается достичь только на линейных участках программы,где отсутствуют операторы условных переходов и где адрес последующей (инициализируемой) команды вычисляется постоянным смешением по отношению к адресу предыдущей (исполняемой) команды. С появлением операторов условных переходов в многомерных адресных потоках команд,а вслед за ними и в многомерных адресных потоках данных возникают "вихри", обработка которых и приводит к аппаратно-временным издержкам на управление ходом вычислительного процесса в (сверх)многопроцессорных (Б)ВС.

    Рост времени наработки на один отказ ( $$T_{0}$$ ) одновременно увеличивает как числитель, так и знаменатель показателя качества (6.2) работы БВС, так как с увеличением коэффициента распараллеливания вычислений снижается надежность всей БВС, что приводит к росту аппаратно-временных затрат на резервирование, а значит, и к росту массо-габаритов ( $$G$$ ) и потребляемой мощности ( $$W$$ ). Такое нелинейное влияние надежности работы отдельного процессора на показатель качества работы всей (сверх)многопроцессорной БВС имеет следующие последствия:

  • коэффициент локального и/или глобального резервирования не превышает значений 3-4, как это имеет место в системах управления посадкой американских космических кораблей многоразового использования типа "Шаттл";
  • на первое место выходит не показатель надежности, а показатель отказоустойчивости, который характеризует способность БВС выполнять полностью или частично возлагаемые на нее функции при наличии в ней карты отказов.
  • Объемы используемой памяти ( $$Q$$ ) также двойственно влияют на комплексный показатель качества (6.2) БВС. С одной стороны, увеличение объема ОЗУ повышает пропускную способность всей БВС как по многомерным потокам команд, так и по многомерным потокам данных, а с другой стороны, современные, особенно многопортовые ОЗУ являются основными источниками повышения потребляемой мощности и снижения надежности работы всей БВС.

    В (сверх)многопроцессорных БВС особое место занимает разрядность параллельной арифметики ( $$n$$ ), которая, с одной стороны, увеличивает коэффициент распараллеливания вычислений на микропрограммном уровне управления ходом вычислительного процесса, а с другой стороны, снижает помехозащищенность параллельных шин передачи данных, особенно в гигагерцовой области и выше.

    При этом следует иметь в виду тот факт, что с ростом коэффициента распараллеливания вычислений на микропрограммном или ассемблерном уровне организации вычислений возрастает количество операций межпроцессорной пересылки данных, что приводит к росту операций округления данных и падению вычислительной устойчивости программно-аппаратного комплекса.

    Программно-аппаратный комплекс считается вычислительно устойчивым, если погрешность вычислений в нем не превышает погрешность представления исходных данных, то есть если проведенные вычисления выполняются с абсолютной точностью и поэтому не вносят дополнительной погрешности в результат.

    Оценить возрастание погрешности вычислений проще всего на различных моделях схем суммирования с накоплением $$N $$ операндов (рис. 6.5).

    (рис 6.5) Схемы суммирования операндов с разным числом операций пересылки

    В схеме рис. 6.5-а вся сумма

    $$S=\sum_{i=1}^{N}{X^i}$$

    сначала накапливается в регистре-аккумуляторе ( АКК ) и только после этого передается в ОЗУ, то есть в ходе вычислений осуществляется только одна пересылка результата. При этом следует иметь в виду, что разрядность аккумулятора ( n = 84-128) в несколько раз превосходит разряд-ность шин данных ( $$n_{d} = 32-64$$ ). Поэтому при выполнении операций пересылки данных типа Х(ОЗУ):= АКК происходит округление накопленных данных. В схеме рис. 6.5-а такое округление выполняется всего один раз, а в схеме рис. 6.5-б - 3 раза, так как появляются две

    дополнительные операции межпроцессорной пересылки накопленных частных сумм

    $$S^1=\sum_{i=1}^{N/2}{X^i}$$ и $$S^1=\sum_{i=1}^{N/2}{X^i}$$, ( $$S = S^1 + S^2$$ )

    Очевидно, что с ростом коэффициента распараллеливания вычислений $$\gamma$$ количество пересылок результатов промежуточных вычислений возрастает в $$2^{\gamma} -1$$ раз.

    Второй наиболее интенсивный источник округления, а значит, и ошибок вычислений - это операция денормализации меньшего слагаемого в арифметике плавающей запятой, которая вносит дополнительную погрешность, если разность порядков суммируемых операндов превосходит разрядность регистра-аккумулятора.

    Типичное влияние двух этих источников на точность вычислений суммы чисел с одинарной и двойной точностью показано соответственно на рис. 6.6 и 6.7, из которых видно:

  • абсолютная погрешность вычислений носит неустойчивый колебательный характер, который зависит как от коэффициента распараллеливания, так и от порядка суммирования одних и тех же чисел;
  • при вычислениях с одинарной точностью абсолютная погрешность проявляется в первом десятичном разряде после запятой, а при вычислениях с двойной точностью - только в десятом десятичном разряде; это указывает на необходимость наращивания разрядности во время вычислений, особенно при использовании операций умножения, удваивающих разрядность произведения по отношению к исходным операндам, и операций деления, в которых останов алгоритма работы микропрограммы в общем случае осуществляется по счетчику, а не по условию.
  • (рис 6.6) Зависимость абсолютной погрешности суммирования от коэффициента распараллеливания вычислений, выполненных с одинарной точностью

    Здесь за наиболее точный (почти "эталонный") результат принято значение $$S$$, вычисленное в "однопроцессорном" варианте с двойной точностью и после упорядочения по возрастанию псевдослучайной последовательности $$\{X ^{i}\}$$, где $$i $$ изменяется от 1 до $$N = 5000$$, а коэффициент распараллеливания вычислений - от 1 до 200.

    Абсолютные погрешности суммирования основную опасность представляют в операторах условных переходов, где условие $$S > H $$ становится нестабильным и может сработать по-разному для одной и той же последовательности входных данных, но упорядоченной разным образом или вычисленной с разным коэффициентом распараллеливания.

    (рис 6.7) Зависимость абсолютной погрешности суммирования от коэффициента распараллеливания вычислений, выполненных с двойной точностью

    На основе приведенных данных можно заключить:

  • В комплексной оценке качества БВС вида (6.1) тесно переплетены как системотехнические, так и конструктивно-технологические факторы, первые из которых фактически предопределяют коэффициент использования физических возможностей параллельных БВС, а вторые - сами эти возможности.
  • Основными факторами, ограничивающими допустимый уровень параллелизма в (Б)ВС, являются не только потребляемая мощность и габариты, но и вычислительная устойчивость, которая в параллельной арифметике падает с ростом коэффициента распараллеливания вычислений. Поэтому в (сверх)параллельных (Б)ВС более перспективной является последовательная (конвейерная) арифметика, обеспечивающая одинаковую и произвольно наращиваемую в ходе вычислений разрядность как регистров-аккумуляторов, так и шин обмена данными.
  • Основные системные аппаратно-временные издержки (сверх)парал-лельных (Б)ВС связаны с обеспечением взаимодействия многомерных потоков команд и многомерных потоков данных, в которых образуются "вихри" из-за наличия в программах операторов условных переходов, нарушающих линейный порядок перечисления потоков инструкций. 4. Прямой перенос алгоритмов и программ с последовательных на параллельные (Б)ВС может привести к потере вычислительной устойчивости, а значит, и к непрогнозируемому поведению автоматизированных комплексов в целом. Это чревато потерей управления сложными и опасными объектами, функционирование которых осуществляется на и над собственной территорией.
  • Системотехнические выводы по лекции 6

  • Многофункциональный характер задач, решаемых современными технотронными комплексами как в сфере обороны, так и в остальных сферах деятельности человека, вынуждает их разработчиков использовать практически весь спектр существующих вычислительных технологий, поддерживающих требуемый уровень параллелизма на всех уровнях организации вычислений: бит-командном, слов-командном и поток-операторном, то есть параллельные вычисления следует считать атрибутом (Б)ВС современных и перспективных технотронных комплексов двойного назначения.
  • Основное достоинство МКМД-бит-процессорных технологий состоит в том, что они позволяют на однородной элементной базе малой номенклатуры наиболее полно воплотить архитектурные решения, которые лежат в основе других технологий.
  • Основной вклад в увеличение трудоемкости и сроков создания современных технотронных комплексов вносят этапы, обеспечивающие алгоритмизацию, программирование и (кремниевую) компиляцию задач пользователя в исполняемый формат или, что одно и то же, в получение булева представления заданий пользователя.
  • Нейрокомпиляция является единственной альтернативой современным технологиям погружения заданий пользователя на уровень аппаратной реализации, и она призвана сократить финансовые, временные и интеллектуальные издержки на формирование исполняемого формата за счет замены дорогостоящих этапов алгоритмизации, программирования и компиляции обучением "дочерней" нейро-ЭВМ.
  • Нейрокомпьютерные технологии не отменяют интеллектуальный этап и связанные с ним затраты на создание формализованного описания задач. Они лишь изменяют представление этого формализованного описания в виде репрезентативных обучающих выборок. Обоснование, выбор или формирование репрезентативной обучающей выборки - не менее сложная интеллектуальная задача, чем получение формализованного описания задания пользователя ЭВМ.
  • Основное преимущество нейрокомпьютерных технологий сосредоточено в стандартных процедурах обучения или, что одно и то же, в формировании исполняемого формата задания вплоть до физико-технического или молекулярно-биологического уровня описания вычислительного процесса.
  • Основная опасность использования нейрокомпьютерных технологий в технотронных комплексах проистекает от непрогнозируемости поведения таких комплексов в быстро изменяющейся "внешней среде". При этом диспетчерские службы и руководство глобальных технотронных комплексов должны иметь автоматизированные средства и оперативные возможности:
  • для оперативной оценки адекватности реальных условий и модельных условий, представленных репрезентативными выборками во время обучения;
  • для прекращения текущих задач в случае существенных отклонений реальных условий от условий обучения "материнской" нейро-ЭВМ.
  • С учетом высокой вероятности потери управляемости технотронными комплексами в ближайшей перспективе применение нейроком-пьютерных технологий можно ожидать при интерактивном решении задач подготовки и планирования глобальных экономических, финансовых, технических и т. п. мероприятий, где руководящий состав еще имеет время и возможности для оценки результатов работы нейро-ЭВМ.
  • В современных вычислительных технологиях основная опасность в применении технотронных комплексов проистекает из возможной потери вычислительной устойчивости алгоритмических и программных платформ, отлаженных и проверенных на последовательных аппаратных платформах и перенесенных впоследствии на параллельные аппаратные платформы.
  • Даже созданная в кооперации с зарубежными партнерами отечественная элементная база отстает и еще долго будет отставать от элементной базы США. Поэтому отечественные (Б)ВС должны обеспечить более высокие коэффициенты распараллеливания вычислений, чтобы решить задачи интеллектуальной и информационный поддержки персонала в противоборстве с конкурентами, обладающими организационно-техническим, финансовым и технологическим превосходством. Это ужесточает требования к вычислительной устойчивости и устойчивости к отказам отечественных алгоритмических и аппаратных платформ, что требует поиска принципиально новых решений в области вычислительных технологий.
  • Создание RISC -процессоров и основанных на них вычислительных технологий является несомненным успехом DARPA, консолидировавшего усилия ученых и коммерческих фирм, обеспечивших продвижение на коммерческий и военный рынок инновационной технологии, в корне изменившей стратегию создания средств вычислительной техники.
  • Вернуться к учебному плану