Лаборатория
Искусственных Нейронных Сетей , Российский Федеральный Ядерный Центр - Всероссийский НИИ Технической Физики
Рассмотрим систему, состоящую из некоторого числа компонент. Для определенности будем иметь в виду, скажем, терминал крупного океанского порта, обслуживающий разгрузку судов портовыми кранами, и отправку грузов автомобильным и железнодорожным транспортом. Нашей конечной целью будет построение модели системы, описывающей ее поведение, и обладающей предсказательными
Каждая из компонент системы имеет свои свойства и характер поведения в зависимости от собственного состояния и внешних условий. Если все возможные проявления системы сводятся к сумме проявлений ее компонент, то такая система является простой, несмотря на то, что число ее компонент может быть велико. Для описания простых систем традиционно применяются методы анализа, состоящие в последовательном расчленении системы на компоненты и построении моделей все более простых элементов. Таковым в своей основе является метод математического моделирования [4.1], в котором модели описываются в форме уравнений, а предсказание поведения системы основывается на их решении.
Современные технические системы (например, упомянутый выше порт, инженерные сооружения, приборные комплексы, транспортные средства и др.) приближаются к такому уровню сложности, когда их наблюдаемое поведение и свойства не сводятся к простой сумме свойств отдельных компонент. При объединении компонент в систему возникают качественно новые свойства, которые не могут быть установлены посредством анализа свойств компонент.
В случае терминала порта небольшие отклонения в производительности работы кранов, малые изменения или сбои графика движения железнодорожных составов, отклонения в степени загрузки и в графике прибытия судов могут вызвать качественно новый режим поведения порта, как системы, а именно затор. Образование затора вызывает обратное воздействие на режимы работы компонент, что может привести к серьезным авариям и т.д. Состояние затора не может быть в полной мере получено на основе отдельного анализа, например, свойств одного крана. Однако в рамках системы обычный режим работы этого крана может приводить к состоянию затора.
Такие системы, в которых при вычленении компонент могут быть потеряны принципиальные свойства, а при добавлении компонент возникают качественно новые свойства, будем называть сложными. Модель сложной системы, основанная на принципах анализа, будет неустранимо неадекватной изучаемой системе, поскольку при разбиении системы на составляющие ее компоненты теряются ее качественные особенности.
Возможным выходом из положения является построение модели на основе синтеза компонент. Синтетические модели являются практически единственной альтернативой в социологии, долгосрочных прогнозах погоды, в макроэкономике, медицине. В последнее время синтетические информационные модели широко используются и при изучении технических и инженерных систем. В ряде приложений информационные и математические компоненты могут составлять единую модель (например, внешние условия описываются решениями уравнений математической физики, а отклик системы - информационной моделью).
Основным принципом информационного моделирования является принцип " черного ящика ". В противоположность аналитическому подходу, при котором моделируется внутренняя структура системы, в синтетическом методе "черного ящика" моделируется внешнее функционирование системы. С точки зрения пользователя модели структура системы спрятана в черном ящике, который имитирует поведенческие особенности системы.
Кибернетический принцип "черного ящика" был предложен [4.2] в рамках теории идентификации систем, в которой для построения модели системы предлагается широкий параметрический класс
Функционирование системы в рамках синтетической модели описывается чисто информационно, на основе данных экспериментов или наблюдений над реальной системой. Как правило, информационные модели проигрывают формальным математическим моделям и экспертным
Можно выделить несколько
В этом разделе изложение будет основываться на моделях первого из указанных типов.
Пусть X - вектор, компоненты которого соответствуют количественным свойствам системы, X' - вектор количественных свойств внешних воздействий. Отклик системы может быть описан некоторой (неизвестной) вектор-функцией F: Y = F(X,X'), где Y - вектор отклика. Задачей моделирования является идентификация системы, состоящая в нахождении функционального отношения, алгоритма или системы правил в общей форме Z=G(X,X'), ассоциирующей каждую пару векторов (X, X') с вектором Z таким образом, что Z и Y близки в некоторой метрике, отражающей Z=G(X,X'), воспроизводящее в указанном смысле функционирование системы F, будем называть информационной моделью системы F.
Искусственные нейронные сети (ИНС) являются удобным и естественным базисом для представления информационных моделей. Нейросеть может быть достаточно формально определена [4.3], как совокупность простых G системы F.
Определяемая нейросетью функция может быть произвольной при легко выполнимых требованиях к структурной сложности сети и наличии нелинейности в переходных функциях нейронов [4.4]. Возможность представления любой системной функции F с наперед заданной точностью определяет нейросеть, как компьютер общего назначения. Этот компьютер, в сравнении с машиной фон Неймана, имеет принципиально другой способ организации вычислительного процесса - он не программируется с использованием явных правил и кодов в соответствии с заданным алгоритмом, а обучается посредством целевой адаптации синаптических связей (и, реже, их структурной модификацией и изменением переходных функций нейронов) для представления требуемой функции.
В гипотетической ситуации, когда функция системы F известна или известен алгоритм ее вычисления при произвольных значениях аргументов, машина фон Неймана является наилучшим средством для моделирования (состоящего в вычислении F ), и необходимость в информационных моделях отпадает.
При моделировании реальных сложных технических систем значения системной функции F получаются на основе экспериментов или наблюдений, которые проводятся лишь для конечного числа параметров X. При этом значения как Y так и Х измеряются приближенно, и подвержены ошибкам различной природы (см. ниже). Целью моделирования является получение значений системных откликов при произвольном изменении X. В этой ситуации может быть успешно применена информационная (статистическая) модель G исследуемой системы F.
Информационные модели могут строиться на основе традиционных методов непараметрической статистики Данная наука позволяет строить обоснованные модели систем в случае большого набора экспериментальных данных (достаточного для доказательства статистических гипотез о характере распределения) и при относительно равномерном их распределении в пространстве параметров. Однако при высокой стоимости экспериментальных данных, или невозможности получения достаточного их количества (как, например, при построении моделей тяжелых производственных аварий, пожаров и т.п.), их высокой зашумленности, неполноте и противоречивости, нейронные модели оказываются более предпочтительными. Нейронная сеть оказывается избирательно чувствительной в областях скопления данных, и дает гладкую интерполяцию в остальных областях.
Эта особенность нейросетевых моделей основывается на более общем принципе - адаптивной кластеризации данных. Одной из первых сетей, обладающих свойствами адаптивной кластеризации была карта
Карты Кохонена применяются в основном, для двух целей. Первая из них - наглядное упорядочивание многопараметрической информации. На практике обычно используются одномерные и двумерные карты. Кластеры, задаваемые узлами карты, содержат группы в некотором смысле похожих наблюдений, которым может быть приписан групповой семантический смысл. Одним из новых эффективных применений сети Кохонена является построение тематической карты электронных сообщений в глобальных компьютерных сетях. При помощи такой карты пользователь получает возможность свободной навигации в бесконечном потоке сообщений, в соответствии с индивидуальным кругом
Вторая группа технических применений связана с предобработкой данных. Карта Кохонена группирует близкие входные сигналы X, а требуемая функция Y=G(X) строится на основе применения обычной нейросети прямого распространения (например, многослойного персептрона или линейной звезды Гроссберга) к выходам
Сеть встречного распространения дает кусочно-постоянное представление модели Y=G(X), поскольку при вариации вектора X в пределах одного кластера на слое соревнующихся
Другой альтернативой традиционным k.
$$y = f\left({W^{(0)} + \sum\limits_i {W_i^{(1)} x_i + \sum\limits_{i < j}{W_{ij}^{(2)} + \ldots + \sum\limits_{i1 < i2 < .. < ik}{W_{i1..ik}^{(k)}x_1 x_2 }}}..x_k }\right)$$
Каждый процессорный элемент k -го порядка способен выполнить не только линейное
(рис 4.1) Решающее правило для задачи "исключающее ИЛИ". Важным достоинством нейронов высокого порядка является возможность строить нейросетевые модели без скрытых слоев, воспроизводящие широкий класс
В этой лекции описанные и другие нейроархитектуры будут применены к модельным и реалистичным задачам информационного моделирования сложных инженерных систем.
Специфичность информационных моделей проявляется не только в способах их синтеза, но и характере делаемых приближений (и связанных с ними ошибок). Отличия в поведении системы и ее информационной модели возникают вследствие свойств экспериментальных данных.
ab initio являются неполными. Пространства входных и выходных переменных не могут, в общем случае, содержать все параметры, существенные для описания поведения системы. Это связано как с F.G рассматривается, как внешняя данность. При этом, в данных всегда присутствуют ошибки разной природы, шум, а также противоречия отдельных измерений друг другу. За исключением простых случаев, искажения в данных не могут быть устранены полностью.Такие особенности в данных и в постановке задач требуют особого отношения к ошибкам информационных моделей.
Итак, при информационном подходе требуемая модель G системы F не может быть полностью основана на явных правилах и формальных законах. Процесс получения G из имеющихся отрывочных экспериментальных сведений о системе F может рассматриваться, как обучение модели G поведению F в соответствии с заданным критерием, настолько близко, насколько возможно. Алгоритмически, обучение означает подстройку
Прямое измерение указанной ошибки модели на практике не достижимо, поскольку системная функция F при произвольных значениях аргумента не известна. Однако возможно получение ее оценки:
$$E_L = \sum\limits_{X \in X}{\left\| {G\left( X \right) - Y}\right\|},$$
где суммирование по X проводится по некоторому конечному набору параметров X, называемому обучающим множеством. При использовании базы данных наблюдений за системой, для обучения может отводиться некоторая ее часть, называемая в этом случае обучающей выборкой. Для обучающих примеров X отклики системы Y G и системной функции Y на множестве X играет важную роль в информационном моделировании и называется ошибкой обучения модели.
Для случая точных измерений (например, в некоторых задачах классификации, когда отношение образца к классу не вызывает сомнений) однозначность системной функции для достаточно широкого класса G моделей гарантирует возможность достижения произвольно малого значения EL. Нарушение однозначности системной функции в присутствии экспериментальных ошибок и неполноты признаковых пространств приводит в общем случае к ненулевым G.
В приложениях пользователя обычно интересуют предсказательные E. Неизвестная ошибка, допускаемая моделью G на данных, не использовавшихся при обучении, называется ошибкой обобщения модели EG.
Основной целью при построении информационной модели является уменьшение именно ошибки обобщения, поскольку малая
Важно отметить, что малость
Поскольку истинное значение ошибки обобщения не доступно, в практике используется ее оценка. Для ее получения анализируется часть примеров из имеющейся базы данных, для которых известны отклики системы, но которые не использовались при обучении. Эта выборка примеров называется тестовой выборкой. Ошибка обобщения оценивается, как норма уклонения модели на множестве примеров из тестовой выборки.
Оценка ошибки обобщения является принципиальным моментом при построении информационной модели. На первый взгляд может показаться, что сознательное не использование части примеров при обучении может только ухудшить итоговую модель. Однако без этапа тестирования единственной оценкой качества модели будет лишь
При формулировании постановки информационной задачи предсказания реакции исследуемой системы при ее известном состоянии на заданные внешние воздействия, т.е. получения величин Y при заданных X исследователь имеет дело с прямой задачей. Прямая задача является типичной при моделировании поведения системы, если запросы к информационной модели носят характер что-если.
Другим важным классом информационных задач являются обратные задачи. Целью обратной задачи выступает получение входных величин X, соответствующих наблюдаемым значениям выходов Y. При моделировании сложных систем соответствующий запрос к модели формулируется, как поиск внешних условий, которые привели к реализовавшемуся отклику системы.
Для большинства приложений чисто обратные задачи встречаются относительно редко, так как обычно имеются дополнительные сведения о системе. Например, кроме измеренного отклика, могут быть известны X и выходного Y векторов восстановить оставшиеся неизвестные компоненты.
В общем случае моделируемая системная функция может быть представлена в виде (X,Y)=F (X, Y). В этом случае комбинированный вектор (X,Y) рассматривается одновременно, как входной и выходной. В этом смысле, произвольная задача допускает комбинированную постановку.
Отличительная особенность обратных и комбинированных задач состоит в том, что они обычно являются некорректно поставленными [4.10], и поэтому требуют специализированных методов поиска приближенных решений. Согласно Ж.Адамару, для корректности постановки задачи необходимо:
существование решения при всех допустимых исходных данных; единственность данного решения; устойчивость решения к изменениям (малым) исходных данных.
Рассмотрим характер возможных нарушений данных условий при решении модельной обратной задачи.
Пусть имеется три исследуемых систем, описываемых кусочно-линейными функциями одной переменной y=F(x) на отрезке [0..1]. Системы отличаются друг от друга величиной скачка h системной функции (см рис. 4.2). Прямая задача состоит в построении приближения G к функции F, с использованием пар значений {xi, yi=s(xi)}, где xi - конечный набор Na случайных равномерно распределенных на [0..1] точек. Обратная задача заключается в нахождении функции, аппроксимирующей соотношения xi(yi). В зависимости от величины скачка моделируемой функции можно выделить три варианта.
h=0 ). Модель является линейной: y=x. Для прямой задачи легко получить исчезающую ошибку обучения $$E_L \approx 0$$, и 0<h<1 ). Прямая задача в этом случае также хорошо определена, и при использовании достаточно богатого множества y > 0.5+0.5h; y < 0.5-0.5h ) и неоднозначной ( $${\rm{y }}\in {\rm{[0}}{\rm{.5 - 0}}{\rm{.5h}}{\rm{, 0}}{\rm{.5 + 0}}{\rm{.5h]}}$$ ) обратной функцией. В областях однозначности функции могут быть получены произвольно точные результаты для обратной задачи. Однако в отрезке нарушения однозначности h. Такие задачи, корректное (единственное и устойчивое) решение которых может быть получено только для
некоторой подобласти множества значений, будем называть условно (или частично ) h=1 ). Прямая задача по-прежнему корректно поставлена, требуемое обучение и обобщение может быть достигнуто ( $$E_L \approx 0$$ ). Однако ситуация качественно меняется для случая обратной задачи. Обратная функция двузначна на всем множестве значений, информация о ее значении минимальна. Обратная задача полностью некорректно поставлена.Что общего между всеми этими примерами? В каждом из них ошибка обобщения при решении обратной задачи не может быть меньше значения, определяемого размером области неоднозначности h, который, таким образом, может рассматриваться, как мера некорректности задачи. В случае, если для решения обратной задачи используется метод со стабилизирующими свойствами (например, с малым числом свободных параметров по сравнению с числом обучающих примеров), будет получено гладкое решение с ненулевой h.
Заметим, что прямая задача является безусловно корректной только при полном отсутствии шума в обучающих данных. При наличии случайных компонент в значениях X имеется целое "облако" решений прямой задачи, причем размер облака пропорционален величине шума. Таким образом, нарушается единственность решения прямой задачи, и она становится некорректно поставленной.
Классическим методом решения некорректных задач является метод
В приложении к нейросетевые моделям, регуляризирующие методы сводятся к оптимизации функционала ошибки (в простейшем случае - суммы квадратов уклонений модели от экспериментальных значений) с аддитивной добавкой, исчезающей по мере улучшения свойств гладкости функции:
$$E\left[ G \right] = \sum\limits_{\alpha = 1}^{N_\alpha }{\left( {G(\vec x^\alpha ) - \vec y^{(\alpha )}}\right)^2 + \lambda \phi \left[ G \right]}.$$
Здесь $$\phi $$ - регуляризирующий функционал, $$\lambda $$ - неотрицательная константа
Замечательной особенностью нейросетевых моделей (аппроксимаций системной функции на основе конечного набора наблюдений) являются их внутренние регуляризирующие свойства, позволяющие получать малые ошибки обобщения. Полезность регуляризирующих свойств нейронных сетей проявляется в ситуациях, когда экспериментальные данные о системе содержат внутреннюю избыточность. Избыточность позволяет представить совокупность данных моделью, содержащей меньшее число параметров, чем имеется данных. Таким образом, нейросетевая модель сжимает экспериментальную информацию, устраняя шумовые компоненты и подчеркивая непрерывные, гладкие зависимости.
Следует отметить, что в случае полностью случайных отображений построение модели с малой ошибкой обобщения не возможно. Достаточно рассмотреть простой пример, в котором аппроксимируется отображение фамилий абонентов телефонной сети (вектор входов X ) в номера их телефонов (вектор выходов Y ). При любой схеме построения обобщающей модели предсказание номера телефона нового абонента по его фамилии представляется абсурдным.
Имеется обширная научная библиография, посвященная обоснованию оптимального выбора нейроархитектур и переходных функций нейронов исходя из различных видов регуляризирующих функционалов $$\phi $$ (см., например [4.11] и цитируемую там литературу). Практическая направленность данной леции не позволяет изложить математические детали. Одним из продуктивных подходов к построению нейросетей с хорошими обобщающими свойствами является требование убывания высоких гармоник Фурье переходных функций. Различные законы убывания приводят к локальным сплайн-методам и нейросетям с радиальными
В случае сигмоидальной переходной функции абсолютная величина коэффициентов
Рассмотрим особенности регуляризированных A, B и C. 200 пар x-y, в которых величина x случайно равномерно распределена на отрезке [0,1], а значение y определяется моделируемой функцией. Расчеты проведены для нейросети с обратным распространением ошибки и нейросети встречного распространения. Еще 500 случайных примеров служили для оценки ошибки обобщения. В трех сериях расчетов величины y из 0%, 10% и 50% соответственно. Обучение проводилось на обратной зависимости x(y), т.е. величины y использовались в качестве входов, а x - выходов нейросети.
Проведенные расчеты преследовали следующие основные цели:
Результаты моделирования приведены на рис. 4.3, 4.4, 4.5, 4.6 и 4.7.
(рис 4.3) Зависимость EL (кружки) и ошибки обобщения EG (точки) от степени некорректности h обратной задачи при различных уровнях шума
На рис. 4.3 представлено изменение h. Для сильно некорректной задачи ( h=1 ) результаты полностью не зависят от шума в данных. Теоретически, для неограниченного обучающего набора для моделируемых систем имеется точное (линейное) решение, минимизирующее среднеквадратичное уклонение, которое в предельном случае ( h=1 ) дает значение ошибки 0.25. Расчетное значение на рис. 4.3 в этом наихудшем случае близко к данной теоретической величине.
Таким образом, скейлинг
На следующем рисунке приведено регуляризованное решение предельно некорректной задачи ( h=1 ), даваемое нейронной сетью с обратным распространением, обученной на зашумленных данных.
(рис 4.4) Регуляризованное решение (точки) предельно некорректной обратной задачи, полученное при помощи нейросети с обратным распространением ошибки на зашумленных данных (кружки).Решение отвечает минимуму среднеквадратичного уклонения от обучающих данных, что является типичным для сетей с сигмоидальными функциями.
Укажем явно, в чем состоит характер априорных предположений, принимаемых при построении нейросетевых моделей. Единственное предположение (которого оказывается достаточно для
Обратная задача может считаться условно корректной, если в признаковом пространстве выходных переменных имеются области, где обратное отображение однозначно (как в случае системы B с промежуточными значениями скачка h ). Для рассмотренных в предыдущем пункте однопараметрических систем области корректности могут быть выявлены при графическом представлении экспериментальных данных. Отделение областей условной корректности в многомерных пространствах параметров является качественно более сложной задачей. В этом разделе предлагается исследовать возможности
При произвольном распределении точек в многомерном пространстве задача таксономии (т.е. разделения всех точек на несколько компактных групп, называемых кластерами) является достаточно сложной, несмотря на то, что имеется целый ряд методов ее решения. Ситуация дополнительно усложняется в важном практическом случае, когда число кластеров заранее не известно.
На классе
Если для приложений достаточно только оценки плотности распределения точек по кластерам с сохранением лишь ближнего порядка в кластеризации, то такое разбиение может быть выполнено более эффективно на основе модели " нейронного газа " [4.12, 4.13], в которой соседство узлов не фиксировано, а динамически меняется по мере улучшения кластеризации. В относительно недавней модификации метода, получившей название " расширяющийся нейронный газ " [4.13], переменными являются не только отношения соседства, но и число нейронов-кластеров.
В данной лекции более подробно рассматриваются приложения более часто используемой карты Кохонена.
Основная идея предлагаемого метода дифференциальной оценки степени некорректности обратной или комбинированной задачи состоит в реализации следующего плана:
Y для чисто обратной задачи, или по совокупности входных и выходных компонент (X,Y) для комбинированного отображения (X,Y)=F(X,Y) ;Важно отметить, что в данном подходе пользователь получает для каждого запроса к нейросетевой модели адекватную локальную точность получаемого результата, и корректный отказ в выдаче результата в области высокой нерегулярности задачи. Поскольку карта Кохонена дает высокую степень наглядности при изучении распределения экспериментальных данных, то распределение степени некорректности по ней представляет богатый материал для понимания особенностей модели и ее параметров. Неоднородности в "раскраске" карты могут отвечать различным режимам поведения инженерной установки или прибора. При моделировании технических систем это часто может служить указанием на нежелательные (или аварийные!) соотношения параметров при эксплуатации.
Для иллюстрации предлагаемого метода рассмотрим его применение к уже использовавшимся модельным системам A, B и C. Для простоты рассмотрения (и снижения числа необходимых вычислений) можно применить упрощенный алгоритм получения оценки некорректности. Для этого вместо использования набора малых экспертов ограничимся одним персептроном (без скрытых слоев), входы которого замкнуты на выходы нейронов карты Кохонена, а число выходов совпадает с размерностью признакового пространства выходов задачи. Такая гибридная нейроархитектура, называемая сетью встречного распространения , предложена Р.Хехт-Нильсеном [4.7, 4.8].
Каждый кластер соревновательного
Уклонение кусочно-постоянной поверхности от значений выходных векторов
(рис 4.5) Гладкое регуляризованное решение (кружки) сетью с обратным распространением ошибки для слабо некорректной задачи двузначного отображения, заданного дискретным набором примеров (точки).На Рис. 4.5 и 4.6 приведено сравнения гладкого регуляризованного решения, определяемого многослойной сетью с обратным распространением, и решения, получаемого при помощи нейросети встречного распространения. Расчеты проведены для системы B для случая относительно слабой некорректности с малым значением величины скачка h.
Легко заметить совершенно различный характер 0.4<Y<0.6 ). Кривая решения и ошибка гладко распространяются в область, где поведение моделируемой системы регулярно.
В случае Y=0 и Y=1 ). Решение же в области
Полезность того или иного представления решения может определиться только в контексте конкретного приложения. Для системы, предупреждающей о высокой ошибке решения в области некорректности, по-видимому, следует предпочесть результат
(рис 4.6) Кусочно-постоянное в области регулярности решение некорректной обратной задачи, полученное с помощью сети встречного распространения (см. подпись и обозначения на Рис.4.5).Обратимся теперь к изучению возможности автоматического выделения области некорректности. В нейронной
В приведенном примере, при h=0.2, теоретическое значение предельной 0.1. Распределение ошибки по кластерам, наблюдаемое в расчетах, приведено на рис. 4.7. Область некорректности может быть легко автоматически выделена при помощи простого решающего правила.
(рис 4.7) Распределение ошибки обучения по пространственным кластерам Карты самоорганизации Кохонена с легко выделяемой областью некорректности задачи.Подведем некоторые итоги рассмотрения модельных задач. Можно выделить два основных пути применения нейронных сетей встречного распространения для решения обратных и комбинированных некорректно поставленных задач.
Во-первых, слой самоорганизующихся нейронов карты Кохонена позволяет получить локальную дифференциальную оценку степени некорректности задачи и пространственное распределение ошибки обобщения, делаемой сетью. Кластерное разложение одинаково легко выполняется в признаковых пространствах любой размерности.
Алгоритм кластеризации Кохонена легко обобщается на случай наличия пропусков в данных. Поскольку для отнесения некоторого вектора к кластеру требуется лишь вычислить
Второй прикладной аспект состоит в том, что в областях корректности задачи решение, даваемое
Сложные инженерные устройства при воздействии внешних факторов могут демонстрировать разнообразное нелинейное поведение. С точки зрения эксплуатации таких систем отклик может отвечать нормальному режиму работы, а также аномальным и аварийным режимам. В последнем случае требуется принятие специальных мер для снижения риска последствий инцидента.
Задача информационного моделирования при оценке
Примером задачи оценки риска является эксплуатация контейнера для перевозки или хранения промышленных отходов (например, делящиеся материалы в отработанных твэлах атомных электростанций, или токсичные химические вещества). В качестве аномального внешнего воздействия требуется рассмотрение пожара с различными параметрами. Отклик контейнера (измеряемый оценкой сохранности содержимого и не проникновением его во внешнюю среду) может изменяться в зависимости от текущего состояния системы, например, степенью возможных повреждений в аварийных условиях.
Рассмотрим относительно простую и полезную с практической точки зрения модель, основанную на данных измерений параметров контейнера при различных условиях пожара. Фактически, построенная модель основывалась на результатах численного моделирования, а не на реальных данных. Это, однако, не снижает ценность рассмотрения, поскольку в численных расчетах удается учесть широкий спектр пожаров для одного и того же контейнера. Неопределенность в коэффициентах, описывающих теплофизические свойства материалов, а также численные эффекты, вносят шум в используемые данные, приближая условия моделирования к реальным. В сложившейся практике нейросетевого моделирования данные такого рода называют реалистичными (в отличие от искусственных и реальных данных).
База собранных данных содержит 8 параметров, описывающих контейнер и условия пожара. Признаковое пространство входов состоит из 6 переменных - одной переменной состояния контейнера (экспертная оценка степени повреждения контейнера) и пяти параметров воздействия (свойств пожара).
(рис 4.8) Схема расположения контейнера и области, охваченной пламенем. Параметры пожара включают две координаты области пламени, диаметр этой области, температуру пожара и его длительность.
Двумя выходными переменными являются максимальное значение температуры внутри контейнера на протяжении всего пожара, а также отрезок времени, в течение которого температура внутри контейнера превышала некоторое пороговое значение, соответствующее критическому уровню возможного повреждения содержимого контейнера.
Информационная модель отклика контейнера строилась на основе
Нейронная сеть для прямой задачи содержит 6 входов и 2 оцениваемых выхода. Прямая задача для данного приложения позволят ответить на следующие вопросы:
Обратная задача соответствует оценке параметров внешнего воздействия по измерениям отклика системы. Тепловой режим внутри контейнера при этом контролируется датчиками температуры. Запросы к обратной модели носят диагностический характер:
Наиболее интересная комбинированная задача рассматривает часть параметров как известные, а остальные, как неизвестные. При обучении нейросети комбинированной задаче множества переменных, используемых как входные и как выходные, могут частично или полностью перекрываться.
Комбинированная задача отвечает на все запросы прямой и обратной задач, но имеет дополнительные возможности:
Обратную и комбинированную задачи следует рассматривать, как некорректно поставленные.
Область возможных значений физических параметров ограничивалась максимальными температурами пожара (достигаемыми при горении обогащенного топлива), расстояниями и размерами пламени, при которых теплопередача контейнеру приводит к температуре около 200оС (типичный порог для пожаро-сигнализирующих датчиков). Длительность пожара ограничивалась значением 1 час.
После введения всех ограничений данные из базы данных были линейным преобразованием приведены в "серый" формат [0..1].
На первом этапе в предлагаемой технологии исследовалась корректность задачи на всей области значений параметров. С этой целью последовательно выбирались семь параметров из восьми, включенных в модель. Эти параметры считались известными, а оставшийся восьмой параметр - неизвестным. Таким образом, каждый из параметров по очереди тестировался, как неизвестный. При моделировании определялась 30 нейронов).
$$E = \frac{{100\% }}{{N_\alpha N_{out}}}\sum\limits_\alpha^{N_\alpha }{\sum\limits_j^{N_{out}}{\left( {Z_j^{(\alpha )} - Y_j^{(\alpha )}}\right)^2 }}$$
Численное моделирование показало, что обе прямые задачи, когда неизвестными считались выходные переменные задачи - максимальная температура внутри контейнера и длительность периода превышения заданного уровня температуры, являются корректно поставленными. Значение 1%. Напротив, все шесть обратных/комбинированных задач оказались некорректными с 25-35%. Данные результат является принципиальным для планирования последующих экспериментов с информационной моделью: попытки оценки
Для выбора эффективной нейросетевой модели для (корректно поставленной) прямой задачи была изучена зависимость
(рис 4.9) Области на плоскости "температура пламени" - "длительность пожара", в которых максимальная температура внутри контейнера превышает значения 200, 500 и 800 градусов Цельсия.Для приложений требуется компактная и быстрая нейросетевая модель, легко обучаемая и имеющая невысокую ошибку обобщения. Данные требования в некоторой мере противоречивы, поэтому был суммирован опыт большого числа компьютерных экспериментов. Были обнаружены следующие особенности:
50-80% при росте объема базы обучающих данных (и соответственно, затрат на обучение!) в 3-4 раза. Следовательно, можно избежать больших объемов данных.10 раз большей, чем 10-15 нейронами на скрытом слое с масштаба 100 синаптическими связями, обученная на базе данных из 300-500 записей, она показывает ошибку обучения 2-3% при ошибке обобщения до 5%.На основе выбранной нейросетевой модели было проведено обучение нейросети и исследован ряд информационных запросов к ней.
Первая серия запросов была выполнена для определения области температур и длительностей пожара, при которых содержимое контейнера не перегревается. Рассматривались пожары, происходящие в непосредственной близости к контейнеру и имеющие диаметр до 15 м. Изолинии температур внутри контейнера показаны на рис.4.9. Расчеты соответствуют трем различным значениям нагрева содержимого 200, 500 и 800oC. Данные результаты в применении к конкретным образцам контейнеров могут составить основу технических требований к противопожарным службам. Так, например, кривая 200oC показывает параметры, при которых срабатывают типичные температурные датчики. Если критическим для эксплуатации оказывается режим превышения 500oC при температуре пламени 800oC, то, как следует из рис. 4.9, контейнер способен выдерживать такую нагрузку в течение 22 мин.
(рис 4.10) Зависимость длины промежутка времени (в минутах), в течении которого температура внутри контейнера превышала критический уровень, от расстояния до эпицентра пожара (в метрах) для двух значений диаметра пламени (15 и 20 м).Вторая рассмотренная задача связана с изучением зависимости тепловых условий внутри системы от расстояния до эпицентра пожара. На рис. 4.10 представлена зависимость длительности закритического нагрева (в минутах) от расстояния до области пожара (в метрах). Длительность пожара составляла 1 час. Интересно отметить, что наблюдается некоторое промежуточное значения расстояния до пожара, при котором теплопередача к контейнеру
На основе данной модели может быть исследовано множество других практических вопросов. Поскольку при анализе запросов нейронная сеть работает только в режиме прямого ненагруженного функционирования, время выполнения запросов минимально.
Займемся теперь рассмотрением обратной и комбинированной задач. Как мы уже убедились на основе расчетов, эти задачи обладают ярко выраженной некорректностью, связанной с неустранимой неоднозначностью обратной функции, поэтому интерес представляет возможность лишь их частичной
(рис 4.11) Распределение ошибок обучения по кластерам карты Кохонена. Ошибка на данных каждого кластера пропорциональна размеру соответствующего квадрата.Для исследований была выбрана комбинированная задача определения диаметра пламени по остальным параметрам пожара и измерениям внутри контейнера. Эта задача имеет минимальную ошибку обучения ( 22% ) при использовании данных из всей области параметров. Для данной задачи был выполнен кластерный анализ на основе 5x5=25 нейронов. рис. 4.11 отражает распределение
Результирующее распределение ошибок близко к равномерному, однако имеются две области (кластеры 1-2 и 4-3 в матричных обозначениях) с относительно малыми ошибками. Эти кластеры определяют области частичной 7 -мерном пространстве параметров.
Наиболее регулярной является область кластера 1-2. Анализ значений параметров, отвечающих центроиду данного кластера, позволяет заключить, что наименьшая ошибка определения диаметра пламени путем решения обратной задачи достигается для высокотемпературных (около 1000oC ), длительных (более получаса) пожаров при промежуточных расстояниях до эпицентра (масштаба диаметра пламени).
Следующий шаг исследований состоял в классификации записей в базе данных по построенным кластерам обученной сети Кохонена. Из полного набора измерений около 2.5% данных оказалось относящимися к наиболее регулярному кластеру 1-2. Эти данные были использованы для обучения многослойной сети с обратным распространением с 7 входами и одним выходом. Результирующая ошибка регуляризованного решения составила лишь 8.5%, что приблизительно в три раза меньше
Результаты описанных исследований могут быть обобщены в нейросетевую технологию решения обратных и комбинированных задач:
Промышленная нейросетевая модель, созданная по данной технологии будет содержать материнскую сеть Кохонена и семейство малых сетей-экспертов с обратным распространением ошибки. Такая
Предлагаемый подход к нейросетевому моделированию сложных технических систем относительно прост в реализации и непосредственно соответствует ежедневным информационным потребностям инженеров, связанных с эксплуатацией таких систем.
Подведем итоги этой лекции. Нейронные сети являются естественным инструментом для построения эффективных и гибких информационных моделей инженерных систем. Различные нейроархитектуры отвечают различным практическим требованиям.
Сети двойственного функционирования с обратным распространением ошибки и
Внутренние регуляризирующие особенности нейронных сетей позволяют решать также обратные и комбинированные задачи с локальной оценкой точности. Для некорректно поставленных задач моделирования предложена нейросетевая информационная технология построения гибридной нейроархитектуры, содержащей кластеризующую карту Кохонена и семейство сетей с обратным распространением, обучаемых на данных индивидуальных кластеров. В этой технологии выявляются области
В работе рассмотрены примеры применения методики
Автор благодарен В.В.Легонькову и Л.И.Шибаршову за полезные обсуждения и консультации.
Лаборатория
Искусственных Нейронных Сетей , Российский Федеральный Ядерный Центр - Всероссийский НИИ Технической Физики
Рассмотрим систему, состоящую из некоторого числа компонент. Для определенности будем иметь в виду, скажем, терминал крупного океанского порта, обслуживающий разгрузку судов портовыми кранами, и отправку грузов автомобильным и железнодорожным транспортом. Нашей конечной целью будет построение модели системы, описывающей ее поведение, и обладающей предсказательными
Каждая из компонент системы имеет свои свойства и характер поведения в зависимости от собственного состояния и внешних условий. Если все возможные проявления системы сводятся к сумме проявлений ее компонент, то такая система является простой, несмотря на то, что число ее компонент может быть велико. Для описания простых систем традиционно применяются методы анализа, состоящие в последовательном расчленении системы на компоненты и построении моделей все более простых элементов. Таковым в своей основе является метод математического моделирования [4.1], в котором модели описываются в форме уравнений, а предсказание поведения системы основывается на их решении.
Современные технические системы (например, упомянутый выше порт, инженерные сооружения, приборные комплексы, транспортные средства и др.) приближаются к такому уровню сложности, когда их наблюдаемое поведение и свойства не сводятся к простой сумме свойств отдельных компонент. При объединении компонент в систему возникают качественно новые свойства, которые не могут быть установлены посредством анализа свойств компонент.
В случае терминала порта небольшие отклонения в производительности работы кранов, малые изменения или сбои графика движения железнодорожных составов, отклонения в степени загрузки и в графике прибытия судов могут вызвать качественно новый режим поведения порта, как системы, а именно затор. Образование затора вызывает обратное воздействие на режимы работы компонент, что может привести к серьезным авариям и т.д. Состояние затора не может быть в полной мере получено на основе отдельного анализа, например, свойств одного крана. Однако в рамках системы обычный режим работы этого крана может приводить к состоянию затора.
Такие системы, в которых при вычленении компонент могут быть потеряны принципиальные свойства, а при добавлении компонент возникают качественно новые свойства, будем называть сложными. Модель сложной системы, основанная на принципах анализа, будет неустранимо неадекватной изучаемой системе, поскольку при разбиении системы на составляющие ее компоненты теряются ее качественные особенности.
Возможным выходом из положения является построение модели на основе синтеза компонент. Синтетические модели являются практически единственной альтернативой в социологии, долгосрочных прогнозах погоды, в макроэкономике, медицине. В последнее время синтетические информационные модели широко используются и при изучении технических и инженерных систем. В ряде приложений информационные и математические компоненты могут составлять единую модель (например, внешние условия описываются решениями уравнений математической физики, а отклик системы - информационной моделью).
Основным принципом информационного моделирования является принцип " черного ящика ". В противоположность аналитическому подходу, при котором моделируется внутренняя структура системы, в синтетическом методе "черного ящика" моделируется внешнее функционирование системы. С точки зрения пользователя модели структура системы спрятана в черном ящике, который имитирует поведенческие особенности системы.
Кибернетический принцип "черного ящика" был предложен [4.2] в рамках теории идентификации систем, в которой для построения модели системы предлагается широкий параметрический класс
Функционирование системы в рамках синтетической модели описывается чисто информационно, на основе данных экспериментов или наблюдений над реальной системой. Как правило, информационные модели проигрывают формальным математическим моделям и экспертным
Можно выделить несколько
В этом разделе изложение будет основываться на моделях первого из указанных типов.
Пусть X - вектор, компоненты которого соответствуют количественным свойствам системы, X' - вектор количественных свойств внешних воздействий. Отклик системы может быть описан некоторой (неизвестной) вектор-функцией F: Y = F(X,X'), где Y - вектор отклика. Задачей моделирования является идентификация системы, состоящая в нахождении функционального отношения, алгоритма или системы правил в общей форме Z=G(X,X'), ассоциирующей каждую пару векторов (X, X') с вектором Z таким образом, что Z и Y близки в некоторой метрике, отражающей Z=G(X,X'), воспроизводящее в указанном смысле функционирование системы F, будем называть информационной моделью системы F.
Искусственные нейронные сети (ИНС) являются удобным и естественным базисом для представления информационных моделей. Нейросеть может быть достаточно формально определена [4.3], как совокупность простых G системы F.
Определяемая нейросетью функция может быть произвольной при легко выполнимых требованиях к структурной сложности сети и наличии нелинейности в переходных функциях нейронов [4.4]. Возможность представления любой системной функции F с наперед заданной точностью определяет нейросеть, как компьютер общего назначения. Этот компьютер, в сравнении с машиной фон Неймана, имеет принципиально другой способ организации вычислительного процесса - он не программируется с использованием явных правил и кодов в соответствии с заданным алгоритмом, а обучается посредством целевой адаптации синаптических связей (и, реже, их структурной модификацией и изменением переходных функций нейронов) для представления требуемой функции.
В гипотетической ситуации, когда функция системы F известна или известен алгоритм ее вычисления при произвольных значениях аргументов, машина фон Неймана является наилучшим средством для моделирования (состоящего в вычислении F ), и необходимость в информационных моделях отпадает.
При моделировании реальных сложных технических систем значения системной функции F получаются на основе экспериментов или наблюдений, которые проводятся лишь для конечного числа параметров X. При этом значения как Y так и Х измеряются приближенно, и подвержены ошибкам различной природы (см. ниже). Целью моделирования является получение значений системных откликов при произвольном изменении X. В этой ситуации может быть успешно применена информационная (статистическая) модель G исследуемой системы F.
Информационные модели могут строиться на основе традиционных методов непараметрической статистики Данная наука позволяет строить обоснованные модели систем в случае большого набора экспериментальных данных (достаточного для доказательства статистических гипотез о характере распределения) и при относительно равномерном их распределении в пространстве параметров. Однако при высокой стоимости экспериментальных данных, или невозможности получения достаточного их количества (как, например, при построении моделей тяжелых производственных аварий, пожаров и т.п.), их высокой зашумленности, неполноте и противоречивости, нейронные модели оказываются более предпочтительными. Нейронная сеть оказывается избирательно чувствительной в областях скопления данных, и дает гладкую интерполяцию в остальных областях.
Эта особенность нейросетевых моделей основывается на более общем принципе - адаптивной кластеризации данных. Одной из первых сетей, обладающих свойствами адаптивной кластеризации была карта
Карты Кохонена применяются в основном, для двух целей. Первая из них - наглядное упорядочивание многопараметрической информации. На практике обычно используются одномерные и двумерные карты. Кластеры, задаваемые узлами карты, содержат группы в некотором смысле похожих наблюдений, которым может быть приписан групповой семантический смысл. Одним из новых эффективных применений сети Кохонена является построение тематической карты электронных сообщений в глобальных компьютерных сетях. При помощи такой карты пользователь получает возможность свободной навигации в бесконечном потоке сообщений, в соответствии с индивидуальным кругом
Вторая группа технических применений связана с предобработкой данных. Карта Кохонена группирует близкие входные сигналы X, а требуемая функция Y=G(X) строится на основе применения обычной нейросети прямого распространения (например, многослойного персептрона или линейной звезды Гроссберга) к выходам
Сеть встречного распространения дает кусочно-постоянное представление модели Y=G(X), поскольку при вариации вектора X в пределах одного кластера на слое соревнующихся
Другой альтернативой традиционным k.
$$y = f\left({W^{(0)} + \sum\limits_i {W_i^{(1)} x_i + \sum\limits_{i < j}{W_{ij}^{(2)} + \ldots + \sum\limits_{i1 < i2 < .. < ik}{W_{i1..ik}^{(k)}x_1 x_2 }}}..x_k }\right)$$
Каждый процессорный элемент k -го порядка способен выполнить не только линейное
(рис 4.1) Решающее правило для задачи "исключающее ИЛИ". Важным достоинством нейронов высокого порядка является возможность строить нейросетевые модели без скрытых слоев, воспроизводящие широкий класс
В этой лекции описанные и другие нейроархитектуры будут применены к модельным и реалистичным задачам информационного моделирования сложных инженерных систем.
Специфичность информационных моделей проявляется не только в способах их синтеза, но и характере делаемых приближений (и связанных с ними ошибок). Отличия в поведении системы и ее информационной модели возникают вследствие свойств экспериментальных данных.
ab initio являются неполными. Пространства входных и выходных переменных не могут, в общем случае, содержать все параметры, существенные для описания поведения системы. Это связано как с F.G рассматривается, как внешняя данность. При этом, в данных всегда присутствуют ошибки разной природы, шум, а также противоречия отдельных измерений друг другу. За исключением простых случаев, искажения в данных не могут быть устранены полностью.Такие особенности в данных и в постановке задач требуют особого отношения к ошибкам информационных моделей.
Итак, при информационном подходе требуемая модель G системы F не может быть полностью основана на явных правилах и формальных законах. Процесс получения G из имеющихся отрывочных экспериментальных сведений о системе F может рассматриваться, как обучение модели G поведению F в соответствии с заданным критерием, настолько близко, насколько возможно. Алгоритмически, обучение означает подстройку
Прямое измерение указанной ошибки модели на практике не достижимо, поскольку системная функция F при произвольных значениях аргумента не известна. Однако возможно получение ее оценки:
$$E_L = \sum\limits_{X \in X}{\left\| {G\left( X \right) - Y}\right\|},$$
где суммирование по X проводится по некоторому конечному набору параметров X, называемому обучающим множеством. При использовании базы данных наблюдений за системой, для обучения может отводиться некоторая ее часть, называемая в этом случае обучающей выборкой. Для обучающих примеров X отклики системы Y G и системной функции Y на множестве X играет важную роль в информационном моделировании и называется ошибкой обучения модели.
Для случая точных измерений (например, в некоторых задачах классификации, когда отношение образца к классу не вызывает сомнений) однозначность системной функции для достаточно широкого класса G моделей гарантирует возможность достижения произвольно малого значения EL. Нарушение однозначности системной функции в присутствии экспериментальных ошибок и неполноты признаковых пространств приводит в общем случае к ненулевым G.
В приложениях пользователя обычно интересуют предсказательные E. Неизвестная ошибка, допускаемая моделью G на данных, не использовавшихся при обучении, называется ошибкой обобщения модели EG.
Основной целью при построении информационной модели является уменьшение именно ошибки обобщения, поскольку малая
Важно отметить, что малость
Поскольку истинное значение ошибки обобщения не доступно, в практике используется ее оценка. Для ее получения анализируется часть примеров из имеющейся базы данных, для которых известны отклики системы, но которые не использовались при обучении. Эта выборка примеров называется тестовой выборкой. Ошибка обобщения оценивается, как норма уклонения модели на множестве примеров из тестовой выборки.
Оценка ошибки обобщения является принципиальным моментом при построении информационной модели. На первый взгляд может показаться, что сознательное не использование части примеров при обучении может только ухудшить итоговую модель. Однако без этапа тестирования единственной оценкой качества модели будет лишь
При формулировании постановки информационной задачи предсказания реакции исследуемой системы при ее известном состоянии на заданные внешние воздействия, т.е. получения величин Y при заданных X исследователь имеет дело с прямой задачей. Прямая задача является типичной при моделировании поведения системы, если запросы к информационной модели носят характер что-если.
Другим важным классом информационных задач являются обратные задачи. Целью обратной задачи выступает получение входных величин X, соответствующих наблюдаемым значениям выходов Y. При моделировании сложных систем соответствующий запрос к модели формулируется, как поиск внешних условий, которые привели к реализовавшемуся отклику системы.
Для большинства приложений чисто обратные задачи встречаются относительно редко, так как обычно имеются дополнительные сведения о системе. Например, кроме измеренного отклика, могут быть известны X и выходного Y векторов восстановить оставшиеся неизвестные компоненты.
В общем случае моделируемая системная функция может быть представлена в виде (X,Y)=F (X, Y). В этом случае комбинированный вектор (X,Y) рассматривается одновременно, как входной и выходной. В этом смысле, произвольная задача допускает комбинированную постановку.
Отличительная особенность обратных и комбинированных задач состоит в том, что они обычно являются некорректно поставленными [4.10], и поэтому требуют специализированных методов поиска приближенных решений. Согласно Ж.Адамару, для корректности постановки задачи необходимо:
существование решения при всех допустимых исходных данных; единственность данного решения; устойчивость решения к изменениям (малым) исходных данных.
Рассмотрим характер возможных нарушений данных условий при решении модельной обратной задачи.
Пусть имеется три исследуемых систем, описываемых кусочно-линейными функциями одной переменной y=F(x) на отрезке [0..1]. Системы отличаются друг от друга величиной скачка h системной функции (см рис. 4.2). Прямая задача состоит в построении приближения G к функции F, с использованием пар значений {xi, yi=s(xi)}, где xi - конечный набор Na случайных равномерно распределенных на [0..1] точек. Обратная задача заключается в нахождении функции, аппроксимирующей соотношения xi(yi). В зависимости от величины скачка моделируемой функции можно выделить три варианта.
h=0 ). Модель является линейной: y=x. Для прямой задачи легко получить исчезающую ошибку обучения $$E_L \approx 0$$, и 0<h<1 ). Прямая задача в этом случае также хорошо определена, и при использовании достаточно богатого множества y > 0.5+0.5h; y < 0.5-0.5h ) и неоднозначной ( $${\rm{y }}\in {\rm{[0}}{\rm{.5 - 0}}{\rm{.5h}}{\rm{, 0}}{\rm{.5 + 0}}{\rm{.5h]}}$$ ) обратной функцией. В областях однозначности функции могут быть получены произвольно точные результаты для обратной задачи. Однако в отрезке нарушения однозначности h. Такие задачи, корректное (единственное и устойчивое) решение которых может быть получено только для
некоторой подобласти множества значений, будем называть условно (или частично ) h=1 ). Прямая задача по-прежнему корректно поставлена, требуемое обучение и обобщение может быть достигнуто ( $$E_L \approx 0$$ ). Однако ситуация качественно меняется для случая обратной задачи. Обратная функция двузначна на всем множестве значений, информация о ее значении минимальна. Обратная задача полностью некорректно поставлена.Что общего между всеми этими примерами? В каждом из них ошибка обобщения при решении обратной задачи не может быть меньше значения, определяемого размером области неоднозначности h, который, таким образом, может рассматриваться, как мера некорректности задачи. В случае, если для решения обратной задачи используется метод со стабилизирующими свойствами (например, с малым числом свободных параметров по сравнению с числом обучающих примеров), будет получено гладкое решение с ненулевой h.
Заметим, что прямая задача является безусловно корректной только при полном отсутствии шума в обучающих данных. При наличии случайных компонент в значениях X имеется целое "облако" решений прямой задачи, причем размер облака пропорционален величине шума. Таким образом, нарушается единственность решения прямой задачи, и она становится некорректно поставленной.
Классическим методом решения некорректных задач является метод
В приложении к нейросетевые моделям, регуляризирующие методы сводятся к оптимизации функционала ошибки (в простейшем случае - суммы квадратов уклонений модели от экспериментальных значений) с аддитивной добавкой, исчезающей по мере улучшения свойств гладкости функции:
$$E\left[ G \right] = \sum\limits_{\alpha = 1}^{N_\alpha }{\left( {G(\vec x^\alpha ) - \vec y^{(\alpha )}}\right)^2 + \lambda \phi \left[ G \right]}.$$
Здесь $$\phi $$ - регуляризирующий функционал, $$\lambda $$ - неотрицательная константа
Замечательной особенностью нейросетевых моделей (аппроксимаций системной функции на основе конечного набора наблюдений) являются их внутренние регуляризирующие свойства, позволяющие получать малые ошибки обобщения. Полезность регуляризирующих свойств нейронных сетей проявляется в ситуациях, когда экспериментальные данные о системе содержат внутреннюю избыточность. Избыточность позволяет представить совокупность данных моделью, содержащей меньшее число параметров, чем имеется данных. Таким образом, нейросетевая модель сжимает экспериментальную информацию, устраняя шумовые компоненты и подчеркивая непрерывные, гладкие зависимости.
Следует отметить, что в случае полностью случайных отображений построение модели с малой ошибкой обобщения не возможно. Достаточно рассмотреть простой пример, в котором аппроксимируется отображение фамилий абонентов телефонной сети (вектор входов X ) в номера их телефонов (вектор выходов Y ). При любой схеме построения обобщающей модели предсказание номера телефона нового абонента по его фамилии представляется абсурдным.
Имеется обширная научная библиография, посвященная обоснованию оптимального выбора нейроархитектур и переходных функций нейронов исходя из различных видов регуляризирующих функционалов $$\phi $$ (см., например [4.11] и цитируемую там литературу). Практическая направленность данной леции не позволяет изложить математические детали. Одним из продуктивных подходов к построению нейросетей с хорошими обобщающими свойствами является требование убывания высоких гармоник Фурье переходных функций. Различные законы убывания приводят к локальным сплайн-методам и нейросетям с радиальными
В случае сигмоидальной переходной функции абсолютная величина коэффициентов
Рассмотрим особенности регуляризированных A, B и C. 200 пар x-y, в которых величина x случайно равномерно распределена на отрезке [0,1], а значение y определяется моделируемой функцией. Расчеты проведены для нейросети с обратным распространением ошибки и нейросети встречного распространения. Еще 500 случайных примеров служили для оценки ошибки обобщения. В трех сериях расчетов величины y из 0%, 10% и 50% соответственно. Обучение проводилось на обратной зависимости x(y), т.е. величины y использовались в качестве входов, а x - выходов нейросети.
Проведенные расчеты преследовали следующие основные цели:
Результаты моделирования приведены на рис. 4.3, 4.4, 4.5, 4.6 и 4.7.
(рис 4.3) Зависимость EL (кружки) и ошибки обобщения EG (точки) от степени некорректности h обратной задачи при различных уровнях шума
На рис. 4.3 представлено изменение h. Для сильно некорректной задачи ( h=1 ) результаты полностью не зависят от шума в данных. Теоретически, для неограниченного обучающего набора для моделируемых систем имеется точное (линейное) решение, минимизирующее среднеквадратичное уклонение, которое в предельном случае ( h=1 ) дает значение ошибки 0.25. Расчетное значение на рис. 4.3 в этом наихудшем случае близко к данной теоретической величине.
Таким образом, скейлинг
На следующем рисунке приведено регуляризованное решение предельно некорректной задачи ( h=1 ), даваемое нейронной сетью с обратным распространением, обученной на зашумленных данных.
(рис 4.4) Регуляризованное решение (точки) предельно некорректной обратной задачи, полученное при помощи нейросети с обратным распространением ошибки на зашумленных данных (кружки).Решение отвечает минимуму среднеквадратичного уклонения от обучающих данных, что является типичным для сетей с сигмоидальными функциями.
Укажем явно, в чем состоит характер априорных предположений, принимаемых при построении нейросетевых моделей. Единственное предположение (которого оказывается достаточно для
Обратная задача может считаться условно корректной, если в признаковом пространстве выходных переменных имеются области, где обратное отображение однозначно (как в случае системы B с промежуточными значениями скачка h ). Для рассмотренных в предыдущем пункте однопараметрических систем области корректности могут быть выявлены при графическом представлении экспериментальных данных. Отделение областей условной корректности в многомерных пространствах параметров является качественно более сложной задачей. В этом разделе предлагается исследовать возможности
При произвольном распределении точек в многомерном пространстве задача таксономии (т.е. разделения всех точек на несколько компактных групп, называемых кластерами) является достаточно сложной, несмотря на то, что имеется целый ряд методов ее решения. Ситуация дополнительно усложняется в важном практическом случае, когда число кластеров заранее не известно.
На классе
Если для приложений достаточно только оценки плотности распределения точек по кластерам с сохранением лишь ближнего порядка в кластеризации, то такое разбиение может быть выполнено более эффективно на основе модели " нейронного газа " [4.12, 4.13], в которой соседство узлов не фиксировано, а динамически меняется по мере улучшения кластеризации. В относительно недавней модификации метода, получившей название " расширяющийся нейронный газ " [4.13], переменными являются не только отношения соседства, но и число нейронов-кластеров.
В данной лекции более подробно рассматриваются приложения более часто используемой карты Кохонена.
Основная идея предлагаемого метода дифференциальной оценки степени некорректности обратной или комбинированной задачи состоит в реализации следующего плана:
Y для чисто обратной задачи, или по совокупности входных и выходных компонент (X,Y) для комбинированного отображения (X,Y)=F(X,Y) ;Важно отметить, что в данном подходе пользователь получает для каждого запроса к нейросетевой модели адекватную локальную точность получаемого результата, и корректный отказ в выдаче результата в области высокой нерегулярности задачи. Поскольку карта Кохонена дает высокую степень наглядности при изучении распределения экспериментальных данных, то распределение степени некорректности по ней представляет богатый материал для понимания особенностей модели и ее параметров. Неоднородности в "раскраске" карты могут отвечать различным режимам поведения инженерной установки или прибора. При моделировании технических систем это часто может служить указанием на нежелательные (или аварийные!) соотношения параметров при эксплуатации.
Для иллюстрации предлагаемого метода рассмотрим его применение к уже использовавшимся модельным системам A, B и C. Для простоты рассмотрения (и снижения числа необходимых вычислений) можно применить упрощенный алгоритм получения оценки некорректности. Для этого вместо использования набора малых экспертов ограничимся одним персептроном (без скрытых слоев), входы которого замкнуты на выходы нейронов карты Кохонена, а число выходов совпадает с размерностью признакового пространства выходов задачи. Такая гибридная нейроархитектура, называемая сетью встречного распространения , предложена Р.Хехт-Нильсеном [4.7, 4.8].
Каждый кластер соревновательного
Уклонение кусочно-постоянной поверхности от значений выходных векторов
(рис 4.5) Гладкое регуляризованное решение (кружки) сетью с обратным распространением ошибки для слабо некорректной задачи двузначного отображения, заданного дискретным набором примеров (точки).На Рис. 4.5 и 4.6 приведено сравнения гладкого регуляризованного решения, определяемого многослойной сетью с обратным распространением, и решения, получаемого при помощи нейросети встречного распространения. Расчеты проведены для системы B для случая относительно слабой некорректности с малым значением величины скачка h.
Легко заметить совершенно различный характер 0.4<Y<0.6 ). Кривая решения и ошибка гладко распространяются в область, где поведение моделируемой системы регулярно.
В случае Y=0 и Y=1 ). Решение же в области
Полезность того или иного представления решения может определиться только в контексте конкретного приложения. Для системы, предупреждающей о высокой ошибке решения в области некорректности, по-видимому, следует предпочесть результат
(рис 4.6) Кусочно-постоянное в области регулярности решение некорректной обратной задачи, полученное с помощью сети встречного распространения (см. подпись и обозначения на Рис.4.5).Обратимся теперь к изучению возможности автоматического выделения области некорректности. В нейронной
В приведенном примере, при h=0.2, теоретическое значение предельной 0.1. Распределение ошибки по кластерам, наблюдаемое в расчетах, приведено на рис. 4.7. Область некорректности может быть легко автоматически выделена при помощи простого решающего правила.
(рис 4.7) Распределение ошибки обучения по пространственным кластерам Карты самоорганизации Кохонена с легко выделяемой областью некорректности задачи.Подведем некоторые итоги рассмотрения модельных задач. Можно выделить два основных пути применения нейронных сетей встречного распространения для решения обратных и комбинированных некорректно поставленных задач.
Во-первых, слой самоорганизующихся нейронов карты Кохонена позволяет получить локальную дифференциальную оценку степени некорректности задачи и пространственное распределение ошибки обобщения, делаемой сетью. Кластерное разложение одинаково легко выполняется в признаковых пространствах любой размерности.
Алгоритм кластеризации Кохонена легко обобщается на случай наличия пропусков в данных. Поскольку для отнесения некоторого вектора к кластеру требуется лишь вычислить
Второй прикладной аспект состоит в том, что в областях корректности задачи решение, даваемое
Сложные инженерные устройства при воздействии внешних факторов могут демонстрировать разнообразное нелинейное поведение. С точки зрения эксплуатации таких систем отклик может отвечать нормальному режиму работы, а также аномальным и аварийным режимам. В последнем случае требуется принятие специальных мер для снижения риска последствий инцидента.
Задача информационного моделирования при оценке
Примером задачи оценки риска является эксплуатация контейнера для перевозки или хранения промышленных отходов (например, делящиеся материалы в отработанных твэлах атомных электростанций, или токсичные химические вещества). В качестве аномального внешнего воздействия требуется рассмотрение пожара с различными параметрами. Отклик контейнера (измеряемый оценкой сохранности содержимого и не проникновением его во внешнюю среду) может изменяться в зависимости от текущего состояния системы, например, степенью возможных повреждений в аварийных условиях.
Рассмотрим относительно простую и полезную с практической точки зрения модель, основанную на данных измерений параметров контейнера при различных условиях пожара. Фактически, построенная модель основывалась на результатах численного моделирования, а не на реальных данных. Это, однако, не снижает ценность рассмотрения, поскольку в численных расчетах удается учесть широкий спектр пожаров для одного и того же контейнера. Неопределенность в коэффициентах, описывающих теплофизические свойства материалов, а также численные эффекты, вносят шум в используемые данные, приближая условия моделирования к реальным. В сложившейся практике нейросетевого моделирования данные такого рода называют реалистичными (в отличие от искусственных и реальных данных).
База собранных данных содержит 8 параметров, описывающих контейнер и условия пожара. Признаковое пространство входов состоит из 6 переменных - одной переменной состояния контейнера (экспертная оценка степени повреждения контейнера) и пяти параметров воздействия (свойств пожара).
(рис 4.8) Схема расположения контейнера и области, охваченной пламенем. Параметры пожара включают две координаты области пламени, диаметр этой области, температуру пожара и его длительность.
Двумя выходными переменными являются максимальное значение температуры внутри контейнера на протяжении всего пожара, а также отрезок времени, в течение которого температура внутри контейнера превышала некоторое пороговое значение, соответствующее критическому уровню возможного повреждения содержимого контейнера.
Информационная модель отклика контейнера строилась на основе
Нейронная сеть для прямой задачи содержит 6 входов и 2 оцениваемых выхода. Прямая задача для данного приложения позволят ответить на следующие вопросы:
Обратная задача соответствует оценке параметров внешнего воздействия по измерениям отклика системы. Тепловой режим внутри контейнера при этом контролируется датчиками температуры. Запросы к обратной модели носят диагностический характер:
Наиболее интересная комбинированная задача рассматривает часть параметров как известные, а остальные, как неизвестные. При обучении нейросети комбинированной задаче множества переменных, используемых как входные и как выходные, могут частично или полностью перекрываться.
Комбинированная задача отвечает на все запросы прямой и обратной задач, но имеет дополнительные возможности:
Обратную и комбинированную задачи следует рассматривать, как некорректно поставленные.
Область возможных значений физических параметров ограничивалась максимальными температурами пожара (достигаемыми при горении обогащенного топлива), расстояниями и размерами пламени, при которых теплопередача контейнеру приводит к температуре около 200оС (типичный порог для пожаро-сигнализирующих датчиков). Длительность пожара ограничивалась значением 1 час.
После введения всех ограничений данные из базы данных были линейным преобразованием приведены в "серый" формат [0..1].
На первом этапе в предлагаемой технологии исследовалась корректность задачи на всей области значений параметров. С этой целью последовательно выбирались семь параметров из восьми, включенных в модель. Эти параметры считались известными, а оставшийся восьмой параметр - неизвестным. Таким образом, каждый из параметров по очереди тестировался, как неизвестный. При моделировании определялась 30 нейронов).
$$E = \frac{{100\% }}{{N_\alpha N_{out}}}\sum\limits_\alpha^{N_\alpha }{\sum\limits_j^{N_{out}}{\left( {Z_j^{(\alpha )} - Y_j^{(\alpha )}}\right)^2 }}$$
Численное моделирование показало, что обе прямые задачи, когда неизвестными считались выходные переменные задачи - максимальная температура внутри контейнера и длительность периода превышения заданного уровня температуры, являются корректно поставленными. Значение 1%. Напротив, все шесть обратных/комбинированных задач оказались некорректными с 25-35%. Данные результат является принципиальным для планирования последующих экспериментов с информационной моделью: попытки оценки
Для выбора эффективной нейросетевой модели для (корректно поставленной) прямой задачи была изучена зависимость
(рис 4.9) Области на плоскости "температура пламени" - "длительность пожара", в которых максимальная температура внутри контейнера превышает значения 200, 500 и 800 градусов Цельсия.Для приложений требуется компактная и быстрая нейросетевая модель, легко обучаемая и имеющая невысокую ошибку обобщения. Данные требования в некоторой мере противоречивы, поэтому был суммирован опыт большого числа компьютерных экспериментов. Были обнаружены следующие особенности:
50-80% при росте объема базы обучающих данных (и соответственно, затрат на обучение!) в 3-4 раза. Следовательно, можно избежать больших объемов данных.10 раз большей, чем 10-15 нейронами на скрытом слое с масштаба 100 синаптическими связями, обученная на базе данных из 300-500 записей, она показывает ошибку обучения 2-3% при ошибке обобщения до 5%.На основе выбранной нейросетевой модели было проведено обучение нейросети и исследован ряд информационных запросов к ней.
Первая серия запросов была выполнена для определения области температур и длительностей пожара, при которых содержимое контейнера не перегревается. Рассматривались пожары, происходящие в непосредственной близости к контейнеру и имеющие диаметр до 15 м. Изолинии температур внутри контейнера показаны на рис.4.9. Расчеты соответствуют трем различным значениям нагрева содержимого 200, 500 и 800oC. Данные результаты в применении к конкретным образцам контейнеров могут составить основу технических требований к противопожарным службам. Так, например, кривая 200oC показывает параметры, при которых срабатывают типичные температурные датчики. Если критическим для эксплуатации оказывается режим превышения 500oC при температуре пламени 800oC, то, как следует из рис. 4.9, контейнер способен выдерживать такую нагрузку в течение 22 мин.
(рис 4.10) Зависимость длины промежутка времени (в минутах), в течении которого температура внутри контейнера превышала критический уровень, от расстояния до эпицентра пожара (в метрах) для двух значений диаметра пламени (15 и 20 м).Вторая рассмотренная задача связана с изучением зависимости тепловых условий внутри системы от расстояния до эпицентра пожара. На рис. 4.10 представлена зависимость длительности закритического нагрева (в минутах) от расстояния до области пожара (в метрах). Длительность пожара составляла 1 час. Интересно отметить, что наблюдается некоторое промежуточное значения расстояния до пожара, при котором теплопередача к контейнеру
На основе данной модели может быть исследовано множество других практических вопросов. Поскольку при анализе запросов нейронная сеть работает только в режиме прямого ненагруженного функционирования, время выполнения запросов минимально.
Займемся теперь рассмотрением обратной и комбинированной задач. Как мы уже убедились на основе расчетов, эти задачи обладают ярко выраженной некорректностью, связанной с неустранимой неоднозначностью обратной функции, поэтому интерес представляет возможность лишь их частичной
(рис 4.11) Распределение ошибок обучения по кластерам карты Кохонена. Ошибка на данных каждого кластера пропорциональна размеру соответствующего квадрата.Для исследований была выбрана комбинированная задача определения диаметра пламени по остальным параметрам пожара и измерениям внутри контейнера. Эта задача имеет минимальную ошибку обучения ( 22% ) при использовании данных из всей области параметров. Для данной задачи был выполнен кластерный анализ на основе 5x5=25 нейронов. рис. 4.11 отражает распределение
Результирующее распределение ошибок близко к равномерному, однако имеются две области (кластеры 1-2 и 4-3 в матричных обозначениях) с относительно малыми ошибками. Эти кластеры определяют области частичной 7 -мерном пространстве параметров.
Наиболее регулярной является область кластера 1-2. Анализ значений параметров, отвечающих центроиду данного кластера, позволяет заключить, что наименьшая ошибка определения диаметра пламени путем решения обратной задачи достигается для высокотемпературных (около 1000oC ), длительных (более получаса) пожаров при промежуточных расстояниях до эпицентра (масштаба диаметра пламени).
Следующий шаг исследований состоял в классификации записей в базе данных по построенным кластерам обученной сети Кохонена. Из полного набора измерений около 2.5% данных оказалось относящимися к наиболее регулярному кластеру 1-2. Эти данные были использованы для обучения многослойной сети с обратным распространением с 7 входами и одним выходом. Результирующая ошибка регуляризованного решения составила лишь 8.5%, что приблизительно в три раза меньше
Результаты описанных исследований могут быть обобщены в нейросетевую технологию решения обратных и комбинированных задач:
Промышленная нейросетевая модель, созданная по данной технологии будет содержать материнскую сеть Кохонена и семейство малых сетей-экспертов с обратным распространением ошибки. Такая
Предлагаемый подход к нейросетевому моделированию сложных технических систем относительно прост в реализации и непосредственно соответствует ежедневным информационным потребностям инженеров, связанных с эксплуатацией таких систем.
Подведем итоги этой лекции. Нейронные сети являются естественным инструментом для построения эффективных и гибких информационных моделей инженерных систем. Различные нейроархитектуры отвечают различным практическим требованиям.
Сети двойственного функционирования с обратным распространением ошибки и
Внутренние регуляризирующие особенности нейронных сетей позволяют решать также обратные и комбинированные задачи с локальной оценкой точности. Для некорректно поставленных задач моделирования предложена нейросетевая информационная технология построения гибридной нейроархитектуры, содержащей кластеризующую карту Кохонена и семейство сетей с обратным распространением, обучаемых на данных индивидуальных кластеров. В этой технологии выявляются области
В работе рассмотрены примеры применения методики
Автор благодарен В.В.Легонькову и Л.И.Шибаршову за полезные обсуждения и консультации.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.