Животные делятся на:
принадлежащих Императору, набальзамированных, прирученных, сосунков, сирен, сказочных, отдельных собак, включенных в эту классификацию, бегающих, как сумасшедшие, бесчисленных, нарисованных тончайшей кистью из верблюжьей шерсти, прочих, разбивших цветочную вазу, издали напоминающих мух.
Нейрокомпьютинг имеет многочисленные точки соприкосновения с другими дисциплинами и их методами. В частности, теория нейронных сетей использует аппарат статистической механики и теории оптимизации. Области приложения нейрокомпьютинга подчас сильно пересекаются или почти совпадают со сферами применения математической статистики, теории нечетких множеств и экспертных систем. Связи и параллели нейрокомпьютинга чрезвычайно многообразны и свидетельствуют о его универсальности. В данной лекции, которую можно рассматривать как дополнительную, так как она требует несколько большей математической подготовки, мы поговорим только о наиболее важных из них.
Поскольку в настоящее время нейронные сети с успехом используются для анализа данных, уместно сопоставить их со старыми хорошо
разработанными статистическими методами. В литературе по статистике иногда можно встретить утверждение, что наиболее часто применяемые
нейросетевые подходы являются ни чем иным, как неэффективными регрессионными и дискриминантными моделями. Мы уже отмечали прежде, что
Как уже отмечалось, некоторые статистики утверждают, что нейросетевые подходы к обработке данных являются просто заново переоткрытыми и переформулированными, но хорошо известными статистическими методами анализа. Иными словами, нейрокомпьютинг просто пользуется новым языком для описания старого знания. В качестве примера приведем цитату из Уоррена Сэрла:
Многие исследователи нейронных сетей являются инженерами, физиками, нейрофизиологами, психологами или специалистами по компьютерам, которые мало знают о статистике и нелинейной оптимизации. Исследователи нейронных сетей постоянно переоткрывают методы, которые известны в математической и статистической литературе десятилетиями и столетиями, но часто оказываются неспособными понять как работают эти методы
Подобная точка зрения, на первый взгляд, может показаться обоснованной. Формализм нейронных сетей действительно способен претендовать на роль универсального языка. Не случайно уже в пионерской работе МакКаллока и Питтса было показано, что нейросетевое описание эквивалентно описанию логики высказываний.
Я в действительности обнаружил, что с помощью техники, которую я разработал в работе1961 года (…), я мог бы легко ответить на все вопросы, которые мне задают специалисты по мозгу (...) или компьютерщики. Как физик, однако, я хорошо знал, что теория, которая объясняет все, на самом деле не объясняет ничего: в лучшем случае она является языком. Эдуардо Каянелло
Не удивительно поэтому, что статистики часто обнаруживают, что привычные им понятия имеют свои аналоги в теории нейронных сетей. Уоррен Сэрл составил небольшой словарик терминов, использующихся в этих двух областях.
| Нейронные сети | Статистические методы. |
|---|---|
| Признаки | переменные |
| входы | независимые переменные |
| выходы | предсказанные значения |
| целевые значения | зависимые переменные |
| ошибка | невязка |
| обучение, адаптация, самоорганизация | оценка |
| функция ошибки, функция Ляпунова | критерий оценки |
| обучающие образы (пары) | наблюдения |
| параметры сети: веса, пороги. | Оценочные параметры |
| нейроны высокого порядка | взаимодействия |
| функциональные связи | трансформации |
| обучение с учителем или гетероассоциация | регрессия и дискриминантный анализ |
| обучение без учителя или автоассоциация | сжатие данных |
| соревновательное обучение, адаптивная векторная квантизация | кластерный анализ |
| обобщение | интерполяция и экстраполяция |
В чем же заключается сходство и различие языков нейрокомпьютинга и статистики в анализе данных. Рассмотрим простейший пример.
Предположим, что мы провели наблюдения и экспериментально измерили N пар точек, представляющих функциональную зависимость $$y(x): \{(x_1,y_1),\ldots ,(x_N,y_N)\}$$. Если попытаться провести через эти точки наилучшую прямую, что на языке статистики будет означать использование для описания неизвестной зависимости линейной модели $$y=ax+b+\varepsilon$$, (где $$\varepsilon$$ обозначает шум при проведении наблюдения), то решение соответствующей проблемы линейной регрессии сведется к нахождению оценочных значений параметров $$\mbox{\~a}$$, $$\mbox{\~b}$$ минимизирующих сумму квадратичных невязок.$$\sum_{k=1}^N[y_k-(ax_k+b)]^2.$$
Если параметры $$\mbox{\~a}$$ и $$\mbox{\~b}$$ найдены, то можно оценить значение y для любого значения x, то есть осуществить интерполяцию и экстраполяцию данных.
Та же самая задача может быть решена с использованием
(рис 11.1) Линейная регрессия и реализующий ее однослойный персептронПри сравнении этих двух подходов сразу бросается в глаза то, что при описании своих методов статистика апеллирует к формулам и уравнениям, а нейрокомпьютинг к графическому описанию нейронных архитектур.
Еще одним существенным различием является то, что для методов статистики не имеет значения, каким образом будет минимизироваться
невязка - в любом случае модель остается той же самой, в то время как для нейрокомпьютинга главную роль играет именно метод обучения.
Иными словами, в отличие от нейросетевого подхода, оценка параметров модели для статистических методов не зависит от
В отличие от нейросетевого подхода, в котором основное время забирает обучение сетей, при статистическом подходе это время тратится на тщательный анализ задачи. При этом опыт статистиков используется для выбора модели на основе анализа данных и информации, специфичной для данной области. Использование нейронных сетей - этих универсальных аппроксиматоров - обычно проводится без использования априорных знаний, хотя в ряде случаев оно весьма полезно. Например, для рассматриваемой линейной модели использование именно среднеквадратичной ошибки ведет к получению оптимальной оценки ее параметров, когда величина шума имеет нормальное распределение с одинаковой дисперсией для всех обучающих пар. В то же время если известно, что эти дисперсии различны, то использование взвешенной функции ошибки$$\sum_{k=1}^Nc_k[y_k-(ax_k+b)]^2$$ может дать значительно лучшие значения параметров.
Помимо рассмотренной простейшей модели можно привести примеры других в некотором смысле эквивалентных моделей статистики и нейросетевых парадигм
| Нейронные сети | Статистические методы |
|---|---|
| Многослойный персептрон | Нелинейная (в т.ч. логистическая) регрессия, Дискриминантные модели |
| Автоассоциативный персептрон | Анализ главных компонент |
| Векторная квантизация | Кластеризация с k-средними |
| Сети нейронов высоких порядков | Полиномиальная регрессия |
Логистическая регрессия является методом
Лучшим ответом на этот сугубо практический для прикладника вопрос является "It depends". По-русски это означает "Все зависит от ситуации". Иногда, особенно если априорная информация о данных отсутствует, разумнее использовать нейронные сети. Такой выбор часто дает быстрое и качественное решение задачи, как правило не худшее, чем получаемое статистическими методами после тщательного изучения структуры данных.
При наличии дополнительных знаний о характере задачи статистические данные могут оказаться предпочтительнее. При сравнительном анализе возможностей нейронных сетей и статистических методов надо быть достаточно осторожными, поскольку иногда весьма сложные нейросетевые подходы сопоставляются с простыми статистическими моделями или наоборот. Существует мнение, что одинаково мощные статистические и нейросетевые подходы дают результаты одинаковые по точности и по затратам. Тем не менее, примеры решения действительно важных прикладных задач могут дать представление о возможностях того или иного подхода.
Дэвид Эшби и Нед Кумар из Школы Бизнеса в Арканзасе сравнили результаты применения нейросетевой технологии и классического
дискриминантного анализа к предсказанию невыполнения обязательств по высокодоходным облигациям ("
Среди так или иначе конкурирующих методологий (а нейронные сети и статистика имеют общую часть "электората" - анализ данных) как правило побеждает не более обоснованная и надежная, а та, что ставит новые задачи для исследования (Имре Лакатош). Нейрокомпьютинг гораздо более молодая отрасль знания нежели статистика. Он бросает многочисленные вызовы специалистам различных профессий: биологам, физикам, психологам, математикам и другим. Кроме того, сфера теории нейронных сетей гораздо шире анализа данных. Она включает в себя и моделирование мозга и разработку нейрокомпьютеров. Статистики не могут претендовать на соревнование в этих областях и ревностно следят за претензиями нейрокомпьютинга на их экологическую нишу.
Конструктивный взгляд на взаимоотношение нейронных сетей и статистических методов заключается в том, что в общем случае они должны помогать друг другу и обогащать друг друга. Кристоф и Пьер Кувре назвали такой процесс перекрестным опылением.
Джон Такер провел тщательное сравнительное исследование использования логистической регрессии и нейронных сетей и определил следующее
их принципиальное различие, которое сохраняет свое значение и при общем сопоставления статистики и нейрокомпьютинга. В то время как
статистические методы фокусируются на оптимальном методе выбора переменных, нейрокомпьютинг ставит во главу угла предобработку этих
переменных. Если нейронная сеть представляет собой многослойный персептрон, то функцией скрытых слоев и является такая последовательная
предобработка данных. Вследствие этого нейронные сети занимают уникальное место среди методов обработки данных, превосходя их в
универсальности и сложности, оставаясь при этом
Главный практический вывод, который может сделать читатель, сводится к фразе, уже ставшей афоризмом:
Если ничего не помогает, попробуйте нейронные сети.
Рассмотрим теперь отношения нейрокомпьютинга и экспертных систем. Обе эти технологии иногда относят к направлению Искусственный Интеллект, хотя строго говоря, термин искусственный интеллект появился в 70-е годы в связи с экспертными системами, как направления альтернативного нейронным сетям.
Его основатели - Марвин Минский и Эдвард Фейгенбаум посчитали излишней апелляцию к архитектуре мозга, его нейронным структурам, и
декларировали необходимость моделирования работы человека со знаниями. Тем самым, поставив в центр внимания операции с
формально-логическими языковыми структурами, они заведомо выбрали ориентацию на имитацию обработки информации левым полушарием мозга
человека. Системы обработки таких формализованных знаний были названы экспертными, поскольку они должны были воспроизводить ход
логических рассуждений эксперта (высокопрофессионального специалиста) в конкретной предметной области. Эти рассуждения проводятся с
использованием правил вывода, которые
Заметим, что в настоящее время распространено более широкое толкование систем искусственного интеллекта. К ним относят не только
экспертные , но и нечеткие системы, нейронные сети и всевозможные комбинации, такие как
Однако, экспертные системы претендовали именно на решение важных прикладных задач прежде всего в таких областях, как медицина и геология. При этом соответствующая технология в сочетании с нечеткими системами была в 1978 году положена японцами в основу программы создания компьютеров 5-го поколения.
Сопоставление экспертных систем и нейрокомпьютинга выявляет различия, многие из которых характерны для уже отмечавшихся в первой лекции различий обычных компьютеров (а экспертные системы реализуются именно на традиционных машинах, главным образом на языке ЛИСП и Пролог) и нейрокомпьютеров
| Нейронные сети | Экспертные системы | |
|---|---|---|
| Аналогия | правое полушарие | левое полушарие |
| Объект | данные | знания |
| Вывод | отображение сетью | правила вывода |
Важным преимуществом нейронных сетей является то, что разработка экспертных систем, основанных на правилах требует 12-18 месяцев, а нейросетевых - от нескольких недель до месяцев.
Рассматривая извлечение знаний из обученных нейронных сетей мы уже показали, что представление о них, как о черных ящиках, не способных объяснить полученное решение (это представление иногда рассматривается как аргумент в пользу преимущества экспертных систем перед нейросетями), неверно. В то же время, очевидно, что как и в случае мозга, в котором левое и правое полушарие действуют сообща, естественно и объединение экспертных систем с искусственными нейронными сетями. Подобные синтетические системы могут быть названы нейронными экспертными системами - этот термин использовал Иржи Шима, указавший на необходимость интеграции достоинств обоих типов систем. Такая интеграция может осуществляться двояким образом. Если известна только часть правил, то можно либо инициализировать веса нейронной сети исходя из явных правил, либо инкорпорировать правила в уже обученные нейронные сети. Шима предложил использовать и чисто коннекционистский методику построения нейронных эксперных систем, которая обладает таким достоинством, как возможность работы с неполными данными (ситуация типичная для реальных баз данных). Такой возможностью обладают введенные им сети интервальных нейронов.
Ситуация, в которой некоторые данные не известны или не точны, встречается достаточно часто. Например, при оценке возможностей той или иной фирмы, можно учитывать ее официально декларируемый капитал, скажем в 100 миллионов, но лучше всего считать, что в действительности его величина является несколько большей и меняется в интервале от 100 до 300 млн. Удобно ввести в данном случае специальные нейроны, состояния которых кодируют не бинарные или непрерывные значения, а интервалы значений. В случае, если нижняя и верхняя граница интервала совпадают, то состояния таких нейронов становятся аналогичными состояниям обычных нейронов.
Для интервального нейрона $$i$$ на каждый его вход $$j$$ подается не одно $$\langle a_j,b_j \rangle$$, а пара значений, определяющая границы интервала, в котором лежит величина воздействия $$j$$ -го нейрона. Воздействие, оказываемое на $$i$$ -й нейрон со стороны всех связанных с ним нейронов само лежит в интервале $$\langle x_i,y_i\rangle$$, где$$x_i=\sum_jw_{ij}\left(\frac{a_j}{1-e^{-\beta_{i}w_{ij}}}+\frac{b_j}{1-e^{\beta_{i}w_{ij}}}\right),$$ $$y_i=\sum_jw_{ij}\left(\frac{a_j}{1-e^{-\beta_{i}w_{ij}}}+\frac{b_j}{1-e^{\beta_{i}w_{ij}}}\right),$$ $$\beta_i$$ - обратная температура.
Интервальное значение, которое принимает $$i$$ -й нейрон при данном воздействии, равно$$\langle a_i,bi \rangle=\langle S_i (x_i),S_i(y_i)\rangle$$ где$$S_i(x)=\frac{1-e^{-\beta_{i}x}}{1+e^{-\beta_{i}x}}.$$
Передаточная функция интервального нейрона приблизительно отражает идею монотонности по отношению к операции интервального включения. Это означает, что при $$\beta \rightarrow\infty $$, если вход $$j$$ -го нейрона лежит в интервале $$\langle a_j,b_j\rangle$$, то выход $$i$$ - го нейрона, определенный по классической функции Ферми, обязательно попадет в интервал $$\langle a_j,b_j\rangle$$. Интервальные нейроны могут являться элементами многослойных персептронов. В этом случае их состояния вычисляются последовательно, начиная от входного слоя к выходному. Для сетей интервальных нейронов может быть построено обобщение метода обратного распространения ошибки, описание которого выходит за рамки нашего курса.
Системы нечеткой логики (
Хотя нечеткая логика может явно использоваться для представления знаний эксперта с помощью правил для
Кроме них имеются также нечеткие нейронные системы. Так называются нейронные сети, использующие методы нечеткости для ускорения обучения и улучшения своих характеристик. Это может достигаться, например, использованием нечетких правил для изменения темпа обучения или же рассмотрением нейронных сетей с нечеткими значениями входов.
| Предыдущий градиент $$\rightarrow$$ | Текущий градиент | ||||
|---|---|---|---|---|---|
| NB | NS | Z | PS | PB | |
| NB | PB | PS | Z | NS | NB |
| NS | NS | PS | Z | NS | NB |
| Z | NB | NS | Z | NS | NB |
| PS | NB | NS | Z | PS | NS |
| PB | NB | NS | Z | PS | PB |
Лингвистические переменные Темп Обучения и Градиент принимают в иллюстрируемом таблицей нечетком правиле адаптации следующие значения: NB - большой отрицательный; NS - малый отрицательный; Z - близок к нулю; PS - малый положительный; PB - большой положительный.
Наконец, в современных гибридных нейронных нечетких системах нейронные сети и нечеткие модели комбинируются в единую гомогенную архитектуру. Такие системы могут интерпретироваться либо как нейронные сети с нечеткими параметрами, либо как параллельные распределенные нечеткие системы.
Центральным понятием нечеткой логики является понятие
Смысл лингвистического значения X и характеризуется выбранной мерой - так называемой функций принадлежности (membership
function) $$\mu:\rightarrow[0,1]$$, которая каждому элементу u универсального множества U ставит в соответствие значение совместимости этого элемента с X .
В нашем случае универсальным множеством является множество всех возможных величин падения производства (от 0 до 100%).
(рис 11.2) Функции принадлежности лингвистической переменной Падение производства
Нечеткое правило связывает значения
Если (падение производства - катастрофическое), то (доходы от экспорта энергоресурсов - значительные).
Нечеткое подмножество универсального множества U характеризуется функцией принадлежности $$mu_A:U\rightarrow[0,1]$$, которая ставит в соответствие каждому элементу $$u\in U$$ число $$\mu_A(u)$$ из интервала [0, 1], характеризующее степень принадлежности элемента u подмножеству A.
Носителем множества A называется множество таких точек в U, для которых величина $$\mu_A(u)$$ положительна.
Преобразование, осуществляемое типичным нейроном с двумя входами, имеет вид $$y=f(w_1x_1+w_2x_2)$$, где $$f(\cdot)$$ -сигмоидная функция. Для того, чтобы обобщить его, нужно представить себе, что вес нейрона не обязательно должен умножаться на значение соответственного входа, а здесь может быть применена какая-либо другая операция. Далее, суммирование воздействий также может быть заменено неким другим действием. Наконец, вместо сигмоидной функции потенциал нейрона может быть преобразован каким-либо новым способом. В нечеткой логике операция умножения заменяется для булевых переменных операцией И, а для числовых - операцией взятия минимума (min). Операция суммирования заменяется соответственно операциями ИЛИ и взятием максимума (max).
Если осуществить соответствующие замены в преобразовании, осуществляемом знакомым нам нейроном, и положить в нем $$f(z)=z$$ (линейный выход), то мы получим так называемый нечеткий ИЛИ-нейрон:$$y=\max\{\min(w_1,x_1)\min(w_2,x_2)\}.$$
Для нечетких нейронов полагается, что значения входов и весов заключены в интервале [0, 1], поэтому и выход нейрона ИЛИ будет принадлежать этому же интервалу.
Используя противоположную подстановку (умножение max), (сложение min ) получим преобразование, характерное для нечеткого И-нейрона:$$y=\min\{\max(w_1,x_1)\max(w_2,x_2)\}$$
В лекции, посвященной извлечению знаний, мы уже познакомились с нейросетевыми методами извлечения правил из данных. Настало время узнать, как можно извлечь с их помощью нечеткие правила.
Рассмотрим набор нечетких правил$$\Re_i:$$ Если $$x$$ есть $$A_i,$$ то $$y$$ есть $$B_i$$, $$i=1,\ldots ,n$$
Каждое из них может интерпретироваться как обучающая пара для многослойного персептрона. При этом, условие (x есть $$A_i$$ ) определяет значение входа, а следствие (y есть $$B_i$$ ) - значение выхода сети. Полное обучающее множество имеет вид $$\{(A_1,B_1),\ldots ,(A_n,B_n)\}$$. Заметим, что каждому лингвистическому значению $$A_i, B_i$$ соответствует своя функция принадлежности, так что каждое нечеткое правило определяет связь двух функций.
Если же правила имеют более сложный вид, типа "два входа - один выход":$$\Re_i:$$ Если $$x$$ есть $$A_i$$ и $$y$$ есть $$B_i,$$ то $$z$$ есть $$C_i, i=1,\ldots ,n$$ то обучающая выборка принимает форму $$\{(A_i,B_i),C_i\}, i=1,\ldots ,n$$, Существует два основных подхода к реализации нечетких правил типа if-then с помощью многослойных персептронов.
В методе Умано и Изавы нечеткое множество представляется конечным числом значений совместимости. Пусть $$\alpha_1,\alpha_2$$ включает носители всех $$A_i$$, входящих в обучающую выборку а также носители всех $$A^{\prime}$$, которые могут быть входами в сети. Предположим также, что $$[\beta_1\beta_2]$$ включает носители всех $$B_j$$, входящих в обучающую выборку, а также носители всех $$B^{/prime}$$, которые могут быть входами в сети. Положим$$x_j=\alpha_1+(j-1)(\alpha_2-\alpha_1)/(N-1),j=1,\ldots ,N; N>1$$ $$y_j=\beta_1+(i-1)(\beta_2-\beta_1)/(M-1),i=1,\ldots ,M; M>1$$
Дискретный аналог обучающего множества правил (заменяющее функциональное) имеет вид:$$\{(A_i(x_1),\ldots ,A_i(x_N)),(B_i(y_1),\ldots ,B_i(y_M))\}, i=1,\ldots ,n$$
Если теперь ввести обозначения $$a_{ij}\equiv A_i(x_i), b_{ij}\equiv B_i(y_i)$$, то можно представить нечеткую нейронную сеть с $$N$$ входными и $$M$$ выходными нейронами ( рис 11.3(рис 11.3) Нечеткая нейронная сеть и треугольные функции принадлежности входных и выходных переменных
Пример 1. Предположим, что обучающая выборка включает три правила: $$\Re_1$$: Если город мал, то доход от продажи бриллиантов отрицателен, $$\Re_2$$: Если город средний, то доход от продажи бриллиантов близок к нулю, $$\Re_3$$: Если город велик, то доход от продажи бриллиантов положителен.
Функции принадлежности определим как$$\mu_{малый}(u)=\left\{ \begin{array}{cc} 1-\frac{u}{50000} 0\leq u\leq 50000\\ 0, u>50000, \end{array}\right.$$ $$\mu_{доход<0}(u)=\left\{ \begin{array}{cc} -u, -1\leq u\leq 0\\ 0, u>0, \end{array}\right.$$ $$\mu_{средний}(u)=\left\{ \begin{array}{cc} \frac{u}{50000}, 0\leq u\leq 50000\\ \frac{300000-u}{250000} , 50000\leq u\leq 300000\\0, u>300000, \end{array}\right.$$ $$\mu_{доход=0}(u)=\left\{ \begin{array}{cc} 1-2|u|, |u|\leq0.5\\ 0, |u|>0.5, \end{array}\right.$$ $$\mu_{большой}(u)=\left\{ \begin{array}{cc} 0, u<50000\\ \frac{u-50000}{250000} , 50000\leq u\leq 300000\\1, u>300000, \end{array}\right.$$ $$\mu_{доход>0}(u)=\left\{ \begin{array}{cc} u, 0\leq u\leq 1\\ 0, u<0, \end{array}\right.$$ (Здесь предполагается, что доход не превышает 100% или 1.0 в относительных величинах)
Тогда обучающая выборка принимает форму {(малый, отрицательный), (средний, близок к нулю), (большой, положительный)}
Если носитель множества входов [0, 10 000 000], то для покрытия множества населения городов равномерной сеткой, захватывающей и малые города, понадобится несколько сот точек. Поэтому, ограничимся городами с населением 1 000 000 человек. Тогда можно выбрать $$N\cong 50-100$$. Носитель множества выходов [-1,1] может быть описан набором из $$M\cong 5-10$$. Таким образом, в рассматриваемом случае сеть будет иметь умеренные размеры (например 50 - ... - 5) и 3 пары в обучающем наборе.
В методе Уехары и Фуджицы вместо разбиения равномерной сеткой области, покрывающей носители всех функций принадлежности, равномерно разбивается область изменения этих функций [0,1]. Здесь видна явная аналогия с переходом от интегрирования по Риману к интегралу Лебега. Остальные действия аналогичны уже описанным.
В лекции, посвященной извлечению знаний из обученных нейронных сетей, мы познакомились с методами интерпретации отображения сетью
входной информации в выходную с помощью правил типа неравенств, правил m-of-n и других. В теории нечетких множеств соответствующие
нечеткие правила уже изначально имеют наглядный смысл. Например, $$\Re$$: если разрыв между бедными и богатыми высок, то уровень преступности повышен.
Конечно заманчиво иметь возможность получения не только качественного, но и количественного правила, связывающего уровень разрыва в доходах с преступностью. Мы знаем, что нейронные сети типа персептрона являются универсальными аппроксиматорами и могут реализовать любое количественное отображение. Хорошо бы поэтому построить нейронную сеть так, чтобы она, во-первых, воспроизводила указанное нечеткое качественное правило (чтобы изначально знать интерпретацию работы сети) и, во-вторых, давала хорошие количественные предсказания для соответствующего параметра (уровня преступности). Очевидно, что добиться этого можно подбором соответствующих функций принадлежности. А именно, задача состоит в том, чтобы так определить понятия "высокий разрыв в доходах" и "повышенный уровень преступности", чтобы выполнялись и качественные и количественные соотношения. Нужно, чтобы и сами эти определения не оказалось дикими - иначе придется усомниться в используемом нами нечетком правиле. Если такая задача успешно решается, то это означает успешный симбиоз теории нечетких множеств и нейронных сетей, в которых "играют" наглядность первых и универсальность последних.
Рассмотрим соответствующую методику на следующем примере.Обозначим $$x_1$$ - курс доллара США ($) по отношению к немецкой марке (DM); $$x_2$$ - курс доллара США ($) по отношению к шведской кроне (SK); $$x_3$$ - курс доллара США ($) по отношению к финской марке (FM); Предположим, что мы имеем три нечетких правила
$$\Re_1$$:если $ слаб по отношению к DM и слаб по отношению к SK и слаб по отношению к FM, то величина портфеля очень высока
$$\Re_2$$: если $ силен по отношению к DM и силен по отношению к SK и слаб по отношению к FM, то величина портфеля высока
$$\Re_3$$: если $ силен по отношению к DM и силен по отношению к SK и силен по отношению к FM, то величина портфеля мала
Формально, эти правила можно записать следующим образом $$\Re_1$$: если $$x_1$$ есть $$L_1$$ и $$x_2$$ есть $$L_2$$ и $$x_3$$ есть $$L_3,$$ то PV есть VB $$\Re_2$$: если $$x_1$$ есть $$H_1$$ и $$x_2$$ есть $$H_2$$ и $$x_3$$ есть $$L_3,$$ то PV есть B $$\Re_3$$: если $$x_1$$ есть $$H_1$$ и $$x_2$$ есть $$H_2$$ и $$x_3$$ есть $$H_3,$$ то PV есть S Для всех нечетких правил $$L_i$$ и $$H_i$$ используем сигмоидные функции принадлежности$$L_i(t)=\frac{1}{1+e^{\gamma_i (t-\vartheta_i)}},$$ $$H_i(t)=\frac{1}{1+e^{-\gamma_i (t-\vartheta_i)}},$$ $$L_i(t)+H_i(t).$$ Для нечетких оценок величины портфеля вводятся следующие функции принадлежности$$S(t)=\frac{1}{1+e^{\gamma(t-\vartheta)}},$$ $$B(t)=\frac{1}{1+e^{-\gamma(t-\vartheta)}},$$ $$S(t)+B(t)=1,$$ $$VS(t)=\frac{1}{1+e^{\gamma(t-\vartheta-\xi)}},$$ $$VB(t)=\frac{1}{1+e^{-\gamma(t-\vartheta-\xi)}}.$$
Предположим, что точные количественные значения курса доллара по отношению к немецкой марке, шведской кроне и финской марке равны $$a_1,a_2,a_3$$, соответственно. Поскольку любые значения этих курсов являются в какой-то мере слабыми и в какой-то мере сильными (а соответствующие меры определяются функциями принадлежности), то все три правила вступают в игру. В этом случае можно определить уровень активации каждого из них:$$\alpha_1=\min(L_1(a_1),L_2(a_2),L_3(a_3))$$ $$\alpha_2=\min(H_1(a_1),H_2(a_2),L_3(a_3))$$ $$\alpha_3=\min(H_1(a_1),H_2(a_2),H_3(a_3))$$
Теперь можно вычислить и количественные оценки величины портфеля, даваемые каждым из наших правил,$$z_1=VB^{-1}(\alpha_1)=\vartheta+\xi+\frac{1}{\gamma}\ln\frac{1-\alpha_1}{\alpha_1}$$ $$z_2=B^{-1}(\alpha_2)=\vartheta+\frac{1}{\gamma}\ln\frac{1-\alpha_2}{\alpha_2}$$ $$z_3=S^{-1}(\alpha_3)=\vartheta-\frac{1}{\gamma}\ln\frac{1-\alpha_3}{\alpha_3}$$
Оценка величины портфеля получается усреднением вышеприведенных оценок по уровням активации каждого из правил$$z_0=\frac{a_1z_1+a_2z_2+a_3z_3}{\alpha_1+\alpha_2+\alpha_3}$$
Ниже на рисунке приведена архитектура нейронной сети, эквивалентной описанной выше нечеткой системе ( рис 11.4(рис 11.4) Нейронная сеть (нечеткий персептрон), входами которой являются лингвистические переменные, выходом - четкое значение величины портфеля. Скрытые слои в нечетком персептроне называются слоями правил
Значения выходов в узлах первого слоя отражают степень соответствия входных значений лингвистическим переменным, связанными с этими узлами. Элементы второго слоя вычисляют значения уровней активации соответствующих нечетких правил. Выходные значения нейронов третьего слоя соответствуют нормированным значениям этих уровней активации $$c_{i}=\alpha_{i}/\sum_{i=1}^3\alpha_i$$ Выходные значения нейронов четвертого слоя вычисляются как произведения нормированных значений уровней активации правил на значения величины портфеля, соответствующего данной их (ненормированной)активации.
$$c_1 z_1=c_1VB^{-1}(\alpha_1), c_2z_2=c_2B^{-1}(\alpha_2), c_3z_3=c_3S^{-1}(\alpha_3)$$Наконец, единственный выходной нейрон (слой 5) просто суммирует воздействия нейронов предыдущего слоя.
Если мы имеем набор обучающих пар, содержащих точные значения курсов обмена $$x_k$$ и точные значения величины портфеля: $$y_k:\{(x_1,y_1),\ldots ,(x_k,y_k)\}$$, то
определив ошибку сети для k-й обучающей пары обычным образом, как $$E_k=\frac{1}{2}(y_k-o_k)^2$$ ( $$o_k$$ - реальное значение состояния выходного нейрона), можно
использовать метод
Аналогичным образом выводятся уравнения коррекции для параметров, управляющих формой функций принадлежности нечетких понятий слабый $$L_i$$ и сильный $$H_i$$ курс доллара: $$\beta_i,\theta_i,i=1,2,3$$. Легко заметить, что особенность описанного нами совместного использования нейросетевого и нечеткого подходов заключается в том, что адаптируются не величины связей между нейронами, а формы нелинейного преобразования, осуществляемого нейронами (формы функции принадлежности). С нейрокомпьютерной точки зрения достоинства нечетких моделей как раз и связаны с нелинейностью функции принадлежности. Фиксирование и изначальное задание архитектуры сети позволяет интерпретировать ее решения. И что особенно важно, описанный подход по сути позволяет инкорпорировать априорные знания в структуру нейронной сети.
Данная тема заслуживает не одной книги и ей действительно посвящена обширнейшая литература. В настоящем курсе лекций мы не можем
хоть сколько-нибудь подробно остановится на ней. Рассмотрим кратко лишь применение соответствующих идей к анализу
Стохастический нейрон, как и в оригинальной модели Хопфилда, является бинарным - его состояние $$s_i$$ принимает значения $$\pm1$$. Однако то,
в какое состояние перейдет нейрон, связано со значением потенциала $$h_i$$ не однозначно, а случайным образом. Именно,
Поскольку динамика состояний стохастических нейронов является вероятностной, можно интересоваться только средней активностью, или же ожидаемыми значениями их состояний$$\langle s_i\rangle=(+1)\langle f(h_i)\rangle+(-1)\langle f(-h_i)\rangle$$
В силу нелинейности функции Ферми усреднение ее затруднительно, но в приближении среднего поля $$\langle f(h)\rangle\cong f(\langle h\rangle)$$ можно получить следующую замкнутую систему уравнений.
$$\langle s_i\rangle\frac{1-e^{-2\beta\langle h_i\rangle}}{1+e^{-2\beta\langle h_i\rangle}}=tanh (\beta\langle h_i\rangle)=tanh(\beta\sum_jw_{ij}\langle s_i\rangle)$$На простом примере можно убедиться, что свойства сети критическим образом зависят от температуры $$\beta^1.$$ Действительно, если величины всех синаптических связей положительны и равны между собой: $$\forall w_{ij}=N^{-1}$$ (такая система эквивалентна ферромагнетику), то все уравнения системы сводятся к одному$$\forall \langle s_i\rangle=\langle s\rangle=tanh(\beta\langle s\rangle).$$
Решение этого уравнения зависит от крутизны наклона функции гиперболического тангенса в начале координат (см.
рисунок 11.5). При высокой температуре $$T>1, \beta<1$$ уравнение имеет только тривиальное решение $$s_i=0$$. Это означает,
что состояния всех нейронов беспорядочно флуктуируют, принимая с равной вероятностью значения $$\pm 1$$.
(рис 11.5) Иллюстрация к характеру решений уравнения среднего поля в приближении высокой и низкой температур
Однако, при снижении температуры ниже точки Кюри $$T_c=1$$ в системе происходит фазовый переход, при котором тривиальное решение становится неустойчивым, а у уравнения среднего поля появляется еще два устойчивых нетривиальных решения $$\pmS_0$$.
Такое поведение характерно и для общего случая. Мы увидим далее, что в модели Хопфилда свойства ассоциативного запоминания и вызова образов проявляются в некоторой области температуры и дополнительного параметра - степени загрузки памяти. Вне этой области система переходит в неупорядоченное состояние.
Рассмотрим интересующий нас случай сети, в которой связи вычислены по Хеббовскому правилу, исходя из вида запоминаемых векторов. В этом случае уравнения среднего поля принимают вид$$\langle s_i\rangle=\\tanh\left(\frac{\beta}{N}\sum_{n,j}\sigma_n^n\sigma_j^n\langle s_j\rangle\right).$$
Если сеть работает как ассоциативная память, то разумно предположить, что каждому запоминаемому вектору $$\sigma^k$$ должно соответствовать некоторое решение системы, совпадающего с ним с точностью до постоянного множителя$$\langle si\rangle=m\sigma^k.$$
Подставляя это выражение в уравнения среднего поля и используя предположение, что все векторы памяти не коррелированы и значения их компонент с равной вероятностью принимают значения, получим:$$m\sigma^k_i=\\tanh\left[\beta m \sigma_i^k + \beta m N^{-1}\sum_{n\neq k}\sigma_i^n\sum_j \sigma_j^n\sigma_j^k\right] =tanh\left[\beta m \sigma_i^k+\beta m O\left(\right\sqrt{\frac{P-1}{N}})\right]$$
В пределе $$N-> \infty$$, $$P\ll N$$ получаем знакомое уравнение для множителя m:$$m=tanh(\beta m).$$
Вновь при высокой температуре $$(T>1)$$ это уравнение имеет только тривиальное решение и усредненная по времени конфигурация состояний
нейронов не имеет ничего общего с запоминаемыми образами. При $$(T<1)$$ уравнение имеет два решения $$m=\pm m_0$$, для которых средняя конфигурация
активностей указывает на одно из запоминаемых состояний $$\sigma^k$$, или на его "зеркального двойника" - $$\sigma^k$$. Из этих состояний однозначно
восстанавливаются образы памяти. Однако, если сделать моментальный снимок состояния сети, то в силу флуктуаций она практически никогда
не находится ни в одном из состояний памяти, всегда воспроизводя их с некоторой ошибкой. Теоретически было показано, что загрузка
памяти, $$\alpha=P/N,$$ оказывает на поведение системы такое же влияние, как температурный параметр в распределении Ферми. Когда этот параметр мал,
каждому из запоминаемых некоррелированных образов соответствует стационарное состояние сети. Однако, при приближении его к критической
емкости $$\alpha\cong 0.138$$, сеть внезапно теряет все свойства памяти. В плоскости координат $$(\alpha,T)$$ области памяти и неупорядоченного поведения
сети разделены границей, при пересечении которой происходит соответствующий фазовый переход. Более детальный анализ
выявляет на фазовой диаграмме следующие 4 области: парамагнитную (P) фазу, в которой любой порядок разрушается высокой температурой;
фазу спинового стекла (SG), в которой состояние сети не может эволюционировать к запомненным образам; смешанную (F+SG) - в ней
запомненные образы метастабильны; и ферромагнитную (F) - в ней всем запоминаемым образам соответствуют глобальные минимумы энергии.
(рис 11.6) Упрощенная и детальная диаграммы фазовых состояний сети Хопфилда
Наличие тепловых флуктуаций снижает вероятность попадания сети в состояние ложных минимумов. Критическая температура, при которых множество таких минимумов становится неустойчивыми, равна $$T_3\approx 0.46$$. Таким образом тепловой шум улучшает свойства памяти и наиболее благоприятным температурным интервалом работы сети является $$T_3<T<T_c$$.
Животные делятся на:
принадлежащих Императору, набальзамированных, прирученных, сосунков, сирен, сказочных, отдельных собак, включенных в эту классификацию, бегающих, как сумасшедшие, бесчисленных, нарисованных тончайшей кистью из верблюжьей шерсти, прочих, разбивших цветочную вазу, издали напоминающих мух.
Нейрокомпьютинг имеет многочисленные точки соприкосновения с другими дисциплинами и их методами. В частности, теория нейронных сетей использует аппарат статистической механики и теории оптимизации. Области приложения нейрокомпьютинга подчас сильно пересекаются или почти совпадают со сферами применения математической статистики, теории нечетких множеств и экспертных систем. Связи и параллели нейрокомпьютинга чрезвычайно многообразны и свидетельствуют о его универсальности. В данной лекции, которую можно рассматривать как дополнительную, так как она требует несколько большей математической подготовки, мы поговорим только о наиболее важных из них.
Поскольку в настоящее время нейронные сети с успехом используются для анализа данных, уместно сопоставить их со старыми хорошо
разработанными статистическими методами. В литературе по статистике иногда можно встретить утверждение, что наиболее часто применяемые
нейросетевые подходы являются ни чем иным, как неэффективными регрессионными и дискриминантными моделями. Мы уже отмечали прежде, что
Как уже отмечалось, некоторые статистики утверждают, что нейросетевые подходы к обработке данных являются просто заново переоткрытыми и переформулированными, но хорошо известными статистическими методами анализа. Иными словами, нейрокомпьютинг просто пользуется новым языком для описания старого знания. В качестве примера приведем цитату из Уоррена Сэрла:
Многие исследователи нейронных сетей являются инженерами, физиками, нейрофизиологами, психологами или специалистами по компьютерам, которые мало знают о статистике и нелинейной оптимизации. Исследователи нейронных сетей постоянно переоткрывают методы, которые известны в математической и статистической литературе десятилетиями и столетиями, но часто оказываются неспособными понять как работают эти методы
Подобная точка зрения, на первый взгляд, может показаться обоснованной. Формализм нейронных сетей действительно способен претендовать на роль универсального языка. Не случайно уже в пионерской работе МакКаллока и Питтса было показано, что нейросетевое описание эквивалентно описанию логики высказываний.
Я в действительности обнаружил, что с помощью техники, которую я разработал в работе1961 года (…), я мог бы легко ответить на все вопросы, которые мне задают специалисты по мозгу (...) или компьютерщики. Как физик, однако, я хорошо знал, что теория, которая объясняет все, на самом деле не объясняет ничего: в лучшем случае она является языком. Эдуардо Каянелло
Не удивительно поэтому, что статистики часто обнаруживают, что привычные им понятия имеют свои аналоги в теории нейронных сетей. Уоррен Сэрл составил небольшой словарик терминов, использующихся в этих двух областях.
| Нейронные сети | Статистические методы. |
|---|---|
| Признаки | переменные |
| входы | независимые переменные |
| выходы | предсказанные значения |
| целевые значения | зависимые переменные |
| ошибка | невязка |
| обучение, адаптация, самоорганизация | оценка |
| функция ошибки, функция Ляпунова | критерий оценки |
| обучающие образы (пары) | наблюдения |
| параметры сети: веса, пороги. | Оценочные параметры |
| нейроны высокого порядка | взаимодействия |
| функциональные связи | трансформации |
| обучение с учителем или гетероассоциация | регрессия и дискриминантный анализ |
| обучение без учителя или автоассоциация | сжатие данных |
| соревновательное обучение, адаптивная векторная квантизация | кластерный анализ |
| обобщение | интерполяция и экстраполяция |
В чем же заключается сходство и различие языков нейрокомпьютинга и статистики в анализе данных. Рассмотрим простейший пример.
Предположим, что мы провели наблюдения и экспериментально измерили N пар точек, представляющих функциональную зависимость $$y(x): \{(x_1,y_1),\ldots ,(x_N,y_N)\}$$. Если попытаться провести через эти точки наилучшую прямую, что на языке статистики будет означать использование для описания неизвестной зависимости линейной модели $$y=ax+b+\varepsilon$$, (где $$\varepsilon$$ обозначает шум при проведении наблюдения), то решение соответствующей проблемы линейной регрессии сведется к нахождению оценочных значений параметров $$\mbox{\~a}$$, $$\mbox{\~b}$$ минимизирующих сумму квадратичных невязок.$$\sum_{k=1}^N[y_k-(ax_k+b)]^2.$$
Если параметры $$\mbox{\~a}$$ и $$\mbox{\~b}$$ найдены, то можно оценить значение y для любого значения x, то есть осуществить интерполяцию и экстраполяцию данных.
Та же самая задача может быть решена с использованием
(рис 11.1) Линейная регрессия и реализующий ее однослойный персептронПри сравнении этих двух подходов сразу бросается в глаза то, что при описании своих методов статистика апеллирует к формулам и уравнениям, а нейрокомпьютинг к графическому описанию нейронных архитектур.
Еще одним существенным различием является то, что для методов статистики не имеет значения, каким образом будет минимизироваться
невязка - в любом случае модель остается той же самой, в то время как для нейрокомпьютинга главную роль играет именно метод обучения.
Иными словами, в отличие от нейросетевого подхода, оценка параметров модели для статистических методов не зависит от
В отличие от нейросетевого подхода, в котором основное время забирает обучение сетей, при статистическом подходе это время тратится на тщательный анализ задачи. При этом опыт статистиков используется для выбора модели на основе анализа данных и информации, специфичной для данной области. Использование нейронных сетей - этих универсальных аппроксиматоров - обычно проводится без использования априорных знаний, хотя в ряде случаев оно весьма полезно. Например, для рассматриваемой линейной модели использование именно среднеквадратичной ошибки ведет к получению оптимальной оценки ее параметров, когда величина шума имеет нормальное распределение с одинаковой дисперсией для всех обучающих пар. В то же время если известно, что эти дисперсии различны, то использование взвешенной функции ошибки$$\sum_{k=1}^Nc_k[y_k-(ax_k+b)]^2$$ может дать значительно лучшие значения параметров.
Помимо рассмотренной простейшей модели можно привести примеры других в некотором смысле эквивалентных моделей статистики и нейросетевых парадигм
| Нейронные сети | Статистические методы |
|---|---|
| Многослойный персептрон | Нелинейная (в т.ч. логистическая) регрессия, Дискриминантные модели |
| Автоассоциативный персептрон | Анализ главных компонент |
| Векторная квантизация | Кластеризация с k-средними |
| Сети нейронов высоких порядков | Полиномиальная регрессия |
Логистическая регрессия является методом
Лучшим ответом на этот сугубо практический для прикладника вопрос является "It depends". По-русски это означает "Все зависит от ситуации". Иногда, особенно если априорная информация о данных отсутствует, разумнее использовать нейронные сети. Такой выбор часто дает быстрое и качественное решение задачи, как правило не худшее, чем получаемое статистическими методами после тщательного изучения структуры данных.
При наличии дополнительных знаний о характере задачи статистические данные могут оказаться предпочтительнее. При сравнительном анализе возможностей нейронных сетей и статистических методов надо быть достаточно осторожными, поскольку иногда весьма сложные нейросетевые подходы сопоставляются с простыми статистическими моделями или наоборот. Существует мнение, что одинаково мощные статистические и нейросетевые подходы дают результаты одинаковые по точности и по затратам. Тем не менее, примеры решения действительно важных прикладных задач могут дать представление о возможностях того или иного подхода.
Дэвид Эшби и Нед Кумар из Школы Бизнеса в Арканзасе сравнили результаты применения нейросетевой технологии и классического
дискриминантного анализа к предсказанию невыполнения обязательств по высокодоходным облигациям ("
Среди так или иначе конкурирующих методологий (а нейронные сети и статистика имеют общую часть "электората" - анализ данных) как правило побеждает не более обоснованная и надежная, а та, что ставит новые задачи для исследования (Имре Лакатош). Нейрокомпьютинг гораздо более молодая отрасль знания нежели статистика. Он бросает многочисленные вызовы специалистам различных профессий: биологам, физикам, психологам, математикам и другим. Кроме того, сфера теории нейронных сетей гораздо шире анализа данных. Она включает в себя и моделирование мозга и разработку нейрокомпьютеров. Статистики не могут претендовать на соревнование в этих областях и ревностно следят за претензиями нейрокомпьютинга на их экологическую нишу.
Конструктивный взгляд на взаимоотношение нейронных сетей и статистических методов заключается в том, что в общем случае они должны помогать друг другу и обогащать друг друга. Кристоф и Пьер Кувре назвали такой процесс перекрестным опылением.
Джон Такер провел тщательное сравнительное исследование использования логистической регрессии и нейронных сетей и определил следующее
их принципиальное различие, которое сохраняет свое значение и при общем сопоставления статистики и нейрокомпьютинга. В то время как
статистические методы фокусируются на оптимальном методе выбора переменных, нейрокомпьютинг ставит во главу угла предобработку этих
переменных. Если нейронная сеть представляет собой многослойный персептрон, то функцией скрытых слоев и является такая последовательная
предобработка данных. Вследствие этого нейронные сети занимают уникальное место среди методов обработки данных, превосходя их в
универсальности и сложности, оставаясь при этом
Главный практический вывод, который может сделать читатель, сводится к фразе, уже ставшей афоризмом:
Если ничего не помогает, попробуйте нейронные сети.
Рассмотрим теперь отношения нейрокомпьютинга и экспертных систем. Обе эти технологии иногда относят к направлению Искусственный Интеллект, хотя строго говоря, термин искусственный интеллект появился в 70-е годы в связи с экспертными системами, как направления альтернативного нейронным сетям.
Его основатели - Марвин Минский и Эдвард Фейгенбаум посчитали излишней апелляцию к архитектуре мозга, его нейронным структурам, и
декларировали необходимость моделирования работы человека со знаниями. Тем самым, поставив в центр внимания операции с
формально-логическими языковыми структурами, они заведомо выбрали ориентацию на имитацию обработки информации левым полушарием мозга
человека. Системы обработки таких формализованных знаний были названы экспертными, поскольку они должны были воспроизводить ход
логических рассуждений эксперта (высокопрофессионального специалиста) в конкретной предметной области. Эти рассуждения проводятся с
использованием правил вывода, которые
Заметим, что в настоящее время распространено более широкое толкование систем искусственного интеллекта. К ним относят не только
экспертные , но и нечеткие системы, нейронные сети и всевозможные комбинации, такие как
Однако, экспертные системы претендовали именно на решение важных прикладных задач прежде всего в таких областях, как медицина и геология. При этом соответствующая технология в сочетании с нечеткими системами была в 1978 году положена японцами в основу программы создания компьютеров 5-го поколения.
Сопоставление экспертных систем и нейрокомпьютинга выявляет различия, многие из которых характерны для уже отмечавшихся в первой лекции различий обычных компьютеров (а экспертные системы реализуются именно на традиционных машинах, главным образом на языке ЛИСП и Пролог) и нейрокомпьютеров
| Нейронные сети | Экспертные системы | |
|---|---|---|
| Аналогия | правое полушарие | левое полушарие |
| Объект | данные | знания |
| Вывод | отображение сетью | правила вывода |
Важным преимуществом нейронных сетей является то, что разработка экспертных систем, основанных на правилах требует 12-18 месяцев, а нейросетевых - от нескольких недель до месяцев.
Рассматривая извлечение знаний из обученных нейронных сетей мы уже показали, что представление о них, как о черных ящиках, не способных объяснить полученное решение (это представление иногда рассматривается как аргумент в пользу преимущества экспертных систем перед нейросетями), неверно. В то же время, очевидно, что как и в случае мозга, в котором левое и правое полушарие действуют сообща, естественно и объединение экспертных систем с искусственными нейронными сетями. Подобные синтетические системы могут быть названы нейронными экспертными системами - этот термин использовал Иржи Шима, указавший на необходимость интеграции достоинств обоих типов систем. Такая интеграция может осуществляться двояким образом. Если известна только часть правил, то можно либо инициализировать веса нейронной сети исходя из явных правил, либо инкорпорировать правила в уже обученные нейронные сети. Шима предложил использовать и чисто коннекционистский методику построения нейронных эксперных систем, которая обладает таким достоинством, как возможность работы с неполными данными (ситуация типичная для реальных баз данных). Такой возможностью обладают введенные им сети интервальных нейронов.
Ситуация, в которой некоторые данные не известны или не точны, встречается достаточно часто. Например, при оценке возможностей той или иной фирмы, можно учитывать ее официально декларируемый капитал, скажем в 100 миллионов, но лучше всего считать, что в действительности его величина является несколько большей и меняется в интервале от 100 до 300 млн. Удобно ввести в данном случае специальные нейроны, состояния которых кодируют не бинарные или непрерывные значения, а интервалы значений. В случае, если нижняя и верхняя граница интервала совпадают, то состояния таких нейронов становятся аналогичными состояниям обычных нейронов.
Для интервального нейрона $$i$$ на каждый его вход $$j$$ подается не одно $$\langle a_j,b_j \rangle$$, а пара значений, определяющая границы интервала, в котором лежит величина воздействия $$j$$ -го нейрона. Воздействие, оказываемое на $$i$$ -й нейрон со стороны всех связанных с ним нейронов само лежит в интервале $$\langle x_i,y_i\rangle$$, где$$x_i=\sum_jw_{ij}\left(\frac{a_j}{1-e^{-\beta_{i}w_{ij}}}+\frac{b_j}{1-e^{\beta_{i}w_{ij}}}\right),$$ $$y_i=\sum_jw_{ij}\left(\frac{a_j}{1-e^{-\beta_{i}w_{ij}}}+\frac{b_j}{1-e^{\beta_{i}w_{ij}}}\right),$$ $$\beta_i$$ - обратная температура.
Интервальное значение, которое принимает $$i$$ -й нейрон при данном воздействии, равно$$\langle a_i,bi \rangle=\langle S_i (x_i),S_i(y_i)\rangle$$ где$$S_i(x)=\frac{1-e^{-\beta_{i}x}}{1+e^{-\beta_{i}x}}.$$
Передаточная функция интервального нейрона приблизительно отражает идею монотонности по отношению к операции интервального включения. Это означает, что при $$\beta \rightarrow\infty $$, если вход $$j$$ -го нейрона лежит в интервале $$\langle a_j,b_j\rangle$$, то выход $$i$$ - го нейрона, определенный по классической функции Ферми, обязательно попадет в интервал $$\langle a_j,b_j\rangle$$. Интервальные нейроны могут являться элементами многослойных персептронов. В этом случае их состояния вычисляются последовательно, начиная от входного слоя к выходному. Для сетей интервальных нейронов может быть построено обобщение метода обратного распространения ошибки, описание которого выходит за рамки нашего курса.
Системы нечеткой логики (
Хотя нечеткая логика может явно использоваться для представления знаний эксперта с помощью правил для
Кроме них имеются также нечеткие нейронные системы. Так называются нейронные сети, использующие методы нечеткости для ускорения обучения и улучшения своих характеристик. Это может достигаться, например, использованием нечетких правил для изменения темпа обучения или же рассмотрением нейронных сетей с нечеткими значениями входов.
| Предыдущий градиент $$\rightarrow$$ | Текущий градиент | ||||
|---|---|---|---|---|---|
| NB | NS | Z | PS | PB | |
| NB | PB | PS | Z | NS | NB |
| NS | NS | PS | Z | NS | NB |
| Z | NB | NS | Z | NS | NB |
| PS | NB | NS | Z | PS | NS |
| PB | NB | NS | Z | PS | PB |
Лингвистические переменные Темп Обучения и Градиент принимают в иллюстрируемом таблицей нечетком правиле адаптации следующие значения: NB - большой отрицательный; NS - малый отрицательный; Z - близок к нулю; PS - малый положительный; PB - большой положительный.
Наконец, в современных гибридных нейронных нечетких системах нейронные сети и нечеткие модели комбинируются в единую гомогенную архитектуру. Такие системы могут интерпретироваться либо как нейронные сети с нечеткими параметрами, либо как параллельные распределенные нечеткие системы.
Центральным понятием нечеткой логики является понятие
Смысл лингвистического значения X и характеризуется выбранной мерой - так называемой функций принадлежности (membership
function) $$\mu:\rightarrow[0,1]$$, которая каждому элементу u универсального множества U ставит в соответствие значение совместимости этого элемента с X .
В нашем случае универсальным множеством является множество всех возможных величин падения производства (от 0 до 100%).
(рис 11.2) Функции принадлежности лингвистической переменной Падение производства
Нечеткое правило связывает значения
Если (падение производства - катастрофическое), то (доходы от экспорта энергоресурсов - значительные).
Нечеткое подмножество универсального множества U характеризуется функцией принадлежности $$mu_A:U\rightarrow[0,1]$$, которая ставит в соответствие каждому элементу $$u\in U$$ число $$\mu_A(u)$$ из интервала [0, 1], характеризующее степень принадлежности элемента u подмножеству A.
Носителем множества A называется множество таких точек в U, для которых величина $$\mu_A(u)$$ положительна.
Преобразование, осуществляемое типичным нейроном с двумя входами, имеет вид $$y=f(w_1x_1+w_2x_2)$$, где $$f(\cdot)$$ -сигмоидная функция. Для того, чтобы обобщить его, нужно представить себе, что вес нейрона не обязательно должен умножаться на значение соответственного входа, а здесь может быть применена какая-либо другая операция. Далее, суммирование воздействий также может быть заменено неким другим действием. Наконец, вместо сигмоидной функции потенциал нейрона может быть преобразован каким-либо новым способом. В нечеткой логике операция умножения заменяется для булевых переменных операцией И, а для числовых - операцией взятия минимума (min). Операция суммирования заменяется соответственно операциями ИЛИ и взятием максимума (max).
Если осуществить соответствующие замены в преобразовании, осуществляемом знакомым нам нейроном, и положить в нем $$f(z)=z$$ (линейный выход), то мы получим так называемый нечеткий ИЛИ-нейрон:$$y=\max\{\min(w_1,x_1)\min(w_2,x_2)\}.$$
Для нечетких нейронов полагается, что значения входов и весов заключены в интервале [0, 1], поэтому и выход нейрона ИЛИ будет принадлежать этому же интервалу.
Используя противоположную подстановку (умножение max), (сложение min ) получим преобразование, характерное для нечеткого И-нейрона:$$y=\min\{\max(w_1,x_1)\max(w_2,x_2)\}$$
В лекции, посвященной извлечению знаний, мы уже познакомились с нейросетевыми методами извлечения правил из данных. Настало время узнать, как можно извлечь с их помощью нечеткие правила.
Рассмотрим набор нечетких правил$$\Re_i:$$ Если $$x$$ есть $$A_i,$$ то $$y$$ есть $$B_i$$, $$i=1,\ldots ,n$$
Каждое из них может интерпретироваться как обучающая пара для многослойного персептрона. При этом, условие (x есть $$A_i$$ ) определяет значение входа, а следствие (y есть $$B_i$$ ) - значение выхода сети. Полное обучающее множество имеет вид $$\{(A_1,B_1),\ldots ,(A_n,B_n)\}$$. Заметим, что каждому лингвистическому значению $$A_i, B_i$$ соответствует своя функция принадлежности, так что каждое нечеткое правило определяет связь двух функций.
Если же правила имеют более сложный вид, типа "два входа - один выход":$$\Re_i:$$ Если $$x$$ есть $$A_i$$ и $$y$$ есть $$B_i,$$ то $$z$$ есть $$C_i, i=1,\ldots ,n$$ то обучающая выборка принимает форму $$\{(A_i,B_i),C_i\}, i=1,\ldots ,n$$, Существует два основных подхода к реализации нечетких правил типа if-then с помощью многослойных персептронов.
В методе Умано и Изавы нечеткое множество представляется конечным числом значений совместимости. Пусть $$\alpha_1,\alpha_2$$ включает носители всех $$A_i$$, входящих в обучающую выборку а также носители всех $$A^{\prime}$$, которые могут быть входами в сети. Предположим также, что $$[\beta_1\beta_2]$$ включает носители всех $$B_j$$, входящих в обучающую выборку, а также носители всех $$B^{/prime}$$, которые могут быть входами в сети. Положим$$x_j=\alpha_1+(j-1)(\alpha_2-\alpha_1)/(N-1),j=1,\ldots ,N; N>1$$ $$y_j=\beta_1+(i-1)(\beta_2-\beta_1)/(M-1),i=1,\ldots ,M; M>1$$
Дискретный аналог обучающего множества правил (заменяющее функциональное) имеет вид:$$\{(A_i(x_1),\ldots ,A_i(x_N)),(B_i(y_1),\ldots ,B_i(y_M))\}, i=1,\ldots ,n$$
Если теперь ввести обозначения $$a_{ij}\equiv A_i(x_i), b_{ij}\equiv B_i(y_i)$$, то можно представить нечеткую нейронную сеть с $$N$$ входными и $$M$$ выходными нейронами ( рис 11.3(рис 11.3) Нечеткая нейронная сеть и треугольные функции принадлежности входных и выходных переменных
Пример 1. Предположим, что обучающая выборка включает три правила: $$\Re_1$$: Если город мал, то доход от продажи бриллиантов отрицателен, $$\Re_2$$: Если город средний, то доход от продажи бриллиантов близок к нулю, $$\Re_3$$: Если город велик, то доход от продажи бриллиантов положителен.
Функции принадлежности определим как$$\mu_{малый}(u)=\left\{ \begin{array}{cc} 1-\frac{u}{50000} 0\leq u\leq 50000\\ 0, u>50000, \end{array}\right.$$ $$\mu_{доход<0}(u)=\left\{ \begin{array}{cc} -u, -1\leq u\leq 0\\ 0, u>0, \end{array}\right.$$ $$\mu_{средний}(u)=\left\{ \begin{array}{cc} \frac{u}{50000}, 0\leq u\leq 50000\\ \frac{300000-u}{250000} , 50000\leq u\leq 300000\\0, u>300000, \end{array}\right.$$ $$\mu_{доход=0}(u)=\left\{ \begin{array}{cc} 1-2|u|, |u|\leq0.5\\ 0, |u|>0.5, \end{array}\right.$$ $$\mu_{большой}(u)=\left\{ \begin{array}{cc} 0, u<50000\\ \frac{u-50000}{250000} , 50000\leq u\leq 300000\\1, u>300000, \end{array}\right.$$ $$\mu_{доход>0}(u)=\left\{ \begin{array}{cc} u, 0\leq u\leq 1\\ 0, u<0, \end{array}\right.$$ (Здесь предполагается, что доход не превышает 100% или 1.0 в относительных величинах)
Тогда обучающая выборка принимает форму {(малый, отрицательный), (средний, близок к нулю), (большой, положительный)}
Если носитель множества входов [0, 10 000 000], то для покрытия множества населения городов равномерной сеткой, захватывающей и малые города, понадобится несколько сот точек. Поэтому, ограничимся городами с населением 1 000 000 человек. Тогда можно выбрать $$N\cong 50-100$$. Носитель множества выходов [-1,1] может быть описан набором из $$M\cong 5-10$$. Таким образом, в рассматриваемом случае сеть будет иметь умеренные размеры (например 50 - ... - 5) и 3 пары в обучающем наборе.
В методе Уехары и Фуджицы вместо разбиения равномерной сеткой области, покрывающей носители всех функций принадлежности, равномерно разбивается область изменения этих функций [0,1]. Здесь видна явная аналогия с переходом от интегрирования по Риману к интегралу Лебега. Остальные действия аналогичны уже описанным.
В лекции, посвященной извлечению знаний из обученных нейронных сетей, мы познакомились с методами интерпретации отображения сетью
входной информации в выходную с помощью правил типа неравенств, правил m-of-n и других. В теории нечетких множеств соответствующие
нечеткие правила уже изначально имеют наглядный смысл. Например, $$\Re$$: если разрыв между бедными и богатыми высок, то уровень преступности повышен.
Конечно заманчиво иметь возможность получения не только качественного, но и количественного правила, связывающего уровень разрыва в доходах с преступностью. Мы знаем, что нейронные сети типа персептрона являются универсальными аппроксиматорами и могут реализовать любое количественное отображение. Хорошо бы поэтому построить нейронную сеть так, чтобы она, во-первых, воспроизводила указанное нечеткое качественное правило (чтобы изначально знать интерпретацию работы сети) и, во-вторых, давала хорошие количественные предсказания для соответствующего параметра (уровня преступности). Очевидно, что добиться этого можно подбором соответствующих функций принадлежности. А именно, задача состоит в том, чтобы так определить понятия "высокий разрыв в доходах" и "повышенный уровень преступности", чтобы выполнялись и качественные и количественные соотношения. Нужно, чтобы и сами эти определения не оказалось дикими - иначе придется усомниться в используемом нами нечетком правиле. Если такая задача успешно решается, то это означает успешный симбиоз теории нечетких множеств и нейронных сетей, в которых "играют" наглядность первых и универсальность последних.
Рассмотрим соответствующую методику на следующем примере.Обозначим $$x_1$$ - курс доллара США ($) по отношению к немецкой марке (DM); $$x_2$$ - курс доллара США ($) по отношению к шведской кроне (SK); $$x_3$$ - курс доллара США ($) по отношению к финской марке (FM); Предположим, что мы имеем три нечетких правила
$$\Re_1$$:если $ слаб по отношению к DM и слаб по отношению к SK и слаб по отношению к FM, то величина портфеля очень высока
$$\Re_2$$: если $ силен по отношению к DM и силен по отношению к SK и слаб по отношению к FM, то величина портфеля высока
$$\Re_3$$: если $ силен по отношению к DM и силен по отношению к SK и силен по отношению к FM, то величина портфеля мала
Формально, эти правила можно записать следующим образом $$\Re_1$$: если $$x_1$$ есть $$L_1$$ и $$x_2$$ есть $$L_2$$ и $$x_3$$ есть $$L_3,$$ то PV есть VB $$\Re_2$$: если $$x_1$$ есть $$H_1$$ и $$x_2$$ есть $$H_2$$ и $$x_3$$ есть $$L_3,$$ то PV есть B $$\Re_3$$: если $$x_1$$ есть $$H_1$$ и $$x_2$$ есть $$H_2$$ и $$x_3$$ есть $$H_3,$$ то PV есть S Для всех нечетких правил $$L_i$$ и $$H_i$$ используем сигмоидные функции принадлежности$$L_i(t)=\frac{1}{1+e^{\gamma_i (t-\vartheta_i)}},$$ $$H_i(t)=\frac{1}{1+e^{-\gamma_i (t-\vartheta_i)}},$$ $$L_i(t)+H_i(t).$$ Для нечетких оценок величины портфеля вводятся следующие функции принадлежности$$S(t)=\frac{1}{1+e^{\gamma(t-\vartheta)}},$$ $$B(t)=\frac{1}{1+e^{-\gamma(t-\vartheta)}},$$ $$S(t)+B(t)=1,$$ $$VS(t)=\frac{1}{1+e^{\gamma(t-\vartheta-\xi)}},$$ $$VB(t)=\frac{1}{1+e^{-\gamma(t-\vartheta-\xi)}}.$$
Предположим, что точные количественные значения курса доллара по отношению к немецкой марке, шведской кроне и финской марке равны $$a_1,a_2,a_3$$, соответственно. Поскольку любые значения этих курсов являются в какой-то мере слабыми и в какой-то мере сильными (а соответствующие меры определяются функциями принадлежности), то все три правила вступают в игру. В этом случае можно определить уровень активации каждого из них:$$\alpha_1=\min(L_1(a_1),L_2(a_2),L_3(a_3))$$ $$\alpha_2=\min(H_1(a_1),H_2(a_2),L_3(a_3))$$ $$\alpha_3=\min(H_1(a_1),H_2(a_2),H_3(a_3))$$
Теперь можно вычислить и количественные оценки величины портфеля, даваемые каждым из наших правил,$$z_1=VB^{-1}(\alpha_1)=\vartheta+\xi+\frac{1}{\gamma}\ln\frac{1-\alpha_1}{\alpha_1}$$ $$z_2=B^{-1}(\alpha_2)=\vartheta+\frac{1}{\gamma}\ln\frac{1-\alpha_2}{\alpha_2}$$ $$z_3=S^{-1}(\alpha_3)=\vartheta-\frac{1}{\gamma}\ln\frac{1-\alpha_3}{\alpha_3}$$
Оценка величины портфеля получается усреднением вышеприведенных оценок по уровням активации каждого из правил$$z_0=\frac{a_1z_1+a_2z_2+a_3z_3}{\alpha_1+\alpha_2+\alpha_3}$$
Ниже на рисунке приведена архитектура нейронной сети, эквивалентной описанной выше нечеткой системе ( рис 11.4(рис 11.4) Нейронная сеть (нечеткий персептрон), входами которой являются лингвистические переменные, выходом - четкое значение величины портфеля. Скрытые слои в нечетком персептроне называются слоями правил
Значения выходов в узлах первого слоя отражают степень соответствия входных значений лингвистическим переменным, связанными с этими узлами. Элементы второго слоя вычисляют значения уровней активации соответствующих нечетких правил. Выходные значения нейронов третьего слоя соответствуют нормированным значениям этих уровней активации $$c_{i}=\alpha_{i}/\sum_{i=1}^3\alpha_i$$ Выходные значения нейронов четвертого слоя вычисляются как произведения нормированных значений уровней активации правил на значения величины портфеля, соответствующего данной их (ненормированной)активации.
$$c_1 z_1=c_1VB^{-1}(\alpha_1), c_2z_2=c_2B^{-1}(\alpha_2), c_3z_3=c_3S^{-1}(\alpha_3)$$Наконец, единственный выходной нейрон (слой 5) просто суммирует воздействия нейронов предыдущего слоя.
Если мы имеем набор обучающих пар, содержащих точные значения курсов обмена $$x_k$$ и точные значения величины портфеля: $$y_k:\{(x_1,y_1),\ldots ,(x_k,y_k)\}$$, то
определив ошибку сети для k-й обучающей пары обычным образом, как $$E_k=\frac{1}{2}(y_k-o_k)^2$$ ( $$o_k$$ - реальное значение состояния выходного нейрона), можно
использовать метод
Аналогичным образом выводятся уравнения коррекции для параметров, управляющих формой функций принадлежности нечетких понятий слабый $$L_i$$ и сильный $$H_i$$ курс доллара: $$\beta_i,\theta_i,i=1,2,3$$. Легко заметить, что особенность описанного нами совместного использования нейросетевого и нечеткого подходов заключается в том, что адаптируются не величины связей между нейронами, а формы нелинейного преобразования, осуществляемого нейронами (формы функции принадлежности). С нейрокомпьютерной точки зрения достоинства нечетких моделей как раз и связаны с нелинейностью функции принадлежности. Фиксирование и изначальное задание архитектуры сети позволяет интерпретировать ее решения. И что особенно важно, описанный подход по сути позволяет инкорпорировать априорные знания в структуру нейронной сети.
Данная тема заслуживает не одной книги и ей действительно посвящена обширнейшая литература. В настоящем курсе лекций мы не можем
хоть сколько-нибудь подробно остановится на ней. Рассмотрим кратко лишь применение соответствующих идей к анализу
Стохастический нейрон, как и в оригинальной модели Хопфилда, является бинарным - его состояние $$s_i$$ принимает значения $$\pm1$$. Однако то,
в какое состояние перейдет нейрон, связано со значением потенциала $$h_i$$ не однозначно, а случайным образом. Именно,
Поскольку динамика состояний стохастических нейронов является вероятностной, можно интересоваться только средней активностью, или же ожидаемыми значениями их состояний$$\langle s_i\rangle=(+1)\langle f(h_i)\rangle+(-1)\langle f(-h_i)\rangle$$
В силу нелинейности функции Ферми усреднение ее затруднительно, но в приближении среднего поля $$\langle f(h)\rangle\cong f(\langle h\rangle)$$ можно получить следующую замкнутую систему уравнений.
$$\langle s_i\rangle\frac{1-e^{-2\beta\langle h_i\rangle}}{1+e^{-2\beta\langle h_i\rangle}}=tanh (\beta\langle h_i\rangle)=tanh(\beta\sum_jw_{ij}\langle s_i\rangle)$$На простом примере можно убедиться, что свойства сети критическим образом зависят от температуры $$\beta^1.$$ Действительно, если величины всех синаптических связей положительны и равны между собой: $$\forall w_{ij}=N^{-1}$$ (такая система эквивалентна ферромагнетику), то все уравнения системы сводятся к одному$$\forall \langle s_i\rangle=\langle s\rangle=tanh(\beta\langle s\rangle).$$
Решение этого уравнения зависит от крутизны наклона функции гиперболического тангенса в начале координат (см.
рисунок 11.5). При высокой температуре $$T>1, \beta<1$$ уравнение имеет только тривиальное решение $$s_i=0$$. Это означает,
что состояния всех нейронов беспорядочно флуктуируют, принимая с равной вероятностью значения $$\pm 1$$.
(рис 11.5) Иллюстрация к характеру решений уравнения среднего поля в приближении высокой и низкой температур
Однако, при снижении температуры ниже точки Кюри $$T_c=1$$ в системе происходит фазовый переход, при котором тривиальное решение становится неустойчивым, а у уравнения среднего поля появляется еще два устойчивых нетривиальных решения $$\pmS_0$$.
Такое поведение характерно и для общего случая. Мы увидим далее, что в модели Хопфилда свойства ассоциативного запоминания и вызова образов проявляются в некоторой области температуры и дополнительного параметра - степени загрузки памяти. Вне этой области система переходит в неупорядоченное состояние.
Рассмотрим интересующий нас случай сети, в которой связи вычислены по Хеббовскому правилу, исходя из вида запоминаемых векторов. В этом случае уравнения среднего поля принимают вид$$\langle s_i\rangle=\\tanh\left(\frac{\beta}{N}\sum_{n,j}\sigma_n^n\sigma_j^n\langle s_j\rangle\right).$$
Если сеть работает как ассоциативная память, то разумно предположить, что каждому запоминаемому вектору $$\sigma^k$$ должно соответствовать некоторое решение системы, совпадающего с ним с точностью до постоянного множителя$$\langle si\rangle=m\sigma^k.$$
Подставляя это выражение в уравнения среднего поля и используя предположение, что все векторы памяти не коррелированы и значения их компонент с равной вероятностью принимают значения, получим:$$m\sigma^k_i=\\tanh\left[\beta m \sigma_i^k + \beta m N^{-1}\sum_{n\neq k}\sigma_i^n\sum_j \sigma_j^n\sigma_j^k\right] =tanh\left[\beta m \sigma_i^k+\beta m O\left(\right\sqrt{\frac{P-1}{N}})\right]$$
В пределе $$N-> \infty$$, $$P\ll N$$ получаем знакомое уравнение для множителя m:$$m=tanh(\beta m).$$
Вновь при высокой температуре $$(T>1)$$ это уравнение имеет только тривиальное решение и усредненная по времени конфигурация состояний
нейронов не имеет ничего общего с запоминаемыми образами. При $$(T<1)$$ уравнение имеет два решения $$m=\pm m_0$$, для которых средняя конфигурация
активностей указывает на одно из запоминаемых состояний $$\sigma^k$$, или на его "зеркального двойника" - $$\sigma^k$$. Из этих состояний однозначно
восстанавливаются образы памяти. Однако, если сделать моментальный снимок состояния сети, то в силу флуктуаций она практически никогда
не находится ни в одном из состояний памяти, всегда воспроизводя их с некоторой ошибкой. Теоретически было показано, что загрузка
памяти, $$\alpha=P/N,$$ оказывает на поведение системы такое же влияние, как температурный параметр в распределении Ферми. Когда этот параметр мал,
каждому из запоминаемых некоррелированных образов соответствует стационарное состояние сети. Однако, при приближении его к критической
емкости $$\alpha\cong 0.138$$, сеть внезапно теряет все свойства памяти. В плоскости координат $$(\alpha,T)$$ области памяти и неупорядоченного поведения
сети разделены границей, при пересечении которой происходит соответствующий фазовый переход. Более детальный анализ
выявляет на фазовой диаграмме следующие 4 области: парамагнитную (P) фазу, в которой любой порядок разрушается высокой температурой;
фазу спинового стекла (SG), в которой состояние сети не может эволюционировать к запомненным образам; смешанную (F+SG) - в ней
запомненные образы метастабильны; и ферромагнитную (F) - в ней всем запоминаемым образам соответствуют глобальные минимумы энергии.
(рис 11.6) Упрощенная и детальная диаграммы фазовых состояний сети Хопфилда
Наличие тепловых флуктуаций снижает вероятность попадания сети в состояние ложных минимумов. Критическая температура, при которых множество таких минимумов становится неустойчивыми, равна $$T_3\approx 0.46$$. Таким образом тепловой шум улучшает свойства памяти и наиболее благоприятным температурным интервалом работы сети является $$T_3<T<T_c$$.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.