Вычислительный центр СО РАН в г. Красноярске
В словах "искусственные нейронные сети" слышатся отзвуки фантазий об андроидах и бунте роботов, о машинах, заменяющих и имитирующих человека. Эти фантазии интенсивно поддерживаются многими разработчиками нейросистем: рисуется не очень отдаленное будущее, в котором роботы осваивают различные виды работ, просто наблюдая за человеком, а в более отдаленной перспективе - человеческое сознание и личность перегружаются в искусственную нейронную сеть - появляются шансы на вечную жизнь.
Поэтическая игра воображения вовлекает в работу молодежь, поэзия рекламы создает научную моду и влияет на финансовые вложения. Можете ли Вы четко различить, где кончается бескорыстная творческая игра и начинается реклама? У меня такое однозначное различение не получается: это как вопрос о искренности - можно сомневаться даже в своей собственной искренности.
Итак: игра и мода как важные движущие силы.
В словах "модное научное направление" слышится нечто неоднозначное - то ли пренебрежение, смешанное с завистью, то ли еще что-то. А вообще, мода в науке - это хорошо или плохо? Дадим три ответа на этот вопрос.
Мы все зависим от своего прошлого, от привычных дел и привычных мыслей. Так давайте же приветствовать все, что освобождает нас от этой зависимости! В новой модной области почти нет накопленных преимуществ - все равны. Это хорошо для молодежи.
"Гений - это терпение мысли." Так давайте же вслед за Ньютоном и другими Великими культивировать в себе это терпение. Не будем поддаваться соблазну моды.
Нейронные сети нынче в моде и поэтическая реклама делает свое дело, привлекает внимание. Но стоит ли следовать за модой? Ресурсы ограничены - особенно у нас, особенно теперь. Все равно всего на всех не хватит. И возникают вопросы:
За этими вопросами скрыты два базовых предположения:
У энтузиастов есть свои рекламные способы отвечать на заданные вопросы, рисуя светлые послезавтрашние горизонты. Но все это в будущем. А сейчас? Ответы парадоксальны:
Зачем же тогда
Если перейти к еще более прозаическому уровню повседневной работы, то нейронные сети - это всего-навсего сети, состоящие из связанных между собой простых элементов - формальных нейронов. Значительное большинство работ по нейроинформатике посвящено переносу различных алгоритмов решения задач на такие сети.
Ядром используемых представлений является идея о том, что нейроны можно моделировать довольно простыми автоматами, а вся сложность мозга, гибкость его функционирования и другие важнейшие качества определяются связями между нейронами. Каждая связь представляется как совсем простой элемент, служащий для передачи сигнала. Предельным выражением этой точки зрения может служить лозунг: "структура связей - все, свойства элементов - ничто".
Совокупность идей и научно-техническое направление, определяемое описанным представлением о мозге, называется коннекционизмом (по-ангийски connection - связь). Как все это соотносится с реальным мозгом? Так же, как карикатура или шарж со своим прототипом-человеком - весьма условно. Это нормально: важно не буквальное соответствие живому прототипу, а продуктивность технической идеи.
С коннекционизмом тесно связан следующий блок идей:
Предполагается, что система связей достаточно богата по своим возможностям и достаточно избыточна, чтобы скомпенсировать бедность выбора элементов, их ненадежность, возможные разрушения части связей.
Коннекционизм и связанные с ним идеи однородности, избыточности и голографичности еще ничего не говорят нам о том, как же такую систему научить решать реальные задачи. Хотелось бы, чтобы это обучение обходилось не слишком дорого.
На первый взгляд кажется, что коннекционистские системы не допускают прямого программирования, то есть формирования связей по явным правилам. Это, однако, не совсем так. Существует большой класс задач: нейронные системы ассоциативной памяти, статистической обработки, фильтрации и др., для которых связи формируются по явным формулам. Но еще больше (по объему существующих приложений) задач требует неявного процесса. По аналогии с обучением животных или человека этот процесс мы также называем обучением.
Обучение обычно строится так: существует задачник - набор примеров с заданными ответами. Эти примеры предъявляются системе. Нейроны получают по входным связям сигналы - "условия примера", преобразуют их, несколько раз обмениваются преобразованными сигналами и, наконец, выдают ответ - также набор сигналов. Отклонение от правильного ответа штрафуется. Обучение состоит в минимизации штрафа как (неявной) функции связей. Примерно четверть нашей книги состоит в описании техники такой оптимизации и возникающих при этом дополнительных задач.
Неявное обучение приводит к тому, что структура связей становится "непонятной" - не существует иного способа ее прочитать, кроме как запустить функционирование сети. Становится сложно ответить на вопрос: "Как нейронная сеть получает результат?" - то есть построить понятную человеку логическую конструкцию, воспроизводящую действия сети.
Это явление можно назвать "логической непрозрачностью" нейронных сетей, обученных по неявным правилам. В работе с логически непрозрачными нейронными сетями иногда оказываются полезными представления, разработанные в психологии и
С другой стороны, при использовании нейронных сетей в экспертных системах на PC возникает потребность прочитать и логически проинтерпретировать навыки, выработанные сетью. В лекции 9 описаны служащие для этого методы контрастирования - получения неявными методами логически прозрачных нейронных сетей. Однако за логическую прозрачность приходится платить снижением избыточности, так как при контрастировании удаляются все связи кроме самых важных, без которых задача не может быть решена.
Итак, очевидно наличие двух источников идеологии нейроинформатики. Это представления о строении мозга и о процессах обучения. Существуют группы исследователей и научные школы, для которых эти источники идей имеют символическое, а иногда даже мистическое или тотемическое значение. Но это все поэзия, а мы пока перейдем к прозе - к изучению формальных нейронов.
Для описания алгоритмов и устройств в нейроинформатике выработана специальная "схемотехника", в которой элементарные устройства - сумматоры,
Интересен статус этой схемотехники - для многих начинающих кажется неожиданным, что ни в аппаратной реализации нейронных сетей, ни в профессиональном программном обеспечении все эти элементы вовсе не обязательно реализуются как отдельные части или блоки. Используемая в нейроинформатике идеальная схемотехника представляет собой особый язык для представления нейронных сетей и их обсуждения. При программной и аппаратной реализации выполненные на этом языке описания переводятся на языки другого уровня, более пригодные для реализации.
Самый заслуженный и, вероятно, наиболее важный элемент нейросистем - это адаптивный сумматор . Адаптивный сумматор вычисляет x на вектор параметров $$\alpha$$. На схемах будем обозначать его так, как показано на рис. 1.1. Адаптивным называем его из-за наличия вектора настраиваемых параметров $$\alpha$$. Для многих задач полезно иметь линейную неоднородную функцию выходных сигналов. Ее вычисление также можно представить с помощью адаптивного сумматора, имеющего n+1 вход и получающего на 0 -й вход постоянный единичный сигнал (рис. 1.2).

(рис 1.2) Адаптивный сумматор.(рис 1.1) Неоднородный адаптивный сумматор 
(рис 1.4) Нелинейный преобразова-тель сигнала.(рис 1.3) Точка ветвления
(рис 1.5) Формальный нейрон Нелинейный преобразователь сигнала изображен на рис. 1.3. Он получает скалярный входной сигнал x и переводит его в $$\varphi{\rm{(x)}}$$.
Точка ветвления служит для рассылки одного сигнала по нескольким адресам (рис. 1.4). Она получает скалярный входной сигнал x и передает его всем своим выходам. Стандартный формальный нейрон составлен из входного сумматора, нелинейного преобразователя и точки ветвления на выходе (рис. 1.5).
Линейная связь - синапс - отдельно от сумматоров не встречается, однако для некоторых рассуждений бывает удобно выделить этот элемент (рис. 1.6). Он умножает входной сигнал x на "вес синапса" $$\alpha$$.
(рис 1.6) СинапсТакже бывает полезно "присоединить" связи не ко входному сумматору, а к точке ветвления. В результате получаем элемент, двойственный адаптивному сумматору и называемый " выходная звезда ". Его выходные связи производят умножение сигнала на свои веса.
Итак, дано описание основных элементов, из которых составляются нейронные сети.
Перейдем теперь к вопросу: как можно составлять эти сети? Строго говоря, как угодно, лишь бы входы получали какие-нибудь сигналы. Но такой произвол слишком необозрим, поэтому используют несколько стандартных архитектур, из которых путем вырезания лишнего или (реже) добавления строят большинство используемых сетей.
Сначала следует договориться о том, как будет согласована работа различных нейронов во времени. Как только в системе возникает более одного элемента, встает вопрос о синхронности функционирования. Для привычных нам всем программных имитаторов нейронных сетей на цифровых ЭВМ такого вопроса нет только из-за свойств основного компьютера, на котором реализуются нейронные сети. Для других способов реализации такой вопрос весьма важен. Все же здесь и далее рассматриваются только нейронные сети, синхронно функционирующие в дискретные моменты времени: все нейроны срабатывают "разом".
В зоопарке нейронных сетей можно выделить две базовых архитектуры - слоистые и полносвязные сети.
(рис 1.7) Слоистая сетьСлоистые сети: нейроны расположены в несколько слоев (рис. 1.7). Нейроны первого слоя получают входные сигналы, преобразуют их и через точки ветвления передают нейронам второго слоя. Далее срабатывает второй слой и т.д. до k -го слоя, который выдает выходные сигналы для интерпретатора и пользователя. Если не оговорено противное, то каждый выходной сигнал i -го слоя подается на вход всех нейронов i+1 -го. Число нейронов в каждом слое может быть любым и никак заранее не связано с количеством нейронов в других слоях. Стандартный способ подачи входных сигналов: все нейроны первого слоя получают каждый входной сигнал. Особое распространение получили трехслойные сети, в которых каждый слой имеет свое наименование: первый - входной, второй - скрытый, третий - выходной.
Полносвязные сети: каждый нейрон передает свой выходной сигнал остальным нейронам, включая самого себя. Выходными сигналами сети могут быть все или некоторые выходные сигналы нейронов после нескольких тактов функционирования сети. Все входные сигналы подаются всем нейронам.
Элементы слоистых и полносвязных сетей могут выбираться по-разному. Существует, впрочем, стандартный выбор - нейрон с адаптивным неоднородным линейным сумматором на входе (рис. 1.5).
Для полносвязной сети входной сумматор нейрона фактически распадается на два: первый вычисляет линейную функцию от входных сигналов сети, второй - линейную функцию от выходных сигналов других нейронов, полученных на предыдущем шаге.
Функция активации нейронов (характеристическая функция) $$\varphi$$ -
Составление сети из нейронов стандартного вида (рис. 1.5) не является обязательным. Слоистая или полносвязная архитектуры не налагают существенных ограничений на участвующие в них элементы. Единственное жесткое требование, предъявляемое архитектурой к элементам сети, это соответствие размерности вектора входных сигналов элемента (она определяется архитектурой) числу его входов.
Если полносвязная сеть функционирует до получения ответа заданное число тактов k, то ее можно представить как частный случай k -слойной сети, все слои которой одинаковы и каждый из них соответствует такту функционирования полносвязной сети.
Существенное различие между полносвязной и слоистой сетями возникает тогда, когда число тактов функционирования заранее не ограничено - слоистая сеть так работать не может.
Вопрос, вынесенный в
Заданный вопрос имеет очень большую историю и заведомо старше, чем исследования
Какие функции может вычислять человек? Если мы умеем складывать и умножать числа, то мы можем точно вычислять многочлены и рациональные функции (отношения многочленов) с рациональными коэффициентами от рациональных же аргументов.
Можно, однако, задавать функции с помощью уравнений. Если считать решения нескольких простых уравнений известными, то класс вычисляемых функций расширится - решения некоторых более общих уравнений удастся выразить через эти, более простые функции.
Классический пример: если использовать радикалы - решения уравнений xn=a, то можно явно получить решения произвольных уравнений 2 -й, 3 -й и 4 -й степеней. Так, функция 3 -х переменных a, b, c - решение уравнения ax2+bx+c=0 - может быть точно выражена с помощью сложения, умножения, деления и функции одного переменного - квадратного корня.
Вопрос: можно ли представить решение любого алгебраического уравнения с помощью радикалов, был окончательно и отрицательно решен Абелем и Галуа - уже уравнения 5 -й степени неразрешимы в радикалах.
Все же можно подбирать другие простые функции небольшого числа переменных - сложнее, чем радикалы, но проще, чем общие решения уравнений высоких степеней. Удастся ли с помощью этих функций построить решение любого уравнения? Вопрос был настолько важен, что Гильберт в списке своих проблем, которые, по его мнению, должны были определять развитие математики XX века, под номером 13 поместил следующую задачу:
Представляется ли корень уравнения
x7+ax3+bx2+cx+1=0
(как функция коэффициентов) суперпозицией каких-либо непрерывных функций двух переменных?
Для уравнений 5 -й и 6 -й степени такое представление возможно не только с помощью непрерывных, но даже
Оказалось полезным абстрагироваться от уравнений и поставить общий вопрос: можно ли произвольную непрерывную функцию n переменных получить с помощью операций сложения, умножения и суперпозиции из непрерывных функций двух переменных? Ответ оказался положительным! В серии работ [1.1, 1.2, 1.3] А.Н.Колмогоров, затем В.И.Арнольд и вновь А.Н.Колмогоров решили эту проблему: можно получить любую непрерывную функцию n переменных с помощью операций сложения, умножения и суперпозиции из непрерывных функций одного переменного.
Последняя теорема А.Н.Колмогорова [1.3] из этой серии настолько проста и изящна, что мы чуть позже приведем ее целиком. А пока - несколько замечаний о условиях теоремы.
От условия непрерывности можно отказаться - тогда получится довольно тривиальный результат связанный, по существу, с равномощностью отрезка и куба любой размерности. Условие непрерывности нельзя значительно усилить: существуют l раз непрерывно дифференцируемые функции трех переменных нельзя представить в виде суперпозиций функций двух переменных, каждая из которых дифференцируема [2l/3] раз и все частные производные которых порядка [2l/3] удовлетворяют условию Липшица (выражение [2l/3] означает целую часть числа 2l/3 ). Это доказано А.Г,Витушкиным [1.4].
А теперь - теорема Колмогорова, завершившая серию исследований для непрерывных функций:
Каждая непрерывная функция n переменных, заданная на единичном кубе n -мерного пространства, представима в виде
$$f(x_1 ,x_2 ,...,x_n )=\sum\limits_{q=1}^{2n+1}{h_q}\left[{\sum\limits_{p=1}^n {\varphi_q^p (x_p)} }\right]$$
где функции $$h_q (u)$$ непрерывны, а функции $$\varphi_q^p (x_p)$$ , кроме того, еще и стандартны, т.е. не зависят от выбора функции f.
В частности, каждая непрерывная функция двух переменных x, y представима в виде
$$f(x,y)=\sum\limits_{q=1}^5 {h_q \left[{\varphi_q (x)+\psi_q (y)}\right]} ,$$
Доказательство настолько просто, изящно и поучительно, что мы приведем его практически полностью для случая n=2, следуя изложению В.И.Арнольда [1.5]. Возможность представления (2) доказывается в несколько этапов.
1. "Внутренние" функции $$\varphi_q (x)$$ и $$\psi_q (y)$$ представления (2) совершенно не зависят от разлагаемой функции $$f(x,y)$$.
Для определения этих функций нам понадобятся некоторые предварительные построения. Рассмотрим изображенный на рис. 1.8 "город" - систему одинаковых "кварталов" (непересекающихся замкнутых квадратов), разделенных узкими "улицами" одной и той же ширины. Уменьшим гомотетично наш "город" в $$N$$ раз; за центр гомотетии можно принять, например, точку $$A_1$$ - мы получим новый" город", который будем называть "городом ранга 2". "Город ранга 3" точно также получается из "города ранга 2" гомотетичным уменьшением с коэффициентом гомотетии $$${\frac{1}{N}}$$$ ; "город ранга 4" получается гомотетичным уменьшением в $$N$$ раз "города ранга 3" и т.д. Вообще "город ранга $$k$$ " получается из исходного "города" (который мы будем называть "городом первого ранга") гомотетичным уменьшением в $$N^k$$ раз (с центром гомотетии в $$A_1$$ ; впрочем, выбор центра гомотетии не существенен для дальнейшего).
(рис 1.8) Система кварталовПостроенную систему "городов" мы назовем 1 -й системой. "Город первого ранга $$q$$ -й системы" ( $$q=2,...,5$$ ) получается из изображенного на рис. 1.8 "города" при помощи параллельного переноса, совмещающего точку $$A_1$$ с точкой $$A_q$$. Нетрудно понять, что "улицы" "города" можно выбрать настолько узкими, что каждая точка плоскости будет покрыта по крайней мере тремя кварталами наших пяти "городов первого ранга". Точно так же "город $$k$$ -го ранга" $$q$$ -й системы ( $$k=2,3,...;q=2,...,5$$ ) получается из "города $$k$$ -го ранга 1 -й системы" параллельным переносом, переводящим точку $$A_1^k$$ в точку $$A_q^k$$, где $$A_1^k$$ и $$A_q^k$$ получаются из точек $$A_1$$ и $$A_q$$ гомотетией, переводящей "город первого ранга" 1 -й системы (т.е. наш исходный "город") в "город $$k$$ -го ранга"
той же системы; при этом каждая точка плоскости будет принадлежать кварталам по крайней мере трех из пяти "городов" любого фиксированного ранга $$k$$.
Функцию
$$\Phi_q (x,y)=\varphi_q (x)+\psi_q (y)$$ ( $$q=1,2,...,5 $$ )
мы определим теперь так, чтобы она разделяла любые два "квартала" каждого "города" системы $$q$$, т.е. чтобы множество значений, принимаемых $$\Phi_q (x,y)$$ на определенном "квартале" "города $$k$$ -го ранга" (здесь $$k$$ - произвольное фиксированное число) $$q$$ -й системы, не пересекалось с множеством значений, принимаемых $$\Phi_q (x,y)$$ на любом другом "квартале" того же "города". При этом нам, разумеется, будет достаточно рассматривать функцию $$\Phi_q (x,y)$$ на единичном квадрате (а не на всей плоскости).
Для того, чтобы функция $$\Phi_q (x,y)=\varphi_q (x)+\psi_q (y)$$ разделяла "кварталы" "города первого ранга", можно потребовать, например, чтобы $$\varphi_q (x)$$ на проекциях "кварталов" "города" на ось $$x$$ весьма мало отличалась от различных целых чисел, а $$\psi_q (y)$$ на проекциях "кварталов" на ось $$y$$ весьма мало отличалась от различных кратных $$\sqrt 2$$ (ибо $$m+n\sqrt 2 =m'+n'\sqrt 2$$ при целых $$m$$, $$n$$, $$m'$$, $$n'$$, лишь если $$m=m',n=n'$$ ). При этом наложенные условия не определяют пока еще, разумеется, функций $$\varphi_q (x)$$ и $$\psi_q (y)$$ (на "улицах" функция $$\Phi_q (x,y)=\varphi_q (x)+\psi_q (y)$$ вообще пока может задаваться совершенно произвольно); используя это,
можно подобрать границы значений $$\varphi_q (x)$$ и $$\psi_q (y)$$ на "кварталах" "города второго ранга" так, чтобы функция $$\Phi_q (x,y)=\varphi_q (x)+\psi_q (y)$$ разделяла не только "кварталы" "города 1 -го ранга", но и "кварталы" "города 2 -го ранга". Намеченную программу можно осуществить, если $$N$$ достаточно велико (так что кварталы последующих рангов не соединяют кварталы предыдущих). А.Н. Колмогоров выбрал $$N=18$$. Привлекая подобным же образом к рассмотрению "города" последующих рангов и уточняя каждый раз значения функций $$\varphi_q (x)$$ и $$\psi_q (y)$$, мы в пределе получим непрерывные функции $$\varphi_q (x)$$ и $$\psi_q (y)$$ (можно даже потребовать, чтобы они были монотонными), удовлетворяющие поставленным условиям.
2. Функции $$h_q (u)$$ разложения (2), напротив того, существенно зависят от исходной функции $$f(x,y)$$.
Для построения этих функций докажем прежде всего, что любую непрерывную функцию $$f(x,y)$$ двух переменных $$x$$ и $$y$$ , заданную на единичном квадрате, можно представить в виде
$$f(x,y)=\sum\limits_{q=1}^5 {h_q^{(1)} (\Phi_q (x,y))}+f_1 (x,y)$$
где $$\Phi_q (x,y)=\varphi_q (x)+\psi_q (y)$$ - функции, построенные выше, и
$$M_1 =\max \left|{f_1 (x,y)} \right|\le \frac{5}{6}\max \left|{f(x,y)} \right|=\frac{5}{6}M ,$$
$$\max \left|{h_q^{(1)} (\Phi_q (x,y))} \right|\le \frac{1}{3}M,$$ $$q=1,...,5$$.
Выберем ранг $$k$$ столь большим, чтобы колебание (т.е. разность наибольшего и наименьшего значений) функции $$f(x,y)$$ на каждом "квартале" любого из "городов ранга $$k$$ " не превосходило $$${\frac{1}{6}}{\rm{M}}$$$ ; это, разумеется, возможно, так как с ростом ранга $$k$$ размеры " кварталов" уменьшаются неограниченно. Далее, пусть $$p_1^{(ij)}$$ - определенный "квартал" "города 1 -й системы" (и выбранного ранга $$k$$ ); в таком случае (непрерывная) функция $$\Phi_1 (x,y)$$ принимает на этом "квартале" значения, принадлежащие определенному сегменту $$\Delta_1^{(ij)}$$ числовой оси (причем в силу определения функции $$\Phi_1$$ этот сегмент не пересекается с сегментами значений, принимаемых $$\Phi_1$$ на всех других "кварталах"). Положим теперь функцию $$h_1^{(1)}$$ на сегменте $$\Delta_1^{(ij)}$$ постоянной, равной $$${\frac{1}{3}}$$$
значения, принимаемого функцией $$f(x,y)$$ в какой-либо (безразлично какой) внутренней точке $$M_1^{(ij)}$$ квартала $$p_1^{(ij)}$$ (эту точку можно назвать "центром квартала"). Таким же образом мы определим функцию $$h_1^{(1)}$$ на любом другом из сегментов, задаваемых значениями функции $$\Phi_1 (x,y)$$ на "кварталах" "города $$k$$ -го ранга" 1 -й системы; при этом все значения $$h_1^{(1)}$$ будут по модулю не превосходить $$${\frac{1}{3}}{\rm{M}}$$$ (ибо значение $$f(x,y)$$ в "центре" любого "квартала" по модулю не превосходит $$M$$ ). Доопределим теперь функцию $$h_1^{(1)} (u)$$ при тех значениях аргумента $$u$$, при каких она еще не определена, произвольно, с тем лишь, чтобы она была непрерывна и чтобы выполнялось неравенство (3б); совершенно аналогично определим и все остальные функции $$h_q^{(1)} (u)$$ ( $$q=2,...,5$$ ).
Докажем теперь, что разность
$$f_1 (x,y)=f(x,y)-\sum\limits_{q=1}^5 {h_q^{(1)}(\Phi_q (x,y))} $$
удовлетворяет условию (3а), т.е. что $$\left|{f_1 (x_0 ,y_0 )} \right|\le \frac{5}{6}M$$, где $$(x_0 ,y_0 )$$ - произвольная точка единичного квадрата. Эта точка (как и все точки плоскости) принадлежит по крайней мере трем кварталам "городов ранга $$k$$ "; поэтому заведомо найдутся такие три из пяти функций $$h_1^{(1)} (\Phi_q (x,y))$$, которые принимают в точке $$(x_0 ,y_0 )$$ значение, равное $$${\frac{1}{3}}$$$ значения $$f(x,y)$$ в "центре" соответствующего "квартала", т.е. отличающееся от $$${\frac{1}{3}}{f(x_0 ,y_0 )} $$$ не более чем на $$${\frac{1}{18}}{\rm{M}}$$$ (ибо колебание $$f(x,y)$$ на каждом квартале не превосходит $$${\frac{1}{6}}{\rm{M}}$$$ ); сумма этих трех значений $$h_q^{(1)} (\Phi_q (x_0 ,y_0 ))$$ будет отличаться от $$f(x_0 ,y_0 )$$ по модулю не более чем на $$${\frac{1}{6}}{\rm{M}}$$$. А так как каждое из оставшихся двух чисел $$h_q^{(1)} (\Phi_q (x_0 ,y_0 ))$$ в силу (3) по модулю не превосходит $$${\frac{1}{3}}{\rm{M}}$$$ то мы получаем:
$$\left|{f_1 (x_0 ,y_0 )} \right|=\left|{f(x_0 ,y_0 )-\sum\limits_{q=1}^5 {h_q^{(1)}(\Phi_q (x_0 ,y_0 ))}}\right|\le \frac{1}{6}M+\frac{2}{3}M=\frac{5}{6}M ,$$
что и доказывает (3а).
Применим теперь то же разложение (3) к входящей в (3) функции $$f_1 (x,y)$$ ; мы получим:
$$f_1 (x,y)=\sum\limits_{q=1}^5 {h_q^{(2)} (\Phi_q (x,y))+f_2 (x,y)} $$
или
$$f(x,y)=\sum\limits_{q=1}^5 {h_q^{(1)} (\Phi_q (x,y))}+\sum\limits_{q=1}^5 {h_q^{(2)} (\Phi_q (x,y))}+f_2 (x,y) ,$$
где
$$M_2 =\max \left|{f_2 (x,y)} \right|\le \frac{5}{6}M_1 =\left( {\frac{5}{6}} \right)^2 M$$
и
$$\max \left|{h_q^{(2)} (\Phi_q (x,y))} \right|\le \frac{1}{3}M_1 \le \frac{1}{3} \cdot \frac{5}{6}M$$ ( $$q=1,2,...,5$$ ).
Затем мы применим разложение (3) к полученной функции $$f_2 (x,y)$$ и т.д.; после $$n$$ -кратного применения этого разложения мы будем иметь:
$$f(x,y)=\sum\limits_{q=1}^5 {h_q^{(1)} (\Phi_q (x,y))}+\sum\limits_{q=1}^5 {h_q^{(2)} (\Phi_q (x,y))}+f_2 (x,y)+..$$.
$$...+\sum\limits_{q=1}^5 {h_q^{(n - 1)} (\Phi_q (x,y))}+f_n (x,y) ,$$
где
$$M_n =\max \left|{f_n (x,y)} \right|\le \left( {\frac{5}{6}} \right)^n M $$
и
$$\max \left|{h_q^{(s)} (\Phi_q (x,y))} \right|\le \frac{1}{3} \cdot \left( {\frac{5}{6}} \right)^{s - 1} M$$ ( $$q=1,2,...,5;s=1,2,...,n - 1$$ ).
Последние оценки показывают, что при $$n \to \infty$$ получим:
$$f(x,y)=\sum\limits_{q=1}^5 {h_q^{(1)} (\Phi_q (x,y))}+\sum\limits_{q=1}^5 {h_q^{(2)} (\Phi_q (x,y))}+f_2 (x,y)+...$$
$$...+\sum\limits_{q=1}^5 {h_q^{(n)} (\Phi_q (x,y))}+...$$
где стоящий справа бесконечный ряд сходится равномерно; также и каждый из пяти рядов
$$h_q^{(1)} (\Phi_q (x,y))+h_q^{(2)} (\Phi_q (x,y))+h_q^{(n)} (\Phi_q (x,y))+..$$. ( $$q=1,2,...,5 $$ )
сходится равномерно, что позволяет ввести обозначения
$$h_q (u)=h_q^{(1)}+h_q^{(2)}+...+h_q^{(n)}+...$$ ( $$q=1,2,...,5$$ ).
Итак, окончательно получаем:
$$f(x,y)=\sum\limits_{q=1}^5 {h_q (\Phi_q (x,y))} =\sum\limits_{q=1}^5 h_q \left[{\varphi_q (x)+\psi_q (y)} \right] ,$$
то есть требуемое разложение (2).
До сих пор речь шла о точном представлении функций многих переменных с помощью функций одного переменного. Оказалось, что в классе непрерывных функций такое представление возможно. Но кроме вопроса о точном представлении существует еще один - об аппроксимации. Можно даже предположить, что он важнее - вычисление большинства функций производится приближенно даже при наличии "точных" формул.
Приближение функций многочленами и рациональными функциями имеет историю, еще более давнюю, чем проблема точного представления. Знаменитая теорема Вейерштрасса утверждает, что непрерывную функцию нескольких переменных $$f(x_1 ,x_2 ,...,x_n )$$ на замкнутом ограниченном множестве Q можно равномерно приблизить последовательностью полиномов: для любого $$\varepsilon>0$$ существует такой многочлен $$P(x_1 ,x_2 ,...,x_n )$$, что
$$\mathop {{\rm{sup}}}\limits_{\rm{Q}}|f(x_1,x_2,...,x_n)-P(x_1,x_2,...,x_n)|< \varepsilon$$
Чтобы сформулировать обобщения и усиления теоремы Вейерштрасса, необходимо перейти к несколько более абстрактному языку. Рассмотрим компактное пространство X и алгебру C(X) непрерывных функций на X с вещественными значениями.
Сильным обобщением теоремы о возможности равномерного приближения непрерывных функций многочленами является теорема Стоуна [1.6, 1.7]:
Пусть $${\rm{E}} \subseteq {\rm{C(X)}}$$ - замкнутая подалгебра в C(X), $$1 \in E$$ и функции из E разделяют точки в X (то есть для любых различных $$x,y \in X$$ существует такая функция $${\rm{g}} \in E$$, что $${\rm{g(x)}}\ne{\rm{g(y)}}$$ ). Тогда E=C(X) .
Теорема Стоуна обобщает теорему Вейерштрасса по двум направлениям. Во-первых, рассматриваются функции на произвольном компакте, а не только функции многих действительных переменных. Во-вторых, доказано утверждение, новое даже для функций одного переменного (не говоря уже о многих): плотно не только множество многочленов от координатных функций, но вообще кольцо многочленов от любого набора функций, разделяющих точки. Следовательно, плотно множество тригонометрических многочленов, множество линейных комбинаций функций вида exp[-(x-x0,Q(x-x0))], где (x,Qx) - положительно определенная квадратичная форма и др.
Дан рецепт конструирования таких обобщений: достаточно взять произвольный набор функций, разделяющих точки, построить кольцо многочленов от них - и получим плотное в C(X) множество функций.
Разложения по ортогональным системам функций (ряды Фурье и их многочисленные обобщения) не дают, вообще говоря, равномерного приближения разлагаемых функций - как правило, можно гарантировать лишь монотонное стремление к нулю интеграла квадрата остатка "функция минус приближение" с какой-либо положительной весовой функцией. Все же, обращаясь к
Так существуют ли функции многих переменных? В каком-то смысле - да, в каком-то - нет. Все непрерывные функции многих переменных могут быть получены из непрерывных функций одного переменного с помощью линейных операций и суперпозиции. Требования гладкости и аналитичности существенно усложняют вопрос. На этом фоне совершенно неожиданно выглядит тот факт, что любой многочлен от многих переменных может быть получен из одного произвольного нелинейного многочлена от одного переменного с помощью линейных операций и суперпозиции. Простое доказательство этой теоремы будет дано в разделе 6.
В этом разделе для множеств непрерывных функций, замкнутых относительно любой нелинейной операции (а не только для колец), доказана обобщенная аппроксимационная теорема Стоуна. Это интерпретируется как утверждение о универсальных аппроксимационных возможностях произвольной нелинейности: с помощью линейных операций и каскадного соединения можно из произвольного нелинейного элемента получить устройство, вычисляющее любую непрерывную функцию с любой наперед заданной точностью.
Рассмотрим компактное пространство X и алгебру C(X) непрерывных функций на X с вещественными значениями.
Кроме аппроксимации функций многочленами и их обобщениями из колец функций, разделяющих точки, в последнее время все большее внимание уделяется приближению функций многих переменных с помощью линейных операций и суперпозиций функций одного переменного. Такое приближение осуществляется специальными формальными "устройствами" - нейронными сетями. Каждая сеть состоит из формальных нейронов. Нейрон получает на входе вектор сигналов x, вычисляет его скалярное произведение на вектор весов a и некоторую функцию одного переменного $$\varphi {(x,\alpha )}$$. Результат рассылается на входы других нейронов или передается на выход. Таким образом, нейронные сети вычисляют суперпозиции простых функций одного переменного и их линейных комбинаций.
Доказан ряд теорем [1.8, 1.9, 1.10] об аппроксимации непрерывных функций многих переменных нейронными сетями с использованием практически произвольной непрерывной функции одного переменного. В данном разделе мы покажем, что эта функция действительно может быть произвольной и докажем обобщенную теорему Стоуна, естественным образом охватывающую и классическую теорему Стоуна, и аппроксимацию функций многих переменных суперпозициями и линейными комбинациями функций одного переменного.
Чтобы получить требуемое обобщение, перейдем от рассмотрения колец функций к изучению их алгебр, замкнутых относительно некоторой нелинейной унарной операции.
Пусть $${\rm{E}} \subseteq {\rm{C(X)}}$$ - C(R) - пространство непрерывных функций на действительной оси R, $${\rm{f}}\in{\rm{C(R)}}$$ - нелинейная функция и для любого $${\rm{g}} \in E$$ выполнено $${\rm{f(g)}} \in E$$. В этом случае будем говорить, что E замкнуто относительно нелинейной унарной операции f.
Очевидный пример: множество функций n переменных, которые можно точно представить, используя заданную функцию одного переменного и линейные функции, является f.
Замечание. f(x)=x2 тогда и только тогда, когда E является кольцом.
Действительно, $$fg=\frac{1}{2}\left[{(f+g)^2 - f^2 - g^2 } \right]
$$ поэтому для линейного пространства $${\rm{E}} \subseteq {\rm{C(X)}}$$ замкнутость относительно унарной операции f(x)=x2 равносильна замкнутости относительно произведения функций.
Согласно приведенному замечанию, теорема Стоуна может быть переформулирована так.
Пусть $${\rm{E}} \subseteq {\rm{C(X)}}$$ - замкнутое линейное подпространство в C(X), $$1 \in E$$, функции из E разделяют точки в X и E замкнуто относительно нелинейной унарной операции f(x)=x2. Тогда E=C(X) .
Наше обобщение теоремы Стоуна состоит в замене f(x)=x2 на произвольную нелинейную непрерывную функцию.
Теорема 1. Пусть $${\rm{E}} \subseteq {\rm{C(X)}}$$ - замкнутое линейное подпространство в C(X), $$1 \in E$$, функции из E разделяют точки в X и E замкнуто относительно нелинейной унарной операции $${\rm{f}} \subseteq {\rm{C(R)}}$$. Тогда E=C(X) .
Доказательство. Рассмотрим множество всех таких $$p \in {\rm{C(R)}}$$, что $${\rm{p(E)}} \subseteq {\rm{E}}$$, то есть для любого $${\rm{g}} \in E$$ выполнено: $${\rm{p(g)}} \in E$$. Обозначим это множество PE. Оно обладает следующими свойствами:
PE - PE - замкнутое линейное подпространство в C(R) (в топологии равномерной сходимости на компактах);PE включает хоть одну непрерывную нелинейную функцию.Дальнейшее следует из теоремы 2, которая является, по существу, подготовительной теоремой о полугруппах функций.
Теорема 2. Пусть множество $${\rm{P}} \subseteq {\rm{C(R)}}$$ удовлетворяет условиям 1-4. Тогда P=C(R).
Доказательство опирается на три леммы.
Лемма 1. В условиях теоремы 2 существует дважды непрерывно дифференцируемая функция $${\rm{g}} \in P$$, не являющаяся линейной.
Доказательство. Пусть $${\rm{v(x)}} \in {\rm{C}}^\infty {\rm{(R)}}$$, v(x)=0 при |x|>1, $$\int {_{\rm{R}}}{\rm{v(x)dx=1}}$$. Рассмотрим оператор осреднения
$$J_\varepsilon f(x)= \int\limits_R {f(x+y)\frac{1}{\varepsilon}v\left({\frac{y}{\varepsilon}}\right)}dy$$
Для любого $$\varepsilon>0$$ выполнено: $$J_\varepsilon f(x) \in P$$.
Действительно, $${\rm{f(x+y)}} \in E$$ для каждого фиксированного y ((т.к. константы принадлежат E и E замкнуто относительно линейных операций и суперпозиции функций). Интеграл $$J_\varepsilon f(x)$$. принадлежит E, так как E является замкнутым линейным подпространством в C(R), а этот интеграл пределом конечных сумм.
Функция $$J_\varepsilon f(x)$$ принадлежит $${\rm{C}}^\infty {\rm{(R)}}$$ так как
$$J_\varepsilon f(x)= \int\limits_R {f(x+y)\frac{1}{\varepsilon}v\left({\frac{y}{\varepsilon}}\right)}dy= \int\limits_R {f(z)\frac{1}{\varepsilon}v\left({\frac{{z-x}}{\varepsilon}}\right)}dz$$
(напомним, что v – функция с компактным носителем).
Существует такое $$\varepsilon >0$$, что функция $$g=J_\varepsilon f$$ не является линейной, поскольку $$J_\varepsilon f \to f$$ не является линейной, поскольку $$\varepsilon \to 0$$, пространство линейных функций замкнуто, а f не является линейной функцией. Таким образом, в предположениях леммы существует нелинейная функция $${\rm{g}} \in {\rm{P}}\cap {\rm{C}}^\infty {\rm{(R)}}$$, которую можно выбрать в виде $$g=J_\varepsilon f$$
Лемма 2. Пусть в условиях теоремы 2 существует дважды непрерывно дифференцируемая функция $${\rm{g}} \in P$$, не являющаяся линейной. Тогда функция q(x)=x2 принадлежит P.
Доказательство. Существует точка x0, для которой $${\rm{g''(x_0 )}} \ne {\rm{0}}$$. Обозначим r(x)=2(g(x+x0)-g(x0)-xg'(x0))/g''(x0). Очевидно, что $${\rm{r}} \in {\rm{P}}{\rm{, r(0)=0}}{\rm{, r'(0)=0}}{\rm{, r''(0)=2}}{\rm{, r(x)=x}}^2 {\rm{+o(x}}^2 )}$$. Поэтому
$${\rm{r(}}\varepsilon {\rm{x)/}}\varepsilon^2 \to {\rm{x}}^2 $$ при $$\varepsilon \to 0$$.
Поскольку P замкнуто, получаем: функция q(x)=x2 принадлежит P.
Лемма 3. Пусть в условиях теоремы 2 функция q(x)=x2 принадлежит P. Тогда P является кольцом - для любых $$f,{\rm{g}} \in P$$ их произведение $$f{\rm{g}} \in P$$.
Доказательство. Действительно, $$fg=\frac{1}{2}\left[{(f+g)^2 - f^2 - g^2}\right]$$ и, так как P замкнуто относительно суперпозиции и линейных операций, то $$f{\rm{g}} \in P$$.
Доказательство теоремы 2 заканчивается обращением к классической теореме Вейерштрасса о приближении функций многочленами: из лемм 1-3 следует, что в условиях теоремы 2 P является кольцом и, в частности, содержит все многочлены (которые получаются из 1 и id с помощью умножения и линейных операций). По теореме Вейерштрасса отсюда следует, что P=C(R) .
Теоремы 1,2 можно трактовать как утверждения о универсальных аппроксимационных свойствах любой нелинейности: с помощью линейных операций и каскадного соединения можно из произвольных нелинейных элементов получить любой требуемый результат с любой наперед заданной точностью.
В этом разделе исследуются
Вернемся к классическому вопросу о представлении функций многих переменных с помощью функций меньшего числа переменных. Следует еще раз заметить, что классических вопроса существует не один, а два:
В рамках первого вопроса особый интерес представляют конструкции, в которых для точного представления всех функций многих переменных используется один и тот же набор функций одного переменного.
Традиционно считается, что эти функции должны иметь весьма специальный и довольно экзотический вид, например, как в обсуждавшейся выше теореме Колмогорова, где использовались существенно негладкие функции.
Напротив, свобода в выборе функций одного переменного для решения второго вопроса при том же самоограничении (один набор функций одного переменного - для приближенного представления всех функций многих переменных) очень велика. Для этого, как показано в предыдущем разделе, можно использовать практически любую нелинейную функцию и достаточно всего одной.
Далее доказываются теоремы, относящиеся к первому вопросу (точное представление). В частности, показано, что можно точно представить любой многочлен от многих переменных с помощью суперпозиций произвольного нелинейного многочлена от одного переменного и линейных функций. Следовательно особенной пропасти между 1-м и 2-м вопросом не существует. Именно это обстоятельство побудило нас включить в книгу данный раздел.
Пусть R[X] - кольцо многочленов от одного переменного над полем R, $${\rm{E}} \subset {\rm{R[X]}}$$ - R.
Предложение 1. Если E замкнуто относительно суперпозиции многочленов, содержит все многочлены первой степени и хотя бы один многочлен p(x) степени m>1, то E=R[X].
Доказательство. Заметим, что степень многочлена p'(x)=p(x+1)-p(x) равна m-1, и $${\rm{p'(x)}} \in E$$, так как E содержит многочлены первой степени (поэтому $${\rm{x+1}} \in E$$ ), замкнуто относительно суперпозиции (поэтому $${\rm{p(x+1)}} \in E$$ ) и линейных операций (поэтому $${\rm{p'(x)}} \in E$$ ).
Если m>2, то понижаем степень с помощью конечных разностей (переходим к p', p'' и т.д.), пока не получим многочлен второй степени. Вычитая из него линейную часть и умножая на константу, получаем: $$x^2 \in E$$. Поэтому для любого $$f \in E$$ имеем $$f^2 \in E$$ (т.к. E - R[X].
Перейдем к задаче представления многочленов от многих переменных. Обозначим R[X1, ..., Xn] кольцо многочленов от n переменных над полем R.
Для каждого многочлена от одного переменного введем множество тех многочленов, которые можно выразить с его помощью, используя суперпозиции и линейные функции. Пусть p - многочлен от одного переменного, Ep[X1, ..., Xn] - множество многочленов от n переменных, которое можно получить из p и многочленов первой степени, принадлежащих R[X1, ..., Xn], с помощью операций суперпозиции, сложения и умножения на число.
Следующие два предложения дают удобную для дальнейшего характеризацию Ep[X1, ..., Xn] и следуют непосредственно из определений.
Предложение 2. Множество Ep[X1, ..., Xn] является R и для любого многочлена g(x1, ... ,xn) из $${\rm{E}}_{\rm{p}}{\rm{[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{] p(g(x}}_{\rm{1}}{\rm{, }}...{\rm{,x}}_{\rm{n}})) \in {\rm{E}}_{\rm{p}}{\rm{[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{]}}$$.
Предложение 3. Для данного p семейство линейных подпространств $${\rm{L}} \subseteq {\rm{R[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{]}}$$, содержащих все многочлены первой степени и удовлетворяющих условию
если $${\rm{g(x}}_{\rm{1}}{\rm{, }}...}{\rm{,x}}_{\rm{n}}{\rm{)}} \in {\rm{L}}$$, то $${\rm{p(g(x}}_{\rm{1}}{\rm{, }}...{\rm{,x}}_{\rm{n}}{\rm{))}} \in {\rm{L}}$$,
замкнуто относительно пересечений. Минимальным по включению элементом этого семейства является Ep[X1, ..., Xn].
Для любого линейного подпространства $${\rm{E}} \subseteq {\rm{R[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{]}}$$ рассмотрим множество алгебраических унарных операций, которые переводят элементы E в элементы E:
$${\rm{P}}_{\rm{E}}{\rm{=\{p}} \in {\rm{R[X]|p(g(x}}_{\rm{1}}{\rm{, }}...{\rm{,x}}_{\rm{n}}{\rm{))}} \in {\rm{E}}$$ для любого $${\rm{g(x}}_{\rm{1}}{\rm{, }}...{\rm{,x}}_{\rm{n}}{\rm{)}} \in {\rm{E}} \}$$.
Предложение 4. Для любого линейного подпространства $${\rm{E}} \subseteq {\rm{R[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{]}}$$ множество полиномов PE является R, замкнуто относительно суперпозиции и содержит все однородные многочлены первой степени.
Если E содержит 1, а PE включает хотя бы один многочлен, степени m>1 (т.е. нелинейный), то PE=R[X].
Доказательство. Замкнутость PE относительно суперпозиции следует из определения, все однородные полиномы первой степени входят в PE, поскольку E является PE является PE содержит многочлен степени m>1, то $$x \in P_E$$, тогда PE=R[X] по предложению 1.
Теорема 3. Пусть $${\rm{E}} \subseteq {\rm{R[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{]}}$$ - линейное подпространство, PE содержит хотя бы один многочлен степени m>1 и $$1 \in E$$, тогда E является кольцом (с единицей).
Доказательство. По предложению 4 в условиях теоремы PE=R[X]. В частности, $$x^2 \in P_E$$. Это означает, что для любого $$f \in E$$ также и $$f^2 \in E$$. Поэтому для любых $$f,{\rm{g}} \in E$$ получаем: $$f{\rm{g}} \in E$$.
Теорема 4. Для любого многочлена p степени m>1
Ep[X1, ..., Xn]=R[X1, ..., Xn]
Доказательство. Заметим, что E=Ep[X1, ..., Xn] - линейное подпространство в R[X1, ..., Xn], PE содержит хотя бы один многочлен ( p ) степени m>1 и E содержит все многочлены первой степени (и поэтому также 1 ). В силу теоремы 3, E является кольцом, а так как оно содержит все многочлены первой степени, то совпадает с R[X1, ..., Xn], поскольку, используя умножение и сложение можно из этих многочленов получить любой.
Таким образом, из p и многочленов первой степени с помощью операций суперпозиции, сложения и умножения на число можно получить все элементы R[X1, ..., Xn].
Класс функций, вычислимый с помощью нейронных сетей, замкнут относительно линейных операций. Действительно, пусть есть нейронные сети S1, S2, ..., Sk, которые вычисляют функции F1, F2, ..., Fk от вектора входных сигналов x. Линейная комбинация a0+a1F1+a2F2+...+akFk вычисляется сумматором (рис. 1.2) с весами a0, a1, a2, ...,ak, на вход которого подаются выходные сигналы сетей S1, S2, ..., Sk. Разница в числе тактов функционирования этих сетей до получения ответа легко компенсируется "линиями задержки", составленными из связей (рис. 1.6) с единичным весом.
Кроме того, класс функций, вычислимый с помощью нейронных сетей, замкнут относительно унарной операции, осуществляемой нелинейным преобразователем сигнала, входящим в состав нейрона (см. рис. 1.3, 1.5): если сеть S вычисляет функцию F, то, подавая выход этой сети на вход нелинейного преобразователя (рис. 1.3), получим на его выходе функцию $$\varphi {\rm{(F)}}.$$
Тем самым, по теореме 1 множество функций, вычислимых нейронными сетями с заданной непрерывной нелинейной характеристической функцией, плотно в пространстве непрерывных функций от входных сигналов.
Теперь - об имитации гладких автоматов с помощью нейронных сетей. Если есть возможность с любой точностью приблизить любую непрерывную функцию и нет ограничений на способы соединения устройств, то можно сколь угодно точно имитировать работу любого непрерывного автомата. Покажем это.
Каждый автомат имеет несколько входов ( n ), несколько выходов ( p ) и конечный набор ( s ) параметров состояния. Он вычисляет s+p функций от n+s переменных. Аргументы этих функций - входные сигналы (их n ) и текущие параметры состояния (их s ). Значения функций - выходные сигналы (их p ) и параметры состояния на следующем шаге (их s ). Каждый такой автомат можно представить как систему из s+p более простых автоматов (рис. 1.9). Эти простые автоматы вычисляют по одной функции от n+s переменных. Смена состояний достигается за счет того, что часть значений этих функций на следующем шаге становится аргументами - так соединены автоматы (см. рис. 1.9).
Таким образом, без потери общности можно рассматривать сеть автоматов как набор устройств, каждое из которых вычисляет функцию нескольких переменных f(x1, ..., xn). Этот простой, но фундаментальный факт позволяет использовать предыдущие результаты. Нейронные сети позволяют с любой точностью вычислять произвольную непрерывную функцию f(x1, ..., xn). Следовательно, с их помощью можно сколь угодно точно аппроксимировать функционирование любого непрерывного автомата.
(рис 1.9) Представление общего автомата с помощью модулей, вычисляющих функции многих переменных от входных сигналов: на верхней схеме представлено функционирование автомата, на нижней он разложен на отдельные модули. Приняты обозначения: In - входные сигналы, Out - выходные сигналы, S - параметры состояния, T - дискретное время, Out(In,S) зависимость выходных сигналов от значений входных и параметров состояния, S'(In,S) зависимость состояния в следующий момент дискретного времени от входных сигналов и текущего состояния, f1-fp функции переменных (In,S) компоненты вектора Out(In,S), fp+1-fp+s функции переменных (In,S) компоненты вектора S'(In,S), индексами T, T±1 обозначены соответствующие моменты времени
Главный вопрос этой лекции: что могут нейронные сети. Ответ получен: нейронные сети могут все. Остается открытым другой вопрос - как их этому научить?
Работа над лекцией была поддержана Красноярским краевым фондом науки, грант 6F0124.
Вычислительный центр СО РАН в г. Красноярске
В словах "искусственные нейронные сети" слышатся отзвуки фантазий об андроидах и бунте роботов, о машинах, заменяющих и имитирующих человека. Эти фантазии интенсивно поддерживаются многими разработчиками нейросистем: рисуется не очень отдаленное будущее, в котором роботы осваивают различные виды работ, просто наблюдая за человеком, а в более отдаленной перспективе - человеческое сознание и личность перегружаются в искусственную нейронную сеть - появляются шансы на вечную жизнь.
Поэтическая игра воображения вовлекает в работу молодежь, поэзия рекламы создает научную моду и влияет на финансовые вложения. Можете ли Вы четко различить, где кончается бескорыстная творческая игра и начинается реклама? У меня такое однозначное различение не получается: это как вопрос о искренности - можно сомневаться даже в своей собственной искренности.
Итак: игра и мода как важные движущие силы.
В словах "модное научное направление" слышится нечто неоднозначное - то ли пренебрежение, смешанное с завистью, то ли еще что-то. А вообще, мода в науке - это хорошо или плохо? Дадим три ответа на этот вопрос.
Мы все зависим от своего прошлого, от привычных дел и привычных мыслей. Так давайте же приветствовать все, что освобождает нас от этой зависимости! В новой модной области почти нет накопленных преимуществ - все равны. Это хорошо для молодежи.
"Гений - это терпение мысли." Так давайте же вслед за Ньютоном и другими Великими культивировать в себе это терпение. Не будем поддаваться соблазну моды.
Нейронные сети нынче в моде и поэтическая реклама делает свое дело, привлекает внимание. Но стоит ли следовать за модой? Ресурсы ограничены - особенно у нас, особенно теперь. Все равно всего на всех не хватит. И возникают вопросы:
За этими вопросами скрыты два базовых предположения:
У энтузиастов есть свои рекламные способы отвечать на заданные вопросы, рисуя светлые послезавтрашние горизонты. Но все это в будущем. А сейчас? Ответы парадоксальны:
Зачем же тогда
Если перейти к еще более прозаическому уровню повседневной работы, то нейронные сети - это всего-навсего сети, состоящие из связанных между собой простых элементов - формальных нейронов. Значительное большинство работ по нейроинформатике посвящено переносу различных алгоритмов решения задач на такие сети.
Ядром используемых представлений является идея о том, что нейроны можно моделировать довольно простыми автоматами, а вся сложность мозга, гибкость его функционирования и другие важнейшие качества определяются связями между нейронами. Каждая связь представляется как совсем простой элемент, служащий для передачи сигнала. Предельным выражением этой точки зрения может служить лозунг: "структура связей - все, свойства элементов - ничто".
Совокупность идей и научно-техническое направление, определяемое описанным представлением о мозге, называется коннекционизмом (по-ангийски connection - связь). Как все это соотносится с реальным мозгом? Так же, как карикатура или шарж со своим прототипом-человеком - весьма условно. Это нормально: важно не буквальное соответствие живому прототипу, а продуктивность технической идеи.
С коннекционизмом тесно связан следующий блок идей:
Предполагается, что система связей достаточно богата по своим возможностям и достаточно избыточна, чтобы скомпенсировать бедность выбора элементов, их ненадежность, возможные разрушения части связей.
Коннекционизм и связанные с ним идеи однородности, избыточности и голографичности еще ничего не говорят нам о том, как же такую систему научить решать реальные задачи. Хотелось бы, чтобы это обучение обходилось не слишком дорого.
На первый взгляд кажется, что коннекционистские системы не допускают прямого программирования, то есть формирования связей по явным правилам. Это, однако, не совсем так. Существует большой класс задач: нейронные системы ассоциативной памяти, статистической обработки, фильтрации и др., для которых связи формируются по явным формулам. Но еще больше (по объему существующих приложений) задач требует неявного процесса. По аналогии с обучением животных или человека этот процесс мы также называем обучением.
Обучение обычно строится так: существует задачник - набор примеров с заданными ответами. Эти примеры предъявляются системе. Нейроны получают по входным связям сигналы - "условия примера", преобразуют их, несколько раз обмениваются преобразованными сигналами и, наконец, выдают ответ - также набор сигналов. Отклонение от правильного ответа штрафуется. Обучение состоит в минимизации штрафа как (неявной) функции связей. Примерно четверть нашей книги состоит в описании техники такой оптимизации и возникающих при этом дополнительных задач.
Неявное обучение приводит к тому, что структура связей становится "непонятной" - не существует иного способа ее прочитать, кроме как запустить функционирование сети. Становится сложно ответить на вопрос: "Как нейронная сеть получает результат?" - то есть построить понятную человеку логическую конструкцию, воспроизводящую действия сети.
Это явление можно назвать "логической непрозрачностью" нейронных сетей, обученных по неявным правилам. В работе с логически непрозрачными нейронными сетями иногда оказываются полезными представления, разработанные в психологии и
С другой стороны, при использовании нейронных сетей в экспертных системах на PC возникает потребность прочитать и логически проинтерпретировать навыки, выработанные сетью. В лекции 9 описаны служащие для этого методы контрастирования - получения неявными методами логически прозрачных нейронных сетей. Однако за логическую прозрачность приходится платить снижением избыточности, так как при контрастировании удаляются все связи кроме самых важных, без которых задача не может быть решена.
Итак, очевидно наличие двух источников идеологии нейроинформатики. Это представления о строении мозга и о процессах обучения. Существуют группы исследователей и научные школы, для которых эти источники идей имеют символическое, а иногда даже мистическое или тотемическое значение. Но это все поэзия, а мы пока перейдем к прозе - к изучению формальных нейронов.
Для описания алгоритмов и устройств в нейроинформатике выработана специальная "схемотехника", в которой элементарные устройства - сумматоры,
Интересен статус этой схемотехники - для многих начинающих кажется неожиданным, что ни в аппаратной реализации нейронных сетей, ни в профессиональном программном обеспечении все эти элементы вовсе не обязательно реализуются как отдельные части или блоки. Используемая в нейроинформатике идеальная схемотехника представляет собой особый язык для представления нейронных сетей и их обсуждения. При программной и аппаратной реализации выполненные на этом языке описания переводятся на языки другого уровня, более пригодные для реализации.
Самый заслуженный и, вероятно, наиболее важный элемент нейросистем - это адаптивный сумматор . Адаптивный сумматор вычисляет x на вектор параметров $$\alpha$$. На схемах будем обозначать его так, как показано на рис. 1.1. Адаптивным называем его из-за наличия вектора настраиваемых параметров $$\alpha$$. Для многих задач полезно иметь линейную неоднородную функцию выходных сигналов. Ее вычисление также можно представить с помощью адаптивного сумматора, имеющего n+1 вход и получающего на 0 -й вход постоянный единичный сигнал (рис. 1.2).

(рис 1.2) Адаптивный сумматор.(рис 1.1) Неоднородный адаптивный сумматор 
(рис 1.4) Нелинейный преобразова-тель сигнала.(рис 1.3) Точка ветвления
(рис 1.5) Формальный нейрон Нелинейный преобразователь сигнала изображен на рис. 1.3. Он получает скалярный входной сигнал x и переводит его в $$\varphi{\rm{(x)}}$$.
Точка ветвления служит для рассылки одного сигнала по нескольким адресам (рис. 1.4). Она получает скалярный входной сигнал x и передает его всем своим выходам. Стандартный формальный нейрон составлен из входного сумматора, нелинейного преобразователя и точки ветвления на выходе (рис. 1.5).
Линейная связь - синапс - отдельно от сумматоров не встречается, однако для некоторых рассуждений бывает удобно выделить этот элемент (рис. 1.6). Он умножает входной сигнал x на "вес синапса" $$\alpha$$.
(рис 1.6) СинапсТакже бывает полезно "присоединить" связи не ко входному сумматору, а к точке ветвления. В результате получаем элемент, двойственный адаптивному сумматору и называемый " выходная звезда ". Его выходные связи производят умножение сигнала на свои веса.
Итак, дано описание основных элементов, из которых составляются нейронные сети.
Перейдем теперь к вопросу: как можно составлять эти сети? Строго говоря, как угодно, лишь бы входы получали какие-нибудь сигналы. Но такой произвол слишком необозрим, поэтому используют несколько стандартных архитектур, из которых путем вырезания лишнего или (реже) добавления строят большинство используемых сетей.
Сначала следует договориться о том, как будет согласована работа различных нейронов во времени. Как только в системе возникает более одного элемента, встает вопрос о синхронности функционирования. Для привычных нам всем программных имитаторов нейронных сетей на цифровых ЭВМ такого вопроса нет только из-за свойств основного компьютера, на котором реализуются нейронные сети. Для других способов реализации такой вопрос весьма важен. Все же здесь и далее рассматриваются только нейронные сети, синхронно функционирующие в дискретные моменты времени: все нейроны срабатывают "разом".
В зоопарке нейронных сетей можно выделить две базовых архитектуры - слоистые и полносвязные сети.
(рис 1.7) Слоистая сетьСлоистые сети: нейроны расположены в несколько слоев (рис. 1.7). Нейроны первого слоя получают входные сигналы, преобразуют их и через точки ветвления передают нейронам второго слоя. Далее срабатывает второй слой и т.д. до k -го слоя, который выдает выходные сигналы для интерпретатора и пользователя. Если не оговорено противное, то каждый выходной сигнал i -го слоя подается на вход всех нейронов i+1 -го. Число нейронов в каждом слое может быть любым и никак заранее не связано с количеством нейронов в других слоях. Стандартный способ подачи входных сигналов: все нейроны первого слоя получают каждый входной сигнал. Особое распространение получили трехслойные сети, в которых каждый слой имеет свое наименование: первый - входной, второй - скрытый, третий - выходной.
Полносвязные сети: каждый нейрон передает свой выходной сигнал остальным нейронам, включая самого себя. Выходными сигналами сети могут быть все или некоторые выходные сигналы нейронов после нескольких тактов функционирования сети. Все входные сигналы подаются всем нейронам.
Элементы слоистых и полносвязных сетей могут выбираться по-разному. Существует, впрочем, стандартный выбор - нейрон с адаптивным неоднородным линейным сумматором на входе (рис. 1.5).
Для полносвязной сети входной сумматор нейрона фактически распадается на два: первый вычисляет линейную функцию от входных сигналов сети, второй - линейную функцию от выходных сигналов других нейронов, полученных на предыдущем шаге.
Функция активации нейронов (характеристическая функция) $$\varphi$$ -
Составление сети из нейронов стандартного вида (рис. 1.5) не является обязательным. Слоистая или полносвязная архитектуры не налагают существенных ограничений на участвующие в них элементы. Единственное жесткое требование, предъявляемое архитектурой к элементам сети, это соответствие размерности вектора входных сигналов элемента (она определяется архитектурой) числу его входов.
Если полносвязная сеть функционирует до получения ответа заданное число тактов k, то ее можно представить как частный случай k -слойной сети, все слои которой одинаковы и каждый из них соответствует такту функционирования полносвязной сети.
Существенное различие между полносвязной и слоистой сетями возникает тогда, когда число тактов функционирования заранее не ограничено - слоистая сеть так работать не может.
Вопрос, вынесенный в
Заданный вопрос имеет очень большую историю и заведомо старше, чем исследования
Какие функции может вычислять человек? Если мы умеем складывать и умножать числа, то мы можем точно вычислять многочлены и рациональные функции (отношения многочленов) с рациональными коэффициентами от рациональных же аргументов.
Можно, однако, задавать функции с помощью уравнений. Если считать решения нескольких простых уравнений известными, то класс вычисляемых функций расширится - решения некоторых более общих уравнений удастся выразить через эти, более простые функции.
Классический пример: если использовать радикалы - решения уравнений xn=a, то можно явно получить решения произвольных уравнений 2 -й, 3 -й и 4 -й степеней. Так, функция 3 -х переменных a, b, c - решение уравнения ax2+bx+c=0 - может быть точно выражена с помощью сложения, умножения, деления и функции одного переменного - квадратного корня.
Вопрос: можно ли представить решение любого алгебраического уравнения с помощью радикалов, был окончательно и отрицательно решен Абелем и Галуа - уже уравнения 5 -й степени неразрешимы в радикалах.
Все же можно подбирать другие простые функции небольшого числа переменных - сложнее, чем радикалы, но проще, чем общие решения уравнений высоких степеней. Удастся ли с помощью этих функций построить решение любого уравнения? Вопрос был настолько важен, что Гильберт в списке своих проблем, которые, по его мнению, должны были определять развитие математики XX века, под номером 13 поместил следующую задачу:
Представляется ли корень уравнения
x7+ax3+bx2+cx+1=0
(как функция коэффициентов) суперпозицией каких-либо непрерывных функций двух переменных?
Для уравнений 5 -й и 6 -й степени такое представление возможно не только с помощью непрерывных, но даже
Оказалось полезным абстрагироваться от уравнений и поставить общий вопрос: можно ли произвольную непрерывную функцию n переменных получить с помощью операций сложения, умножения и суперпозиции из непрерывных функций двух переменных? Ответ оказался положительным! В серии работ [1.1, 1.2, 1.3] А.Н.Колмогоров, затем В.И.Арнольд и вновь А.Н.Колмогоров решили эту проблему: можно получить любую непрерывную функцию n переменных с помощью операций сложения, умножения и суперпозиции из непрерывных функций одного переменного.
Последняя теорема А.Н.Колмогорова [1.3] из этой серии настолько проста и изящна, что мы чуть позже приведем ее целиком. А пока - несколько замечаний о условиях теоремы.
От условия непрерывности можно отказаться - тогда получится довольно тривиальный результат связанный, по существу, с равномощностью отрезка и куба любой размерности. Условие непрерывности нельзя значительно усилить: существуют l раз непрерывно дифференцируемые функции трех переменных нельзя представить в виде суперпозиций функций двух переменных, каждая из которых дифференцируема [2l/3] раз и все частные производные которых порядка [2l/3] удовлетворяют условию Липшица (выражение [2l/3] означает целую часть числа 2l/3 ). Это доказано А.Г,Витушкиным [1.4].
А теперь - теорема Колмогорова, завершившая серию исследований для непрерывных функций:
Каждая непрерывная функция n переменных, заданная на единичном кубе n -мерного пространства, представима в виде
$$f(x_1 ,x_2 ,...,x_n )=\sum\limits_{q=1}^{2n+1}{h_q}\left[{\sum\limits_{p=1}^n {\varphi_q^p (x_p)} }\right]$$
где функции $$h_q (u)$$ непрерывны, а функции $$\varphi_q^p (x_p)$$ , кроме того, еще и стандартны, т.е. не зависят от выбора функции f.
В частности, каждая непрерывная функция двух переменных x, y представима в виде
$$f(x,y)=\sum\limits_{q=1}^5 {h_q \left[{\varphi_q (x)+\psi_q (y)}\right]} ,$$
Доказательство настолько просто, изящно и поучительно, что мы приведем его практически полностью для случая n=2, следуя изложению В.И.Арнольда [1.5]. Возможность представления (2) доказывается в несколько этапов.
1. "Внутренние" функции $$\varphi_q (x)$$ и $$\psi_q (y)$$ представления (2) совершенно не зависят от разлагаемой функции $$f(x,y)$$.
Для определения этих функций нам понадобятся некоторые предварительные построения. Рассмотрим изображенный на рис. 1.8 "город" - систему одинаковых "кварталов" (непересекающихся замкнутых квадратов), разделенных узкими "улицами" одной и той же ширины. Уменьшим гомотетично наш "город" в $$N$$ раз; за центр гомотетии можно принять, например, точку $$A_1$$ - мы получим новый" город", который будем называть "городом ранга 2". "Город ранга 3" точно также получается из "города ранга 2" гомотетичным уменьшением с коэффициентом гомотетии $$${\frac{1}{N}}$$$ ; "город ранга 4" получается гомотетичным уменьшением в $$N$$ раз "города ранга 3" и т.д. Вообще "город ранга $$k$$ " получается из исходного "города" (который мы будем называть "городом первого ранга") гомотетичным уменьшением в $$N^k$$ раз (с центром гомотетии в $$A_1$$ ; впрочем, выбор центра гомотетии не существенен для дальнейшего).
(рис 1.8) Система кварталовПостроенную систему "городов" мы назовем 1 -й системой. "Город первого ранга $$q$$ -й системы" ( $$q=2,...,5$$ ) получается из изображенного на рис. 1.8 "города" при помощи параллельного переноса, совмещающего точку $$A_1$$ с точкой $$A_q$$. Нетрудно понять, что "улицы" "города" можно выбрать настолько узкими, что каждая точка плоскости будет покрыта по крайней мере тремя кварталами наших пяти "городов первого ранга". Точно так же "город $$k$$ -го ранга" $$q$$ -й системы ( $$k=2,3,...;q=2,...,5$$ ) получается из "города $$k$$ -го ранга 1 -й системы" параллельным переносом, переводящим точку $$A_1^k$$ в точку $$A_q^k$$, где $$A_1^k$$ и $$A_q^k$$ получаются из точек $$A_1$$ и $$A_q$$ гомотетией, переводящей "город первого ранга" 1 -й системы (т.е. наш исходный "город") в "город $$k$$ -го ранга"
той же системы; при этом каждая точка плоскости будет принадлежать кварталам по крайней мере трех из пяти "городов" любого фиксированного ранга $$k$$.
Функцию
$$\Phi_q (x,y)=\varphi_q (x)+\psi_q (y)$$ ( $$q=1,2,...,5 $$ )
мы определим теперь так, чтобы она разделяла любые два "квартала" каждого "города" системы $$q$$, т.е. чтобы множество значений, принимаемых $$\Phi_q (x,y)$$ на определенном "квартале" "города $$k$$ -го ранга" (здесь $$k$$ - произвольное фиксированное число) $$q$$ -й системы, не пересекалось с множеством значений, принимаемых $$\Phi_q (x,y)$$ на любом другом "квартале" того же "города". При этом нам, разумеется, будет достаточно рассматривать функцию $$\Phi_q (x,y)$$ на единичном квадрате (а не на всей плоскости).
Для того, чтобы функция $$\Phi_q (x,y)=\varphi_q (x)+\psi_q (y)$$ разделяла "кварталы" "города первого ранга", можно потребовать, например, чтобы $$\varphi_q (x)$$ на проекциях "кварталов" "города" на ось $$x$$ весьма мало отличалась от различных целых чисел, а $$\psi_q (y)$$ на проекциях "кварталов" на ось $$y$$ весьма мало отличалась от различных кратных $$\sqrt 2$$ (ибо $$m+n\sqrt 2 =m'+n'\sqrt 2$$ при целых $$m$$, $$n$$, $$m'$$, $$n'$$, лишь если $$m=m',n=n'$$ ). При этом наложенные условия не определяют пока еще, разумеется, функций $$\varphi_q (x)$$ и $$\psi_q (y)$$ (на "улицах" функция $$\Phi_q (x,y)=\varphi_q (x)+\psi_q (y)$$ вообще пока может задаваться совершенно произвольно); используя это,
можно подобрать границы значений $$\varphi_q (x)$$ и $$\psi_q (y)$$ на "кварталах" "города второго ранга" так, чтобы функция $$\Phi_q (x,y)=\varphi_q (x)+\psi_q (y)$$ разделяла не только "кварталы" "города 1 -го ранга", но и "кварталы" "города 2 -го ранга". Намеченную программу можно осуществить, если $$N$$ достаточно велико (так что кварталы последующих рангов не соединяют кварталы предыдущих). А.Н. Колмогоров выбрал $$N=18$$. Привлекая подобным же образом к рассмотрению "города" последующих рангов и уточняя каждый раз значения функций $$\varphi_q (x)$$ и $$\psi_q (y)$$, мы в пределе получим непрерывные функции $$\varphi_q (x)$$ и $$\psi_q (y)$$ (можно даже потребовать, чтобы они были монотонными), удовлетворяющие поставленным условиям.
2. Функции $$h_q (u)$$ разложения (2), напротив того, существенно зависят от исходной функции $$f(x,y)$$.
Для построения этих функций докажем прежде всего, что любую непрерывную функцию $$f(x,y)$$ двух переменных $$x$$ и $$y$$ , заданную на единичном квадрате, можно представить в виде
$$f(x,y)=\sum\limits_{q=1}^5 {h_q^{(1)} (\Phi_q (x,y))}+f_1 (x,y)$$
где $$\Phi_q (x,y)=\varphi_q (x)+\psi_q (y)$$ - функции, построенные выше, и
$$M_1 =\max \left|{f_1 (x,y)} \right|\le \frac{5}{6}\max \left|{f(x,y)} \right|=\frac{5}{6}M ,$$
$$\max \left|{h_q^{(1)} (\Phi_q (x,y))} \right|\le \frac{1}{3}M,$$ $$q=1,...,5$$.
Выберем ранг $$k$$ столь большим, чтобы колебание (т.е. разность наибольшего и наименьшего значений) функции $$f(x,y)$$ на каждом "квартале" любого из "городов ранга $$k$$ " не превосходило $$${\frac{1}{6}}{\rm{M}}$$$ ; это, разумеется, возможно, так как с ростом ранга $$k$$ размеры " кварталов" уменьшаются неограниченно. Далее, пусть $$p_1^{(ij)}$$ - определенный "квартал" "города 1 -й системы" (и выбранного ранга $$k$$ ); в таком случае (непрерывная) функция $$\Phi_1 (x,y)$$ принимает на этом "квартале" значения, принадлежащие определенному сегменту $$\Delta_1^{(ij)}$$ числовой оси (причем в силу определения функции $$\Phi_1$$ этот сегмент не пересекается с сегментами значений, принимаемых $$\Phi_1$$ на всех других "кварталах"). Положим теперь функцию $$h_1^{(1)}$$ на сегменте $$\Delta_1^{(ij)}$$ постоянной, равной $$${\frac{1}{3}}$$$
значения, принимаемого функцией $$f(x,y)$$ в какой-либо (безразлично какой) внутренней точке $$M_1^{(ij)}$$ квартала $$p_1^{(ij)}$$ (эту точку можно назвать "центром квартала"). Таким же образом мы определим функцию $$h_1^{(1)}$$ на любом другом из сегментов, задаваемых значениями функции $$\Phi_1 (x,y)$$ на "кварталах" "города $$k$$ -го ранга" 1 -й системы; при этом все значения $$h_1^{(1)}$$ будут по модулю не превосходить $$${\frac{1}{3}}{\rm{M}}$$$ (ибо значение $$f(x,y)$$ в "центре" любого "квартала" по модулю не превосходит $$M$$ ). Доопределим теперь функцию $$h_1^{(1)} (u)$$ при тех значениях аргумента $$u$$, при каких она еще не определена, произвольно, с тем лишь, чтобы она была непрерывна и чтобы выполнялось неравенство (3б); совершенно аналогично определим и все остальные функции $$h_q^{(1)} (u)$$ ( $$q=2,...,5$$ ).
Докажем теперь, что разность
$$f_1 (x,y)=f(x,y)-\sum\limits_{q=1}^5 {h_q^{(1)}(\Phi_q (x,y))} $$
удовлетворяет условию (3а), т.е. что $$\left|{f_1 (x_0 ,y_0 )} \right|\le \frac{5}{6}M$$, где $$(x_0 ,y_0 )$$ - произвольная точка единичного квадрата. Эта точка (как и все точки плоскости) принадлежит по крайней мере трем кварталам "городов ранга $$k$$ "; поэтому заведомо найдутся такие три из пяти функций $$h_1^{(1)} (\Phi_q (x,y))$$, которые принимают в точке $$(x_0 ,y_0 )$$ значение, равное $$${\frac{1}{3}}$$$ значения $$f(x,y)$$ в "центре" соответствующего "квартала", т.е. отличающееся от $$${\frac{1}{3}}{f(x_0 ,y_0 )} $$$ не более чем на $$${\frac{1}{18}}{\rm{M}}$$$ (ибо колебание $$f(x,y)$$ на каждом квартале не превосходит $$${\frac{1}{6}}{\rm{M}}$$$ ); сумма этих трех значений $$h_q^{(1)} (\Phi_q (x_0 ,y_0 ))$$ будет отличаться от $$f(x_0 ,y_0 )$$ по модулю не более чем на $$${\frac{1}{6}}{\rm{M}}$$$. А так как каждое из оставшихся двух чисел $$h_q^{(1)} (\Phi_q (x_0 ,y_0 ))$$ в силу (3) по модулю не превосходит $$${\frac{1}{3}}{\rm{M}}$$$ то мы получаем:
$$\left|{f_1 (x_0 ,y_0 )} \right|=\left|{f(x_0 ,y_0 )-\sum\limits_{q=1}^5 {h_q^{(1)}(\Phi_q (x_0 ,y_0 ))}}\right|\le \frac{1}{6}M+\frac{2}{3}M=\frac{5}{6}M ,$$
что и доказывает (3а).
Применим теперь то же разложение (3) к входящей в (3) функции $$f_1 (x,y)$$ ; мы получим:
$$f_1 (x,y)=\sum\limits_{q=1}^5 {h_q^{(2)} (\Phi_q (x,y))+f_2 (x,y)} $$
или
$$f(x,y)=\sum\limits_{q=1}^5 {h_q^{(1)} (\Phi_q (x,y))}+\sum\limits_{q=1}^5 {h_q^{(2)} (\Phi_q (x,y))}+f_2 (x,y) ,$$
где
$$M_2 =\max \left|{f_2 (x,y)} \right|\le \frac{5}{6}M_1 =\left( {\frac{5}{6}} \right)^2 M$$
и
$$\max \left|{h_q^{(2)} (\Phi_q (x,y))} \right|\le \frac{1}{3}M_1 \le \frac{1}{3} \cdot \frac{5}{6}M$$ ( $$q=1,2,...,5$$ ).
Затем мы применим разложение (3) к полученной функции $$f_2 (x,y)$$ и т.д.; после $$n$$ -кратного применения этого разложения мы будем иметь:
$$f(x,y)=\sum\limits_{q=1}^5 {h_q^{(1)} (\Phi_q (x,y))}+\sum\limits_{q=1}^5 {h_q^{(2)} (\Phi_q (x,y))}+f_2 (x,y)+..$$.
$$...+\sum\limits_{q=1}^5 {h_q^{(n - 1)} (\Phi_q (x,y))}+f_n (x,y) ,$$
где
$$M_n =\max \left|{f_n (x,y)} \right|\le \left( {\frac{5}{6}} \right)^n M $$
и
$$\max \left|{h_q^{(s)} (\Phi_q (x,y))} \right|\le \frac{1}{3} \cdot \left( {\frac{5}{6}} \right)^{s - 1} M$$ ( $$q=1,2,...,5;s=1,2,...,n - 1$$ ).
Последние оценки показывают, что при $$n \to \infty$$ получим:
$$f(x,y)=\sum\limits_{q=1}^5 {h_q^{(1)} (\Phi_q (x,y))}+\sum\limits_{q=1}^5 {h_q^{(2)} (\Phi_q (x,y))}+f_2 (x,y)+...$$
$$...+\sum\limits_{q=1}^5 {h_q^{(n)} (\Phi_q (x,y))}+...$$
где стоящий справа бесконечный ряд сходится равномерно; также и каждый из пяти рядов
$$h_q^{(1)} (\Phi_q (x,y))+h_q^{(2)} (\Phi_q (x,y))+h_q^{(n)} (\Phi_q (x,y))+..$$. ( $$q=1,2,...,5 $$ )
сходится равномерно, что позволяет ввести обозначения
$$h_q (u)=h_q^{(1)}+h_q^{(2)}+...+h_q^{(n)}+...$$ ( $$q=1,2,...,5$$ ).
Итак, окончательно получаем:
$$f(x,y)=\sum\limits_{q=1}^5 {h_q (\Phi_q (x,y))} =\sum\limits_{q=1}^5 h_q \left[{\varphi_q (x)+\psi_q (y)} \right] ,$$
то есть требуемое разложение (2).
До сих пор речь шла о точном представлении функций многих переменных с помощью функций одного переменного. Оказалось, что в классе непрерывных функций такое представление возможно. Но кроме вопроса о точном представлении существует еще один - об аппроксимации. Можно даже предположить, что он важнее - вычисление большинства функций производится приближенно даже при наличии "точных" формул.
Приближение функций многочленами и рациональными функциями имеет историю, еще более давнюю, чем проблема точного представления. Знаменитая теорема Вейерштрасса утверждает, что непрерывную функцию нескольких переменных $$f(x_1 ,x_2 ,...,x_n )$$ на замкнутом ограниченном множестве Q можно равномерно приблизить последовательностью полиномов: для любого $$\varepsilon>0$$ существует такой многочлен $$P(x_1 ,x_2 ,...,x_n )$$, что
$$\mathop {{\rm{sup}}}\limits_{\rm{Q}}|f(x_1,x_2,...,x_n)-P(x_1,x_2,...,x_n)|< \varepsilon$$
Чтобы сформулировать обобщения и усиления теоремы Вейерштрасса, необходимо перейти к несколько более абстрактному языку. Рассмотрим компактное пространство X и алгебру C(X) непрерывных функций на X с вещественными значениями.
Сильным обобщением теоремы о возможности равномерного приближения непрерывных функций многочленами является теорема Стоуна [1.6, 1.7]:
Пусть $${\rm{E}} \subseteq {\rm{C(X)}}$$ - замкнутая подалгебра в C(X), $$1 \in E$$ и функции из E разделяют точки в X (то есть для любых различных $$x,y \in X$$ существует такая функция $${\rm{g}} \in E$$, что $${\rm{g(x)}}\ne{\rm{g(y)}}$$ ). Тогда E=C(X) .
Теорема Стоуна обобщает теорему Вейерштрасса по двум направлениям. Во-первых, рассматриваются функции на произвольном компакте, а не только функции многих действительных переменных. Во-вторых, доказано утверждение, новое даже для функций одного переменного (не говоря уже о многих): плотно не только множество многочленов от координатных функций, но вообще кольцо многочленов от любого набора функций, разделяющих точки. Следовательно, плотно множество тригонометрических многочленов, множество линейных комбинаций функций вида exp[-(x-x0,Q(x-x0))], где (x,Qx) - положительно определенная квадратичная форма и др.
Дан рецепт конструирования таких обобщений: достаточно взять произвольный набор функций, разделяющих точки, построить кольцо многочленов от них - и получим плотное в C(X) множество функций.
Разложения по ортогональным системам функций (ряды Фурье и их многочисленные обобщения) не дают, вообще говоря, равномерного приближения разлагаемых функций - как правило, можно гарантировать лишь монотонное стремление к нулю интеграла квадрата остатка "функция минус приближение" с какой-либо положительной весовой функцией. Все же, обращаясь к
Так существуют ли функции многих переменных? В каком-то смысле - да, в каком-то - нет. Все непрерывные функции многих переменных могут быть получены из непрерывных функций одного переменного с помощью линейных операций и суперпозиции. Требования гладкости и аналитичности существенно усложняют вопрос. На этом фоне совершенно неожиданно выглядит тот факт, что любой многочлен от многих переменных может быть получен из одного произвольного нелинейного многочлена от одного переменного с помощью линейных операций и суперпозиции. Простое доказательство этой теоремы будет дано в разделе 6.
В этом разделе для множеств непрерывных функций, замкнутых относительно любой нелинейной операции (а не только для колец), доказана обобщенная аппроксимационная теорема Стоуна. Это интерпретируется как утверждение о универсальных аппроксимационных возможностях произвольной нелинейности: с помощью линейных операций и каскадного соединения можно из произвольного нелинейного элемента получить устройство, вычисляющее любую непрерывную функцию с любой наперед заданной точностью.
Рассмотрим компактное пространство X и алгебру C(X) непрерывных функций на X с вещественными значениями.
Кроме аппроксимации функций многочленами и их обобщениями из колец функций, разделяющих точки, в последнее время все большее внимание уделяется приближению функций многих переменных с помощью линейных операций и суперпозиций функций одного переменного. Такое приближение осуществляется специальными формальными "устройствами" - нейронными сетями. Каждая сеть состоит из формальных нейронов. Нейрон получает на входе вектор сигналов x, вычисляет его скалярное произведение на вектор весов a и некоторую функцию одного переменного $$\varphi {(x,\alpha )}$$. Результат рассылается на входы других нейронов или передается на выход. Таким образом, нейронные сети вычисляют суперпозиции простых функций одного переменного и их линейных комбинаций.
Доказан ряд теорем [1.8, 1.9, 1.10] об аппроксимации непрерывных функций многих переменных нейронными сетями с использованием практически произвольной непрерывной функции одного переменного. В данном разделе мы покажем, что эта функция действительно может быть произвольной и докажем обобщенную теорему Стоуна, естественным образом охватывающую и классическую теорему Стоуна, и аппроксимацию функций многих переменных суперпозициями и линейными комбинациями функций одного переменного.
Чтобы получить требуемое обобщение, перейдем от рассмотрения колец функций к изучению их алгебр, замкнутых относительно некоторой нелинейной унарной операции.
Пусть $${\rm{E}} \subseteq {\rm{C(X)}}$$ - C(R) - пространство непрерывных функций на действительной оси R, $${\rm{f}}\in{\rm{C(R)}}$$ - нелинейная функция и для любого $${\rm{g}} \in E$$ выполнено $${\rm{f(g)}} \in E$$. В этом случае будем говорить, что E замкнуто относительно нелинейной унарной операции f.
Очевидный пример: множество функций n переменных, которые можно точно представить, используя заданную функцию одного переменного и линейные функции, является f.
Замечание. f(x)=x2 тогда и только тогда, когда E является кольцом.
Действительно, $$fg=\frac{1}{2}\left[{(f+g)^2 - f^2 - g^2 } \right]
$$ поэтому для линейного пространства $${\rm{E}} \subseteq {\rm{C(X)}}$$ замкнутость относительно унарной операции f(x)=x2 равносильна замкнутости относительно произведения функций.
Согласно приведенному замечанию, теорема Стоуна может быть переформулирована так.
Пусть $${\rm{E}} \subseteq {\rm{C(X)}}$$ - замкнутое линейное подпространство в C(X), $$1 \in E$$, функции из E разделяют точки в X и E замкнуто относительно нелинейной унарной операции f(x)=x2. Тогда E=C(X) .
Наше обобщение теоремы Стоуна состоит в замене f(x)=x2 на произвольную нелинейную непрерывную функцию.
Теорема 1. Пусть $${\rm{E}} \subseteq {\rm{C(X)}}$$ - замкнутое линейное подпространство в C(X), $$1 \in E$$, функции из E разделяют точки в X и E замкнуто относительно нелинейной унарной операции $${\rm{f}} \subseteq {\rm{C(R)}}$$. Тогда E=C(X) .
Доказательство. Рассмотрим множество всех таких $$p \in {\rm{C(R)}}$$, что $${\rm{p(E)}} \subseteq {\rm{E}}$$, то есть для любого $${\rm{g}} \in E$$ выполнено: $${\rm{p(g)}} \in E$$. Обозначим это множество PE. Оно обладает следующими свойствами:
PE - PE - замкнутое линейное подпространство в C(R) (в топологии равномерной сходимости на компактах);PE включает хоть одну непрерывную нелинейную функцию.Дальнейшее следует из теоремы 2, которая является, по существу, подготовительной теоремой о полугруппах функций.
Теорема 2. Пусть множество $${\rm{P}} \subseteq {\rm{C(R)}}$$ удовлетворяет условиям 1-4. Тогда P=C(R).
Доказательство опирается на три леммы.
Лемма 1. В условиях теоремы 2 существует дважды непрерывно дифференцируемая функция $${\rm{g}} \in P$$, не являющаяся линейной.
Доказательство. Пусть $${\rm{v(x)}} \in {\rm{C}}^\infty {\rm{(R)}}$$, v(x)=0 при |x|>1, $$\int {_{\rm{R}}}{\rm{v(x)dx=1}}$$. Рассмотрим оператор осреднения
$$J_\varepsilon f(x)= \int\limits_R {f(x+y)\frac{1}{\varepsilon}v\left({\frac{y}{\varepsilon}}\right)}dy$$
Для любого $$\varepsilon>0$$ выполнено: $$J_\varepsilon f(x) \in P$$.
Действительно, $${\rm{f(x+y)}} \in E$$ для каждого фиксированного y ((т.к. константы принадлежат E и E замкнуто относительно линейных операций и суперпозиции функций). Интеграл $$J_\varepsilon f(x)$$. принадлежит E, так как E является замкнутым линейным подпространством в C(R), а этот интеграл пределом конечных сумм.
Функция $$J_\varepsilon f(x)$$ принадлежит $${\rm{C}}^\infty {\rm{(R)}}$$ так как
$$J_\varepsilon f(x)= \int\limits_R {f(x+y)\frac{1}{\varepsilon}v\left({\frac{y}{\varepsilon}}\right)}dy= \int\limits_R {f(z)\frac{1}{\varepsilon}v\left({\frac{{z-x}}{\varepsilon}}\right)}dz$$
(напомним, что v – функция с компактным носителем).
Существует такое $$\varepsilon >0$$, что функция $$g=J_\varepsilon f$$ не является линейной, поскольку $$J_\varepsilon f \to f$$ не является линейной, поскольку $$\varepsilon \to 0$$, пространство линейных функций замкнуто, а f не является линейной функцией. Таким образом, в предположениях леммы существует нелинейная функция $${\rm{g}} \in {\rm{P}}\cap {\rm{C}}^\infty {\rm{(R)}}$$, которую можно выбрать в виде $$g=J_\varepsilon f$$
Лемма 2. Пусть в условиях теоремы 2 существует дважды непрерывно дифференцируемая функция $${\rm{g}} \in P$$, не являющаяся линейной. Тогда функция q(x)=x2 принадлежит P.
Доказательство. Существует точка x0, для которой $${\rm{g''(x_0 )}} \ne {\rm{0}}$$. Обозначим r(x)=2(g(x+x0)-g(x0)-xg'(x0))/g''(x0). Очевидно, что $${\rm{r}} \in {\rm{P}}{\rm{, r(0)=0}}{\rm{, r'(0)=0}}{\rm{, r''(0)=2}}{\rm{, r(x)=x}}^2 {\rm{+o(x}}^2 )}$$. Поэтому
$${\rm{r(}}\varepsilon {\rm{x)/}}\varepsilon^2 \to {\rm{x}}^2 $$ при $$\varepsilon \to 0$$.
Поскольку P замкнуто, получаем: функция q(x)=x2 принадлежит P.
Лемма 3. Пусть в условиях теоремы 2 функция q(x)=x2 принадлежит P. Тогда P является кольцом - для любых $$f,{\rm{g}} \in P$$ их произведение $$f{\rm{g}} \in P$$.
Доказательство. Действительно, $$fg=\frac{1}{2}\left[{(f+g)^2 - f^2 - g^2}\right]$$ и, так как P замкнуто относительно суперпозиции и линейных операций, то $$f{\rm{g}} \in P$$.
Доказательство теоремы 2 заканчивается обращением к классической теореме Вейерштрасса о приближении функций многочленами: из лемм 1-3 следует, что в условиях теоремы 2 P является кольцом и, в частности, содержит все многочлены (которые получаются из 1 и id с помощью умножения и линейных операций). По теореме Вейерштрасса отсюда следует, что P=C(R) .
Теоремы 1,2 можно трактовать как утверждения о универсальных аппроксимационных свойствах любой нелинейности: с помощью линейных операций и каскадного соединения можно из произвольных нелинейных элементов получить любой требуемый результат с любой наперед заданной точностью.
В этом разделе исследуются
Вернемся к классическому вопросу о представлении функций многих переменных с помощью функций меньшего числа переменных. Следует еще раз заметить, что классических вопроса существует не один, а два:
В рамках первого вопроса особый интерес представляют конструкции, в которых для точного представления всех функций многих переменных используется один и тот же набор функций одного переменного.
Традиционно считается, что эти функции должны иметь весьма специальный и довольно экзотический вид, например, как в обсуждавшейся выше теореме Колмогорова, где использовались существенно негладкие функции.
Напротив, свобода в выборе функций одного переменного для решения второго вопроса при том же самоограничении (один набор функций одного переменного - для приближенного представления всех функций многих переменных) очень велика. Для этого, как показано в предыдущем разделе, можно использовать практически любую нелинейную функцию и достаточно всего одной.
Далее доказываются теоремы, относящиеся к первому вопросу (точное представление). В частности, показано, что можно точно представить любой многочлен от многих переменных с помощью суперпозиций произвольного нелинейного многочлена от одного переменного и линейных функций. Следовательно особенной пропасти между 1-м и 2-м вопросом не существует. Именно это обстоятельство побудило нас включить в книгу данный раздел.
Пусть R[X] - кольцо многочленов от одного переменного над полем R, $${\rm{E}} \subset {\rm{R[X]}}$$ - R.
Предложение 1. Если E замкнуто относительно суперпозиции многочленов, содержит все многочлены первой степени и хотя бы один многочлен p(x) степени m>1, то E=R[X].
Доказательство. Заметим, что степень многочлена p'(x)=p(x+1)-p(x) равна m-1, и $${\rm{p'(x)}} \in E$$, так как E содержит многочлены первой степени (поэтому $${\rm{x+1}} \in E$$ ), замкнуто относительно суперпозиции (поэтому $${\rm{p(x+1)}} \in E$$ ) и линейных операций (поэтому $${\rm{p'(x)}} \in E$$ ).
Если m>2, то понижаем степень с помощью конечных разностей (переходим к p', p'' и т.д.), пока не получим многочлен второй степени. Вычитая из него линейную часть и умножая на константу, получаем: $$x^2 \in E$$. Поэтому для любого $$f \in E$$ имеем $$f^2 \in E$$ (т.к. E - R[X].
Перейдем к задаче представления многочленов от многих переменных. Обозначим R[X1, ..., Xn] кольцо многочленов от n переменных над полем R.
Для каждого многочлена от одного переменного введем множество тех многочленов, которые можно выразить с его помощью, используя суперпозиции и линейные функции. Пусть p - многочлен от одного переменного, Ep[X1, ..., Xn] - множество многочленов от n переменных, которое можно получить из p и многочленов первой степени, принадлежащих R[X1, ..., Xn], с помощью операций суперпозиции, сложения и умножения на число.
Следующие два предложения дают удобную для дальнейшего характеризацию Ep[X1, ..., Xn] и следуют непосредственно из определений.
Предложение 2. Множество Ep[X1, ..., Xn] является R и для любого многочлена g(x1, ... ,xn) из $${\rm{E}}_{\rm{p}}{\rm{[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{] p(g(x}}_{\rm{1}}{\rm{, }}...{\rm{,x}}_{\rm{n}})) \in {\rm{E}}_{\rm{p}}{\rm{[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{]}}$$.
Предложение 3. Для данного p семейство линейных подпространств $${\rm{L}} \subseteq {\rm{R[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{]}}$$, содержащих все многочлены первой степени и удовлетворяющих условию
если $${\rm{g(x}}_{\rm{1}}{\rm{, }}...}{\rm{,x}}_{\rm{n}}{\rm{)}} \in {\rm{L}}$$, то $${\rm{p(g(x}}_{\rm{1}}{\rm{, }}...{\rm{,x}}_{\rm{n}}{\rm{))}} \in {\rm{L}}$$,
замкнуто относительно пересечений. Минимальным по включению элементом этого семейства является Ep[X1, ..., Xn].
Для любого линейного подпространства $${\rm{E}} \subseteq {\rm{R[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{]}}$$ рассмотрим множество алгебраических унарных операций, которые переводят элементы E в элементы E:
$${\rm{P}}_{\rm{E}}{\rm{=\{p}} \in {\rm{R[X]|p(g(x}}_{\rm{1}}{\rm{, }}...{\rm{,x}}_{\rm{n}}{\rm{))}} \in {\rm{E}}$$ для любого $${\rm{g(x}}_{\rm{1}}{\rm{, }}...{\rm{,x}}_{\rm{n}}{\rm{)}} \in {\rm{E}} \}$$.
Предложение 4. Для любого линейного подпространства $${\rm{E}} \subseteq {\rm{R[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{]}}$$ множество полиномов PE является R, замкнуто относительно суперпозиции и содержит все однородные многочлены первой степени.
Если E содержит 1, а PE включает хотя бы один многочлен, степени m>1 (т.е. нелинейный), то PE=R[X].
Доказательство. Замкнутость PE относительно суперпозиции следует из определения, все однородные полиномы первой степени входят в PE, поскольку E является PE является PE содержит многочлен степени m>1, то $$x \in P_E$$, тогда PE=R[X] по предложению 1.
Теорема 3. Пусть $${\rm{E}} \subseteq {\rm{R[X}}_{\rm{1}}{\rm{, }}...,{\rm{X}}_{\rm{n}}{\rm{]}}$$ - линейное подпространство, PE содержит хотя бы один многочлен степени m>1 и $$1 \in E$$, тогда E является кольцом (с единицей).
Доказательство. По предложению 4 в условиях теоремы PE=R[X]. В частности, $$x^2 \in P_E$$. Это означает, что для любого $$f \in E$$ также и $$f^2 \in E$$. Поэтому для любых $$f,{\rm{g}} \in E$$ получаем: $$f{\rm{g}} \in E$$.
Теорема 4. Для любого многочлена p степени m>1
Ep[X1, ..., Xn]=R[X1, ..., Xn]
Доказательство. Заметим, что E=Ep[X1, ..., Xn] - линейное подпространство в R[X1, ..., Xn], PE содержит хотя бы один многочлен ( p ) степени m>1 и E содержит все многочлены первой степени (и поэтому также 1 ). В силу теоремы 3, E является кольцом, а так как оно содержит все многочлены первой степени, то совпадает с R[X1, ..., Xn], поскольку, используя умножение и сложение можно из этих многочленов получить любой.
Таким образом, из p и многочленов первой степени с помощью операций суперпозиции, сложения и умножения на число можно получить все элементы R[X1, ..., Xn].
Класс функций, вычислимый с помощью нейронных сетей, замкнут относительно линейных операций. Действительно, пусть есть нейронные сети S1, S2, ..., Sk, которые вычисляют функции F1, F2, ..., Fk от вектора входных сигналов x. Линейная комбинация a0+a1F1+a2F2+...+akFk вычисляется сумматором (рис. 1.2) с весами a0, a1, a2, ...,ak, на вход которого подаются выходные сигналы сетей S1, S2, ..., Sk. Разница в числе тактов функционирования этих сетей до получения ответа легко компенсируется "линиями задержки", составленными из связей (рис. 1.6) с единичным весом.
Кроме того, класс функций, вычислимый с помощью нейронных сетей, замкнут относительно унарной операции, осуществляемой нелинейным преобразователем сигнала, входящим в состав нейрона (см. рис. 1.3, 1.5): если сеть S вычисляет функцию F, то, подавая выход этой сети на вход нелинейного преобразователя (рис. 1.3), получим на его выходе функцию $$\varphi {\rm{(F)}}.$$
Тем самым, по теореме 1 множество функций, вычислимых нейронными сетями с заданной непрерывной нелинейной характеристической функцией, плотно в пространстве непрерывных функций от входных сигналов.
Теперь - об имитации гладких автоматов с помощью нейронных сетей. Если есть возможность с любой точностью приблизить любую непрерывную функцию и нет ограничений на способы соединения устройств, то можно сколь угодно точно имитировать работу любого непрерывного автомата. Покажем это.
Каждый автомат имеет несколько входов ( n ), несколько выходов ( p ) и конечный набор ( s ) параметров состояния. Он вычисляет s+p функций от n+s переменных. Аргументы этих функций - входные сигналы (их n ) и текущие параметры состояния (их s ). Значения функций - выходные сигналы (их p ) и параметры состояния на следующем шаге (их s ). Каждый такой автомат можно представить как систему из s+p более простых автоматов (рис. 1.9). Эти простые автоматы вычисляют по одной функции от n+s переменных. Смена состояний достигается за счет того, что часть значений этих функций на следующем шаге становится аргументами - так соединены автоматы (см. рис. 1.9).
Таким образом, без потери общности можно рассматривать сеть автоматов как набор устройств, каждое из которых вычисляет функцию нескольких переменных f(x1, ..., xn). Этот простой, но фундаментальный факт позволяет использовать предыдущие результаты. Нейронные сети позволяют с любой точностью вычислять произвольную непрерывную функцию f(x1, ..., xn). Следовательно, с их помощью можно сколь угодно точно аппроксимировать функционирование любого непрерывного автомата.
(рис 1.9) Представление общего автомата с помощью модулей, вычисляющих функции многих переменных от входных сигналов: на верхней схеме представлено функционирование автомата, на нижней он разложен на отдельные модули. Приняты обозначения: In - входные сигналы, Out - выходные сигналы, S - параметры состояния, T - дискретное время, Out(In,S) зависимость выходных сигналов от значений входных и параметров состояния, S'(In,S) зависимость состояния в следующий момент дискретного времени от входных сигналов и текущего состояния, f1-fp функции переменных (In,S) компоненты вектора Out(In,S), fp+1-fp+s функции переменных (In,S) компоненты вектора S'(In,S), индексами T, T±1 обозначены соответствующие моменты времени
Главный вопрос этой лекции: что могут нейронные сети. Ответ получен: нейронные сети могут все. Остается открытым другой вопрос - как их этому научить?
Работа над лекцией была поддержана Красноярским краевым фондом науки, грант 6F0124.
Для получения официальных документов о завершении программы дополнительного профессионального образования (удостоверения о повышении квалификации, дипломов о профессиональной переподготовке и MBA) необходимо предоставить:
Внимание! Вы можете не заказывать доставку бумажной версии официального документы, а скачать его в электронном виде и распечатать самостоятельно. Информация о выданном документе в течение 1 месяца загружается в Федеральную информационную систему «Федеральный реестр сведений о документах об образовании и (или) о квалификации, документах об обучении» - ФИС ФРДО.
Доступ на новый сайт осуществляется с использованием адреса электронной почты, который был указан вами при регистрации на "старом". Мы постарались перенести все ваши данные с прежнего ресурса, однако не исключена вероятность потери части информации.
При возникновении проблемы со входом, воспользуйтесь функцией сброса пароля
Если вы обнаружите несоответствия, пожалуйста, сообщите нам.