Обратное распространение ошибки

Метод обратного распространения ошибок (англ. backpropagation) — метод вычисления градиента, который используется при обновлении весов в нейронной сети.

Содержание

1 Обучение как задача оптимизации
2 Дифференцирование для однослойной сети
- 2.1 Находим производную ошибки
3 Недостатки алгоритма
- 3.1 Паралич сети
- 3.2 Локальные минимумы
4 Алгоритм
5 Заметки
6 См. также
7 Источники информации

Обучение как задача оптимизации

Чтобы понять математическое предназначение метода, требуется осознать взаимоотношения между действительными выходными значениями сети и требуемыми выходными значениями для конкретного примера из обучения. Рассмотрим простую нейронную сеть без скрытых слоев, с двумя входными вершинами и одной выходной, в которых каждый нейрон использует линейную функцию активации,^{[заметка 1]} которая является взвешенной суммой входных данных.

Простая нейронная сеть с двумя входными вершинами и одной выходной

Изначально веса задаются случайно. Затем, нейрон обучается с помощью тренировочного множества, которое в этом случае состоит из множества троек [math](x_1, x_2, t)[/math] где [math]x_1[/math] и [math]x_2[/math] — это входные данные сети и [math]t[/math] — правильный ответ. Начальная сеть, приняв на вход [math]x_1[/math] и [math]x_2[/math], вычислит ответ [math]y[/math], который вероятно отличается от [math]t[/math]. Общепринятый метод вычисления несоответствия между ожидаемым [math]t[/math] и получившимся [math]y[/math] ответом — квадратичная функция потерь:

где ошибка.

В качестве примера, рассмотрим сеть с одним тренировочным объектом: , таким образом, значения и равны 1, а равна 0. Теперь, если действительный ответ изобразить на графике на горизонтальной оси, а ошибку на вертикальной, результатом будет парабола. Минимум параболы соответствует ответу , который минимизирует ошибку . Для одиночного тренировочного объекта, минимум также касается горизонтальной оси, следовательно ошибка будет нулевая и сеть может выдать ответ который точно соответствует ожидаемому ответу . Следовательно, задача преобразования входных значений в выходные может быть сведена к задаче оптимизации, заключающейся в поиске функции, которая даст минимальную ошибку.

График ошибки для нейрона с линейной функцией активации и одним тренировочным объектом

В таком случае, выходное значение нейрона — взвешенная сумма всех его входных значений:

где [math]w_1[/math] и [math]w_2[/math] — веса на ребрах, соединяющих входные вершины с выходной. Следовательно, ошибка зависит от весов, входящих в нейрон. И именно это нужно менять в процессе обучения. Распространенный алгоритм для поиска набора весов, минимизирующего ошибку — градиентный спуск. Метод обратного распространения ошибки используется для вычисления самого "крутого" направления для спуска.

Дифференцирование для однослойной сети

Метод градиентного спуска включает в себя вычисление дифференциала квадратичной функции ошибки относительно весов сети. Обычно это делается с помощью метода обратного распространения ошибки. Предположим, что выходной нейрон один,^{[заметка 2]} тогда квадратичная функция ошибки:

где — квадратичная ошибка, — требуемый ответ для обучающего образца, — действительный ответ сети.

Множитель [math]\textstyle\frac{1}{2}[/math] добавлен чтобы предотвратить возникновение экспоненты во время дифференцирования. Позже, выражение будет умножено на произвольную величину скорости обучения, так что не имеет значения на какую константу мы умножим сейчас.

Для каждого нейрона [math]j[/math], его выходное значение [math]o_j[/math] определено как

Входные значения [math]\text{net}_j[/math] нейрона это взвешенная сумма выходных значений [math]o_k[/math] предыдущих нейронов. Если нейрон в первом слове после входного слоя, то [math]o_k[/math] входного слоя это просто входные значения [math]x_k[/math] сети. Количество входных значений нейрона [math]n[/math]. Переменная [math]w_{kj}[/math] обозначает вес на ребре между нейроном [math]k[/math] предыдущего слоя и нейроном [math]j[/math] текущего слоя.

Функция активации [math]\varphi[/math] нелинейна и дифференцируема. Одна из распространенных функций активации — сигмоида:

у нее удобная производная:

Находим производную ошибки

Вычисление частной производной ошибки по весам [math]w_{ij}[/math] выполняется с помощью цепного правила:

Только одно слагаемое в [math]\text{net}_j[/math] зависит от [math]w_{ij}[/math], так что

Если нейрон в первом слое после входного, то [math]o_i[/math] это просто [math]x_i[/math].

Производная выходного значения нейрона [math]j[/math] по его входному значению это просто частная производная функции активации (предполагается что в качестве функции активации используется сигмоида):

По этой причине данный метод требует дифференцируемой функции активации. (Тем не менее, функция ReLU стала достаточно популярной в последнее время, хоть и не дифференцируема в 0)

Первый множитель легко вычислим, если нейрон находится в выходном слое, ведь в таком случае [math]o_j = y[/math] и

Тем не менее, если [math]j[/math] произвольный внутренний слой сети, нахождение производной [math]E[/math] по [math]o_j[/math] менее очевидно.

Если рассмотреть [math]E[/math] как функцию, берущую на вход все нейроны [math]L = {u, v, \dots, w}[/math] получающие на вход значение нейрона [math]j[/math],

и взять полную производную по [math]o_j[/math], то получим рекурсивное выражение для производной:

Следовательно, производная по [math]o_j[/math] может быть вычислена если все все производные по выходным значениям [math]o_\ell[/math] следующего слоя известны.

Если собрать все месте:

и

Чтобы обновить вес [math]w_{ij}[/math] используя градиентный спуск, нужно выбрать скорость обучения, [math]\eta \gt 0[/math]. Изменение в весах должно отражать влияние [math]E[/math] на увеличение или уменьшение в [math]w_{ij}[/math]. Если , увеличение [math]w_{ij}[/math] увеличивает [math]E[/math]; наоборот, если , увеличение [math]w_{ij}[/math] уменьшает [math]E[/math]. Новый [math]\Delta w_{ij}[/math] добавлен к старым весам, и произведение скорости обучения на градиент, умноженный на [math]-1[/math] гарантирует что [math]w_{ij}[/math] изменения будут всегда уменьшать [math]E[/math]. Другими словами, в следующем уравнении, всегда изменяет [math]w_{ij}[/math] в такую сторону, что [math]E[/math] уменьшается:

Недостатки алгоритма

Несмотря на многочисленные успешные применения обратного распространения, оно не является универсальным решением. Больше всего неприятностей приносит неопределённо долгий процесс обучения. В сложных задачах для обучения сети могут потребоваться дни или даже недели, она может и вообще не обучиться. Причиной может быть одна из описанных ниже.

Градиентный спуск может найти локальный минимум вместо глобального

Паралич сети

В процессе обучения сети значения весов могут в результате коррекции стать очень большими величинами. Это может привести к тому, что все или большинство нейронов будут функционировать при очень больших значениях OUT, в области, где производная сжимающей функции очень мала. Так как посылаемая обратно в процессе обучения ошибка пропорциональна этой производной, то процесс обучения может практически замереть.

Локальные минимумы

Градиентный спуск с обратным распространением ошибок гарантирует нахождение только локального минимума функции; также, возникают проблемы с пересечением плато на поверхности функции ошибки.

Алгоритм

Алгоритм: BackPropagation

Инициализировать [math]\{w_{ij}\}_{i,j} [/math] маленькими случайными значениями,
Повторить [math]steps[/math] раз:
.Для всех d от 1 до m:
1. Подать [math]\{x_i^d\}[/math] на вход сети и подсчитать выходы [math]o_i[/math] каждого узла.
2. Для всех [math]k \in Outputs[/math]
  .
3. Для каждого уровня l, начиная с предпоследнего:
  Для каждого узла j уровня l вычислить
  
  .
4. Для каждого ребра сети {i, j}
  .
  
  .
Выдать значения [math]w_{ij}[/math].

где [math]\alpha[/math] — коэффициент инерциальности для сглаживания резких скачков при перемещении по поверхности целевой функции

Заметки

↑ Обычно, многослойные нейронные сети используют нелинейные функции активации, линейные функции используются для упрощения понимания.
↑ Их может быть несколько, тогда ошибка это квадратичная норма вектора разницы.

См. также

Источники информации

[1] Обычно, многослойные нейронные сети используют нелинейные функции активации, линейные функции используются для упрощения понимания.

[2] Их может быть несколько, тогда ошибка это квадратичная норма вектора разницы.

[заметка 1]

[заметка 2]

Обратное распространение ошибки

Содержание

Обучение как задача оптимизации

Дифференцирование для однослойной сети

Находим производную ошибки

Недостатки алгоритма

Паралич сети

Локальные минимумы

Алгоритм

Заметки

См. также

Источники информации

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты