Часть III Знание и обучение – все это в связях
Страница 172 из 223
Настройки чтения
18px
1.8
1

Часть III Знание и обучение – все это в связях

Страница 172
система с RL экспериментирует со множеством последовательностей действий. Она фиксирует вознаграждение, которое получает (или не получает) в конце каждой последовательности. Действия в успешных последовательностях подкрепляются, а в неуспешных – ослабляются. В отличие от обучения с коррекцией ошибок, здесь нет обучающего набора «правильных» действий, с которым система должна сверяться. Единственная обратная связь – это величина полученного вознаграждения. Важно понимать: принципиальное различие между RL и обучением с коррекцией ошибок заключается не в алгоритме обучения, а в обучающем сигнале. В RL мы настраиваем связи для максимизации вознаграждения, а не для уменьшения ошибки. Чтобы понять принцип работы обучения с подкреплением, представим робота в сложном лабиринте со множеством путей и тупиков. В одной точке лабиринта робот получает сигнал вознаграждения – положительный или отрицательный. Попадание в тупик приносит небольшое отрицательное вознаграждение. Робот может начинать из любой точки лабиринта – это его состояние . Из каждого состояния он может выполнить одно из четырех действий: двигаться вперед, назад, влево или вправо. Выполняя действие, он меняет свое состояние. Роботу нужно научиться выбирать действие из любого состояния так, чтобы максимизировать вознаграждение. Такое соответствие между состояниями и действиями называется политикой . Робот с хорошей политикой быстро находит доступные вознаграждения, в отличие от робота с менее оптимальной политикой. Существует множество вариантов обучения с подкреплением, применимых к задаче робота в лабиринте, но мы рассмотрим подход под названием оптимизация политики . Он использует информацию о результатах в полном соответствии с основной идеей закона эффекта. В простейшем варианте оптимизация политики применяет обратное распространение для обучения сети: она усиливает склонность выполнять все действия из последовательности, которая привела к успеху, и ослабляет склонность выполнять действия из неудачной последовательности. Применительно к нашему роботу: мы помещаем его в случайную точку лабиринта и позволяем случайно выбирать действия, пока он не достигнет награды или тупика. Если робот добрался до награды, мы рассматриваем каждое его действие в каждом состоянии как целевое и обучаем сеть методом обратного распространения, усиливая склонность выполнять эти действия из соответствующих состояний. Если же робот попал в тупик, мы рассматриваем каждый его шаг как ошибочный и используем обратное распространение,
назадназад
1 ... 170 171 172 173 174 ... 223
впередвперед