чтобы уменьшить склонность сети выполнять эти действия. Одним из самых впечатляющих достижений обучения с подкреплением стала победа AlphaGo от DeepMind над прославленным чемпионом мира по го, которая потрясла весь мир. Го считается игрой, которая требует глубокой интуиции, а число возможных позиций в игре настолько огромно, что их невозможно перебрать полностью. Поэтому долгое время считалось, что компьютер никогда не сможет освоить эту игру. И все же AlphaGo справился. Причем без обучения набору стратегий или принципов – он учился методом обучения с подкреплением, играя бесчисленное количество партий сам с собой. AlphaGo использовал сети с оптимизированной политикой в сочетании с сетью, обученной оценивать ценность различных позиций на доске (где ценность – это вероятность того, что дальнейшие ходы из данной позиции приведут к победе). Во время игры сети политики генерировали варианты последовательностей ходов, а сети ценности оценивали получавшиеся позиции, определяя лучший вариант. Следующим ходом становилось просто первое действие из последовательности с наивысшей оценкой. Другой интересный пример использования обучения с подкреплением – тонкая настройка ответов LLM (глава 8). Предсказывая следующее слово, LLM иногда может выдать нежелательное ругательство (поскольку ненормативная лексика присутствует в обучающих данных). Чтобы этого избежать, LLM дополнительно настраивают алгоритмом обучения с подкреплением, который штрафует за генерацию ненормативной лексики или другого нежелательного контента. LLM генерирует несколько вариантов ответов, которые затем оценивает отдельная нейронная сеть, обученная распознавать неподобающие выражения. Ответы LLM с нежелательными словами получают меньшее вознаграждение, что побуждает модель избегать такой лексики в будущем. После множества итераций модель учится создавать ответы, максимизирующие вознаграждение за счет исключения ненормативной лексики и других нежелательных элементов. Несмотря на эти успехи, обучение с подкреплением на основе обратного распространения имеет серьезные ограничения. Дело в том, что такие системы вынуждены усреднять свой опыт по огромному количеству последовательностей действий, чтобы определить, какие именно действия в последовательности оказались решающими для результата. Если робот добрался до награды после 1000 действий, какие из них заслуживают большего доверия? Или наоборот: если робот постоянно попадал в тупики после 1000 действий, какие из них в первую очередь были тому причиной? Распределение