Цитаты из книги Грокаем глубокое обучение с подкреплениемавтор Мигель Моралес
представляю время, когда мы будем для роботов тем же, чем сейчас собаки являются для людей, и болею за машины.
4 Нравится
Она лежит в основе так называемой временной задачи присваивания коэффициентов доверия — в определении того, какое состояние и/или действие привело к получению вознаграждения. Когда у задачи есть временная составляющая, а у действия — отложенные последствия, наградам сложно присвоить коэффициенты доверия.
1 Нравится
Задача, которую пытается выполнить агент, может иметь естественное завершение или не иметь его. Задачи с естественным завершением, такие как игры, называются эпизодическими, а без него, такие как обучение движению вперед, — непрерывными. Последовательность временных шагов от начала до завершения эпизодической задачи называется эпизодом. Чтобы научиться выполнять задачу, агенту может понадобиться несколько временных шагов и эпизодов. Агенты обучаются методом проб и ошибок: они пытаются что-то сделать, наблюдают результат, делают вывод, пробуют что-то другое и т.д.
Взаимодействие между агентом и средой продолжается несколько циклов — временных шагов. На каждом временном шаге агент наблюдает за средой, выполняет действие и получает новое наблюдение и награду. Совокупность состояния, действия, награды и нового состояния называется опытом. Любой опыт открывает возможность для обучения и улучшения производительности.
Обычно у среды есть четко определенная задача, которая формируется через функцию вознаграждения. Сигналы этой функции могут быть одновременно последовательными, оценочными и выборочными. Для достижения поставленной цели агент должен продемонстрировать интеллект или хотя бы когнитивные способности, связанные с ним: долгосрочное мышление, сбор информации и обобщение.
Работа агента проходит в три этапа: взаимодействие со средой, оценка ее поведения и улучшение ответов. Агент может быть предназначен для изучения связей между наблюдениями и действиями (такие связи называют правилами или стратегиями) или для изучения влияния модели среды. А с помощью функций ценности его можно научить оценивать и будущее вознаграждение.
В каждом состоянии среда предоставляет агенту набор действий, выполнив которые он может повлиять на нее. В ответ на действия агента среда может менять состояния. За эту связь отвечает функция перехода. Среда может возвращать и сигнал вознаграждения. За эту связь отвечает функция вознаграждения. Совокупность этих двух функций называется моделью среды.
У каждого объекта есть определенное местоположение, но агенту ничего не известно об этой конкретной части состояния. Вместо этого он воспринимает основанные на состояниях наблюдения. В научной литературе, в том числе и в этой книге, наблюдения и состояния часто используются как синонимы. Заранее прошу прощения за такую непоследовательность. Просто помните о различиях и делайте поправку на лексику — это главное.
у агентов обычно нет доступа ко всему состоянию среды. Та часть состояния, которую агент может наблюдать, называется наблюдением. Наблюдения зависят от состояний, но представляют собой то, что может видеть агент.
Переменные и все их возможные значения называют пространством состояний, где состояние — это отдельный экземпляр, набор значений, которые принимают переменные.
