Грокаем глубокое обучение с подкреплением
В приложении удобнееQR для скачивания приложенияRuStore · Samsung Galaxy Store
Huawei AppGallery · Xiaomi GetApps

Цитаты из книги  Грокаем глубокое обучение с подкреплением

представляю время, когда мы будем для роботов тем же, чем сейчас собаки являются для людей, и болею за машины.
4 Нравится
Комментировать
Она лежит в основе так называемой временной задачи присваивания коэффициентов доверия — в определении того, какое состояние и/или действие привело к получению вознаграждения. Когда у задачи есть временная составляющая, а у действия — отложенные последствия, наградам сложно присвоить коэффициенты доверия.
1 Нравится
Комментировать
Задача, которую пытается выполнить агент, может иметь естественное завершение или не иметь его. Задачи с естественным завершением, такие как игры, называются эпизодическими, а без него, такие как обучение движению вперед, — непрерывными. Последовательность временных шагов от начала до завершения эпизодической задачи называется эпизодом. Чтобы научиться выполнять задачу, агенту может понадобиться несколько временных шагов и эпизодов. Агенты обучаются методом проб и ошибок: они пытаются что-то сделать, наблюдают результат, делают вывод, пробуют что-то другое и т.д.
Комментировать
Взаимодействие между агентом и средой продолжается несколько циклов — временных шагов. На каждом временном шаге агент наблюдает за средой, выполняет действие и получает новое наблюдение и награду. Совокупность состояния, действия, награды и нового состояния называется опытом. Любой опыт открывает возможность для обучения и улучшения производительности.
Комментировать
Обычно у среды есть четко определенная задача, которая формируется через функцию вознаграждения. Сигналы этой функции могут быть одновременно последовательными, оценочными и выборочными. Для достижения поставленной цели агент должен продемонстрировать интеллект или хотя бы когнитивные способности, связанные с ним: долгосрочное мышление, сбор информации и обобщение.
Комментировать
Работа агента проходит в три этапа: взаимодействие со средой, оценка ее поведения и улучшение ответов. Агент может быть предназначен для изучения связей между наблюдениями и действиями (такие связи называют правилами или стратегиями) или для изучения влияния модели среды. А с помощью функций ценности его можно научить оценивать и будущее вознаграждение.
Комментировать
В каждом состоянии среда предоставляет агенту набор действий, выполнив которые он может повлиять на нее. В ответ на действия агента среда может менять состояния. За эту связь отвечает функция перехода. Среда может возвращать и сигнал вознаграждения. За эту связь отвечает функция вознаграждения. Совокупность этих двух функций называется моделью среды.
Комментировать
У каждого объекта есть определенное местоположение, но агенту ничего не известно об этой конкретной части состояния. Вместо этого он воспринимает основанные на состояниях наблюдения. В научной литературе, в том числе и в этой книге, наблюдения и состояния часто используются как синонимы. Заранее прошу прощения за такую непоследовательность. Просто помните о различиях и делайте поправку на лексику — это главное.
Комментировать
у агентов обычно нет доступа ко всему состоянию среды. Та часть состояния, которую агент может наблюдать, называется наблюдением. Наблюдения зависят от состояний, но представляют собой то, что может видеть агент.
Комментировать
Переменные и все их возможные значения называют пространством состояний, где состояние — это отдельный экземпляр, набор значений, которые принимают переменные.
Комментировать