Епізоди та Винагороди
Свайпніть щоб показати меню
Тривалість завдання
Завдання у навчанні з підкріпленням (RL) зазвичай класифікуються як епізодичні або безперервні, залежно від того, як організовано процес навчання у часі.
Епізод — це повна послідовність взаємодій між агентом і середовищем, яка починається з початкового стану і проходить через серію переходів до досягнення термінального стану.
Епізодичні задачі — це задачі, що складаються з скінченної послідовності станів, дій і винагород, де взаємодія агента з середовищем поділяється на окремі епізоди.
На відміну від них, безперервні задачі не мають чіткого завершення кожного циклу взаємодії. Агент постійно взаємодіє із середовищем без повернення до початкового стану, а процес навчання триває, часто без визначеної кінцевої точки.
Віддача
Ви вже знаєте, що основна мета агента — максимізувати накопичені винагороди. Хоча функція винагороди надає миттєві винагороди, вона не враховує майбутні результати, що може бути проблематичним. Агент, навчений максимізувати лише негайні винагороди, може ігнорувати довгострокові переваги. Щоб вирішити цю проблему, введемо поняття повернення.
Повернення G — це загальна накопичена винагорода, яку агент отримує, починаючи з певного стану, і яка включає всі винагороди, які він отримає в майбутньому, а не лише негайно.
Повернення є кращою характеристикою того, наскільки хороший певний стан або дія у довгостроковій перспективі. Мета навчання з підкріпленням тепер може бути визначена як максимізація повернення.
Якщо T — це фінальний часовий крок, формула повернення виглядає так:
Gt=Rt+1+Rt+2+Rt+3+...+RTДисконтоване повернення
Хоча просте повернення є хорошою ціллю для епізодичних задач, у безперервних задачах виникає проблема. Якщо кількість часових кроків є нескінченною, саме повернення може стати нескінченним. Щоб уникнути цього, використовується дисконтуючий фактор, який зменшує вагу майбутніх винагород, запобігаючи нескінченності повернення.
Коефіцієнт дисконтування γ — це мультиплікативний коефіцієнт, який використовується для визначення поточної вартості майбутніх винагород. Його значення знаходиться в межах від 0 до 1: значення, ближче до 0, змушує агента надавати перевагу негайним винагородам, тоді як значення, ближче до 1, змушує агента більше враховувати майбутні винагороди.
Повернення у поєднанні з коефіцієнтом дисконтування називається дисконтованим поверненням.
Формула дисконтованого повернення виглядає так:
Gt=Rt+1+γRt+2+γ2Rt+3+...=k=0∑∞γkRt+k+1Навіть у епізодичних завданнях використання коефіцієнта дисконтування має практичні переваги: це мотивує агента досягати мети якомога швидше, що призводить до більш ефективної поведінки. З цієї причини дисконтування часто застосовується навіть у явно епізодичних сценаріях.
Дякуємо за ваш відгук!
Запитати АІ
Запитати АІ
Запитайте про що завгодно або спробуйте одне із запропонованих запитань, щоб почати наш чат