Акции школ
Войти

Курс «Reinforcement Learning»

Составитель: Денис Сметнёв · Обновлено: 05.08.2024

Reinforcement Learning стоит особняком среди разделов машинного обучения: здесь агент не учится по размеченным данным, а ищет стратегию через взаимодействие со средой и сигналы награды. На этом принципе работают игровые ИИ, автономные агенты, торговые системы и управление роботами. Курс OTUS рассчитан на тех, кто уже работает с ML и хочет углубиться именно в RL. За шесть месяцев программа проходит основные алгоритмы и подводит к реальным задачам, а не останавливается на вводной теории.

Подробнее


Компания: OTUS (Отус)

Уровень: Средний Длительность: 6 месяцев Формат: Онлайн
Почему мы рекомендуем: актуальные данные курса — оценка по нашей методике (рейтинг, цена, трудоустройство, диплом)

Актуальная программа курса (29 модулей, по данным школы)

  1. Модуль 1. Введение в Reinforcement Learning — Модуль начинается с общего введения, охватывает ключевые особенности обучения с подкреплением, основные алгоритмы. Вы рассмотрите, как построить модель окружения и агента, и примените свои знания на простых сценариях.
  2. • Знакомство с Reinforcement Learning
  3. • Ключевые понятия RL: агент, среда, награда, политика. Построение среды
  4. • Основные алгоритмы RL: Value based
  5. • Основные алгоритмы RL: Policy based
  6. Модуль 2. Deep Reinforcement Learning — В этом модуле вы рассмотрите введение в глубокое обучение с подкреплением, которое объясняет значимость глубоких Q-сетей, представляет алгоритмы на основе политик. Затем объединяет методы на основе политик и значений с использованием алгоритма Actor-Critic. И, наконец, охватывает то, как нейронные сети могут использоваться для аппроксимации функций вознаграждения и политик.
  7. • Введение в Deep Reinforcement Learning
  8. • Deep Q-Network (DQN) алгоритм
  9. • Deep Policy Gradient (PG) алгоритм
  10. • Actor-Critic алгоритм
  11. • TRPO -> PPO
  12. • DDPG -> TD3 -> LSTM-TD3
  13. Модуль 3. Advanced Reinforcement Learning — Модуль содержит более сложные темы и глубже раскрывает пройденный материал. Здесь рассматривается применение алгоритмов к более сложным ситуациям, например наличие фиксированных правил (model-based) или взаимодействие нескольких агентов между собой для достижения общей темы.
  14. • Обучение с использованием модели среды (model-based rl)
  15. • Model-based, часть 2
  16. • Иерархическое обучение с подкреплением
  17. • Выбор темы и организация проектной работы
  18. • Многоагентное обучение и кооперация агентов
  19. • Трансформеры в RL: decision transformers и action transformers
  20. Модуль 4. Применение RL в реальных задачах — Модуль посвящен обзору практических примеров применения RL. Вы познакомитесь с игровой индустрией и рассмотрите какие задачи здесь можно решать с помощью RL. Поговорите о робототехнике, поймете какое применение RL находит в рекомендательных системах и более подробно рассмотрите финансовые модели на примере задачи балансировки портфеля активов и задачи кредитного скоринга.
  21. • Применение RL в игровой индустрии
  22. • Применение RL в робототехнике
  23. • RL в рекомендательных системах
  24. • RL в задаче скоринга
  25. • Применение RL в управлении финансовым портфелем

Сколько зарабатывают в профессии (медиана hh.ru, по 141 вакансиям)

Junior
110 000 ₽
Middle
205 000 ₽
Senior
261 000 ₽

Окупаемость: стоимость курса ≈ 1 мес зарплаты junior-специалиста.

Сравнение с похожими курсами других школ

КурсШколаЦенаСрокРейтингДиплом
Reinforcement Learning (этот) OTUS (Отус) — 6 месяцев — — —
Кибербезопасность и приложения на Python GeekBrains (ГикБреинс) — 8 месяцев 5.0 — Перейти
Python-разработчик GeekBrains (ГикБреинс) — 9 месяцев 3.9 Сертификат Перейти
Приложение на Python с веб-интерфейсом на Flask. GeekBrains (ГикБреинс) беспл. — 1.0 Сертификат Перейти

Стоит ли идти на этот курс

Плюсы

  • Шесть месяцев под RL — реалистичный срок: алгоритмов много (Q-learning, policy gradient, PPO, DQN), и каждый требует времени на практическое освоение.
  • Курс заявлен для среднего уровня, значит, программа не тратит время на линейную регрессию и азы Python — стартует с предположением, что базовый ML у вас уже есть.
  • Полноценных русскоязычных программ именно по RL мало: это узкая специализация внутри Data Science, и предложение на рынке ограничено.

Минусы и кому не стоит

  • Трудоустройство в программу не включено: карьерного сопровождения OTUS по этому курсу не заявляет.
  • Перед оплатой стоит выяснить на странице курса, предусмотрена ли живая обратная связь по проектам, а не только видеолекции.
  • Порог входа реальный: без опыта в ML и Python программа будет тяжёлой, и вероятность дойти до конца заметно снижается.

Когда этот курс вам не нужен

Если вы уже работаете с RL на практике и знакомы с основными подходами — PPO, DQN, A3C — программа вряд ли даст много нового: она рассчитана на вход в тему, не на продвинутый уровень. Не стоит идти сюда и с целью быстро сменить профессию: без базы в ML и готовности к шести месяцам реальной нагрузки результата не будет. Если нужна помощь с трудоустройством, ищите программы с явным блоком карьерного сопровождения — в этом курсе его нет.

Как выбрать курс по этому направлению

При выборе курса по RL смотрите прежде всего на то, как устроена практика: хороший курс разбирает реальные среды (Gym, MuJoCo) с работающим кодом, а не ограничивается лекциями про Q-learning. Проверьте, есть ли проектная работа и кто её проверяет: живой ревьюер даёт обратную связь, автотест — нет. Шесть месяцев для среднего уровня — реалистичный срок: RL математически насыщен, и торопиться здесь не получится. Цены на такие программы на русскоязычном рынке разбросаны широко; ориентируйтесь не на дешевизну, а на наличие живой обратной связи по проектам.

Частые вопросы

Можно ли пройти курс без опыта в машинном обучении?

Нет. Курс рассчитан на средний уровень: базовые знания ML и Python нужны до старта. Если с моделями вы ещё не работали, лучше сначала пройти вводный курс по Data Science и вернуться к RL с нормальной базой.

Сколько времени в неделю нужно уделять учёбе?

Для шестимесячного курса среднего уровня реалистичная нагрузка — от 8 до 12 часов в неделю. RL требует времени на эксперименты с кодом: пассивного просмотра лекций здесь мало.

Выдают ли документ об окончании?

В открытых данных по этому курсу информации о документе нет. Проверьте этот момент на странице курса на сайте OTUS до принятия решения.

Что такое обучение с подкреплением и зачем оно нужно?

RL — класс алгоритмов, где агент учится принимать решения через взаимодействие со средой и получение наград. Применяется в робототехнике, игровом ИИ, торговых системах, системах рекомендаций. Это отдельная от классического ML область, математически насыщенная.

Можно ли совмещать курс с работой?

Шесть месяцев позволяют распределить нагрузку. Но если рабочий день занимает больше девяти-десяти часов, темп может быть некомфортным: RL требует времени на эксперименты, и без этого материал не закрепится.

Как понять, что я готов к этому курсу?

Ориентир: вы уже обучали модели (хотя бы классификацию или регрессию), понимаете градиентный спуск, пишете на Python без словаря. Если что-то из этого пока вызывает затруднения — сначала закройте эти пробелы.

Компания, проводящая курс

OTUS (Отус)

222 курса по 861 теме

Образовательная онлайн-платформа и сообщество IT-профессионалов OTUS (Отус) работает с 2017 года. Компания является резидентом Сколково....

Преподаватели курса

ИС
(к.ф.-м.н.) Teamlead, главный инженер, FinTech

Более 15 лет занимался прикладной математикой и мат....

АК
Senior Data Scientist, Самолет

Занимался задачами с использованием как...

СД
Ведущий инженер-программист, ЗАО Астраханские Цифровые Технологии

На текущем месте работы ускорил выгрузку из SQL в 6 раз...

АК
CEO и соотнователь IT компании, kapralov.ai

8+ лет разработки в сфере ИИ. Люблю сложные, творческие...

Отзывов об этом курсе пока нет

Ниже — отзывы о школе OTUS (Отус): они помогут составить впечатление, но в рейтинге курса не учитываются. Проходили этот курс? Поделитесь — это поможет другим студентам.

больше курсов

Похожие курсы компании

OTUS (Отус)
(0)
OTUS (Отус)
(0)
149 600 ₽
OTUS (Отус)
(0)
106 500 ₽
OTUS (Отус)
(0)
85 000 ₽
OTUS (Отус)
(0)
85 000 ₽
OTUS (Отус)
(0)
50 000 ₽
OTUS (Отус)
(0)
больше курсов

Другие курсы этих преподавателей

OTUS (Отус)
(3)
OTUS (Отус)
(0)
OTUS (Отус)
(0)
125 000 ₽
OTUS (Отус)
(0)
OTUS (Отус)
(0)
198 500 ₽
OTUS (Отус)
(0)
78 750 ₽