Турнир по обучению с подкреплением: DDPG, SAC, PPO, I2A, Трансформатор решений

• Автор обучил имитированных роботов-гуманоидов для сражений с использованием пяти новых учебных пособий с подкреплением. • Использовался симулятор агентов машинного обучения Unity для создания тела робота с 21 приводом и RGB-видением. • Агенты получают вознаграждение за прикосновение меча к противнику, удержание головы в y-образном положении и приближение к противнику. • Обучение проводилось с использованием алгоритмов Q-Learning, DDPG, SAC, I2A и PPO. • DDPG использует схему "актер-критик" для обучения политики действий и критики ожидаемых вознаграждений. • I2A с PPO использует суррогатную целевую функцию и сокращенную целевую функцию для оптимизации обучения. • Агенты с воображением добавляют дополнительный вектор внедрения для моделирования будущих вариантов действий и оценок их вознаграждений. • Decision Transformer использует архитектуру transformer для обучения с подкреплением и выделения важных вознаграждений среди редких/отвлекающих действий.

читать материал полностью

Этот пост подготовила нейросеть: сделала выжимку статьи и, возможно, даже перевела ее с английского. А бот опубликовал пост в Сетке.