• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта

Применение обучения с подкреплением в исследовании игр в автобатлеры

Выполнил: Пономарев Тимур Евгеньевич

Автобаттлеры — класс стратегических игр с неполной информацией, стохастическими переходами состояний и комбинаторно обширным пространством действий, представляющий одну из открытых задач в области обучения с подкреплением (Reinforcement Learning, RL). Hearthstone Battlegrounds, насчитывающий свыше 20 миллионов активных игроков, объединяет экономическое планирование, позиционную расстановку юнитов и автоматизированную боевую фазу в единый POMDP с разреженными наградами. Несмотря на масштабность аудитории, задача обучения конкурентоспособного RL-агента для данной игры остаётся нерешённой: существующие академические работы используют упрощённые модели среды, не покрывающие ключевые механики (ауры, вложенные триггеры, Discovery).

В настоящей работе исследуется применимость Transformer-архитектуры с механизмом внимания для задач стратегического RL в автобаттлерах. Для проведения исследования был разработан headless-симулятор Hearthstone Battlegrounds с Gymnasium-интерфейсом, поддержкой Action Masking и полной реализацией боевой и экономической подсистем (свыше 3 500 строк на Python). На базе данной средыпроведён сравнительный эксперимент двух архитектур: классического MLP-baseline и исследовательского Transformer-экстрактора, интегрирующего DecomposedEncoder, FiLM-модуляцию, GTrXL-шлюзы и агрегацию Pooling by Multihead Attention.

Руководитель проекта

Кудеров Петр Викторович


 

Нашли опечатку?
Выделите её, нажмите Ctrl+Enter и отправьте нам уведомление. Спасибо за участие!
Сервис предназначен только для отправки сообщений об орфографических и пунктуационных ошибках.