Применение обучения с подкреплением в исследовании игр в автобатлеры
Выполнил: Пономарев Тимур Евгеньевич
Автобаттлеры — класс стратегических игр с неполной информацией, стохастическими переходами состояний и комбинаторно обширным пространством действий, представляющий одну из открытых задач в области обучения с подкреплением (Reinforcement Learning, RL). Hearthstone Battlegrounds, насчитывающий свыше 20 миллионов активных игроков, объединяет экономическое планирование, позиционную расстановку юнитов и автоматизированную боевую фазу в единый POMDP с разреженными наградами. Несмотря на масштабность аудитории, задача обучения конкурентоспособного RL-агента для данной игры остаётся нерешённой: существующие академические работы используют упрощённые модели среды, не покрывающие ключевые механики (ауры, вложенные триггеры, Discovery).
В настоящей работе исследуется применимость Transformer-архитектуры с механизмом внимания для задач стратегического RL в автобаттлерах. Для проведения исследования был разработан headless-симулятор Hearthstone Battlegrounds с Gymnasium-интерфейсом, поддержкой Action Masking и полной реализацией боевой и экономической подсистем (свыше 3 500 строк на Python). На базе данной средыпроведён сравнительный эксперимент двух архитектур: классического MLP-baseline и исследовательского Transformer-экстрактора, интегрирующего DecomposedEncoder, FiLM-модуляцию, GTrXL-шлюзы и агрегацию Pooling by Multihead Attention.
Презентация (Пономарев)
Руководитель проекта

Нашли опечатку?
Выделите её, нажмите Ctrl+Enter и отправьте нам уведомление. Спасибо за участие!
Сервис предназначен только для отправки сообщений об орфографических и пунктуационных ошибках.
