• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта

О методологии off-policy оценки в больших пространствах действия

Выполнила: Коровайцева Дарья Алексеевна

Контекстуальные бандиты являются популярными статистическими моделями, которые повсеметсно используются в рекомендательных системах и других областях компьютерных наук. Они описывают стохастический процесс, в котором агент взаимодействует с некоторой средой, выбирая действия в соответствии с определённой политикой и получая соответствующие вознаграждения. Однако практическое применение таких алгоритмов порождает важную задачу Off-Policy Evaluation — оценки эффективности одной политики, используя только логи, собранные другой политикой, чтобы избежать ресурсозатратных A/B-тестов. За последнее десятилетие было предложено множество различных оценок, решающих данную задачу, тем не менее, большинство из них неприменимы к средам с большим пространством действий — типичной ситуации для реальных рекомендательных систем. Ещё одной проблемой является отсутствие единого алгоритма оценивания, сравнения и выбора оценок, что делает невозможным для практиков корректное сравнение различных методов и выбор наилучшего из них в конкретной ситуации. Данная работа анализирует существующие OPE-оценки, сравнивает и улучшает их, параллельно исследуя различные методы для их оценивания.

Защита

Руководитель проекта

Самсонов Сергей Владимирович

Базовая кафедра Института проблем передачи информации им. А.А. Харкевича РАН: Доцент


 

Нашли опечатку?
Выделите её, нажмите Ctrl+Enter и отправьте нам уведомление. Спасибо за участие!
Сервис предназначен только для отправки сообщений об орфографических и пунктуационных ошибках.