• A
  • A
  • A
  • АБВ
  • АБВ
  • АБВ
  • А
  • А
  • А
  • А
  • А
Обычная версия сайта

Методы генерации синтетических текстовых датасетов для обучения моделей понимания команд Голосовым Ассистентом

Выполнил: Нижанковский Илья Романович

В данной курсовой работе рассматривается процесс генерации синтетических текстовых данных для формирования обучающего датасета голосового помощника водителя в автомобиле. Актуальность работы обусловлена тем, что на практике исследователи и разработчики регулярно сталкиваются с дефицитом релевантных данных и необходимостью их трудоёмкой подготовки, при этом качество доступных данных нередко не удовлетворяет требованиям обучения, что напрямую отражается на качестве моделей.

Основное содержание работы связано с построением пайплайна генерации данных через API OpenAI с последующей подготовкой датасета данных в виде примеров общения водителя с автомобильным голосовым помощником. В рамках проекта формируется набор из n классов (интентов) голосового помощника и синтетически генерируются фразы и параметры, имитирующие пользовательские запросы.

Большое внимание уделяется проверке корректности полученных данных: выполняется валидация структуры и согласованности между текстом запроса, назначенным интентом и набором параметров, а также разнообразию генерируемых данных, что необходимо для дальнейшего использования датасета при обучении. Синтетическая генерация рассматривается как способ восполнения недостатка текстовых данных или их полного восстановления под задачу.

После завершения генерации появится возможность для дальнейшей работы по дообучению многоклассового классификатора на сформированном синтетическом датасете с использованием методов LoRA и SFT, что позволит оценить качество данных через итоговые результаты обучения и сделать вывод о целесообразности выбранного подхода.

Руководитель проекта:

Потапов Иван Андреевич


 

Нашли опечатку?
Выделите её, нажмите Ctrl+Enter и отправьте нам уведомление. Спасибо за участие!
Сервис предназначен только для отправки сообщений об орфографических и пунктуационных ошибках.