В Санкт-Петербургском государственном университете завершен первый этап исследования, посвященного улучшению интонационного оформления речи, генерируемой нейросетевыми моделями. О подходе и полученных результатах рассказала доцент кафедры фонетики и методики преподавания иностранных языков СПбГУ Ульяна Евгеньевна Кочеткова. Работа выполнялась в рамках магистерской диссертации студентки Анастасии Шербан и была сосредоточена не на создании новой архитектуры, а на подготовке обучающего материала.

«В первую очередь хочу сказать, что мы занимались и продолжаем заниматься этой темой именно как лингвисты. То есть мы не математики и не разработчики, мы в первую очередь лингвисты-фонетисты. Нашей целью было использовать одну из доступных готовых моделей, в данном случае это Tacotron 2, хотя это могла бы быть и другая модель», — сказала Ульяна Евгеньевна Кочеткова.

Ключевым элементом работы стал корпус, созданный на кафедре фонетики СПбГУ в 2000-х годах в рамках совместного проекта с Центром речевых технологий. Его отличительная особенность — экспертная интонационная аннотация, разработанная Ниной Борисовной Вольской и Павлом Анатольевичем Скрелиным. В разметке учитываются не только базовые коммуникативные типы (вопрос, повествование, незавершенность, восклицание), но и вставочные конструкции, а также эмоционально окрашенные варианты, которые преобразуют основные интонационные модели.

«Прелесть нашего корпуса заключается в том, что эта интонационная аннотация была сделана экспертами. То есть размечала не сеть, это была не автоматическая разметка, а экспертная разметка — это, в общем-то, попадание в десятку», — отметила Ульяна Евгеньевна Кочеткова.

Обучение модели Tacotron 2 на этом размеченном материале дало заметное улучшение интонационного оформления синтезированной речи. При оценке качества по стандартной метрике MOS (Mean Opinion Score), применяемой для большинства систем синтеза, исследователи получили результат 4,5–4,7 балла. Это высокий показатель, особенно с учетом ограниченного объема данных и того, что в эксперименте использовались записи только мужских голосов.

«Обучение на размеченном материале дало нам очень хороший результат, даже по сравнению с тем, что мы ожидали. Другое дело, маленький объем материала по сравнению с big data дает свои огрехи: какие-то неточности не столько в плане интонационного оформления, сколько в плане воспроизведения отдельных звуков», — пояснила Ульяна Евгеньевна Кочеткова.

Авторы работы подчеркивают, что большие данные, используемые крупными компаниями, отлично справляются с сегментным составом речи, но до сих пор не могут обеспечить столь же тонкое интонационное оформление. Причина, по мнению исследователей, кроется в том, что при синтезе и распознавании речи во многом применяются подходы из обработки изображений: мел-спектрограммы интерпретируются как картинки, а затем преобразуются в звук. Это позволяет достичь почти безошибочного воспроизведения отдельных звуков, но слабо улавливает статистически редкие, однако значимые интонационные тонкости.

«Big data сейчас решила огромное количество вопросов в самых разных сферах науки и человеческой деятельности, мы везде это видим. Но big data не всегда и не все вопросы решают, и где-то нам нужно очень внимательно посмотреть на то, что внутри материала есть», — сказала Ульяна Евгеньевна Кочеткова.

Исследователи рассматривают проделанную работу как пробный шаг. В дальнейшем планируется расширить эксперимент, включив в него эмоциональную окраску и стилистические варианты, а также привлечь новое поколение студентов магистерской программы Искусственный интеллект в моделировании речевой деятельности.

Новость подготовлена при поддержке Министерства науки и высшего образования РФ

Источник изображения: Magnific