Ученые факультета вычислительной математики и кибернетики МГУ разработали метод, позволяющий выявлять ошибки в размеченных текстах, используемых для обучения систем обработки языка.
Такие тексты представляют собой специальные корпуса, в которых для каждого предложения заранее указана его структура. Они используются при создании систем автоматического анализа языка, поэтому точность их разметки имеет ключевое значение.
В работе предложен подход, при котором на основе корпуса автоматически строится модель, способная воспроизводить его структуру. Если для одного и того же предложения система находит несколько вариантов разбора, это может указывать на возможные ошибки или неоднозначности в исходной разметке.
«Мы предложили способ, который позволяет автоматически находить потенциальные несоответствия в разметке и тем самым помогать экспертам быстрее их обнаруживать. Метод был протестирован на корпусе СинТагРус. В подмножестве из 8199 предложений система выявила 1148 случаев, где возможно несколько вариантов разбора. В большинстве из них — 1078 предложений — различия были связаны с разметкой запятых», — отметил доцент кафедры алгоритмических языков факультета ВМК МГУ Игорь Головин.
Разработанный инструмент не заменяет работу эксперта, но позволяет существенно сократить время анализа и сосредоточиться на наиболее проблемных местах в корпусе.
Подобные решения могут использоваться при подготовке языковых данных для систем искусственного интеллекта, где качество разметки напрямую влияет на точность моделей.
Результаты работы были представлены на научной конференции «Ломоносовские чтения».
Информация предоставлена пресс-службой МГУ
Источник фото: armmypicca / ru.123rf.com




















