Создание языкового корпуса — одна из первоочередных задач в деле сохранения исчезающих языков. Это кропотливый труд над текстами и выезды в полевые экспедиции, где лингвисты напрямую общаются с носителями и записывают данные. Какие новые инструменты создаются для оптимизации этого процесса? И как быть, когда носителей языка почти не осталось, а письменных источников — единицы? Обо всем этом корреспондент «Научной России» беседует с Павлом Гращенковым — доктором филологических наук, научным руководителем проекта по цифровизации данных нивхского языка.
Справка: Павел Валерьевич Гращенков — российский лингвист, доктор филологических наук, заведующий лабораторией автоматизированных лексикографических систем Научно-исследовательского вычислительного центра (НИВЦ), доцент кафедры теоретической и прикладной лингвистики филологического факультета МГУ им. М.В. Ломоносова, руководит проектами по созданию корпусов языков коренных народов России, в частности, нивхского языка.
— Что такое языковой корпус и какую роль он играет в сохранении малых языков?
— Корпус — это способ хранения структурированных данных о языке. Если мы говорим о малых языках, то под языковым корпусом, как правило, подразумевается корпус с морфологической разметкой. Он представляет собой отдельные предложения, внутри которых слова размечены по падежам, числам, видам (если это глагол), временам и другим грамматическим категориям.
Но вообще существует много разных типов корпусов. Например, национальный корпус русского языка огромен, в нем много подкорпусов с разными типами размеченных данных. Помимо морфологической, синтаксической и семантической разметки, есть параллельные корпуса, в которых текст сопоставляется с переводом на другой язык. В случае с малыми языками работа обычно ограничивается разметкой грамматических категорий, падежей, времен и лиц. С другой стороны, функционал того корпуса, который мы разрабатываем, позволяет нам добавить синтаксическую и социолингвистическую разметку.
Зачем вообще нужен языковой корпус? К сожалению, многие языки исчезают. Это результат глобализации как в нашей стране, так и во всем мире. Все правовые и социальные нормы, вокруг которых строится наше общество, как и система образования, опираются в основном на русский язык. Владение им становится необходимым условием жизни в России. С одной стороны, это закономерный процесс, но с другой — малые языки в результате этого постепенно угасают. Мы сейчас наиболее плотно занимаемся нивхским языком. Согласно переписи населения, в России живут около 5 тыс. нивхов, но на родном языке говорят всего несколько десятков носителей. Все они уже пожилые люди, им больше 80 лет. Аналогичная ситуация наблюдается у носителей селькупского, кетского и других языков Сибири. Индустриализация и новый уклад жизни с общероссийскими социальными нормами и образованием привели к вынужденному обучению детей в интернатах. И сегодня нивхский язык сохраняется только у поколения, освоившего его с родителями до семилетнего возраста, перед тем как попасть в интернат в русскоязычное окружение. А дальше передача языка в семье потерялась.
Часто спрашивают: зачем сохранять малые языки? Есть ли в них что-то, чего нельзя выразить на русском языке? Во-первых, сохранять народные традиции важно для каждого этноса, проживающего на территории России. Во-вторых, не менее значим научный аспект, потому что при утрате языка мы теряем критически важные для лингвистики данные. Тот же нивхский язык исключительно интересен по множеству параметров. В тот момент, когда на нем перестанут говорить, наука потеряет доступ к уникальным данным. Поэтому чем больше текстов мы сейчас запишем и переведем в структурированный корпусный формат, тем больше мы сохраним информации о нивхском и других малых языках. И если этих данных будет достаточное количество, то появится надежда на ревитализацию, то есть возрождение языка. Тем более что нивхи — большие энтузиасты в вопросе сохранения культуры и до сих пор очень бережно соблюдают традиции, насколько это возможно в современной реальности. Но чтобы помочь сохранить язык, нужны дополнительные ресурсы, которые нам сейчас дает искусственный интеллект. Я говорю прежде всего о создании языковых ассистентов. У нас есть такие проекты, но для их реализации нужно собрать еще много данных.
Павел Гращенков
— Как создаются корпуса текстов для малых языков, если учитывать небогатые письменные традиции и малое количество носителей?
— Сбор данных ведется по стандартной методике, но есть и другой инструмент — использование корпусов. Кому и зачем они нужны? В основном ими пользуются лингвисты, но в последние десятилетия ситуация меняется. Помимо Национального корпуса русского языка и смежных проектов, создаются специализированные ресурсы, в том числе параллельные корпуса, разработкой которых активно занимается, например, Институт языкознания РАН. К использованию корпусов пытаются привлечь не только лингвистов, но и учителей. Это правильно, потому что далеко не все нивхские учителя владеют родным языком, — между тем для его сохранения очень важно, чтобы ученики могли слышать речь носителей. И для этого нужно, чтобы учителя тоже умели обращаться с языковыми корпусами. Сбор корпуса — это огромный труд. В случае с малыми языками используются двуязычные корпуса, то есть фраза, например, на нивхском языке сопровождается переводом на русский. Для этого нужно сначала собрать весь материал, который есть на нивхском, и сделать разметку. После этого его можно представить в виде структуры и снабдить русским литературным переводом каждого предложения. Это длительная, кропотливая работа, которую некоторые лингвисты выполняют прямо в полевых условиях, а некоторые — разбирая тексты из книг. Такая деятельность предполагает многократную перепроверку разметки и должна сопровождаться взаимодействием с носителями языка. После того как текст разобран, мы показываем его носителю и спрашиваем, правильно ли мы его поняли. При работе с такими языками, как нивхский, сложности возникают именно с этой последней стадией. Мы собрали большое количество данных: некоторые из них мы нашли в интернете, в чем-то нам помогли хорошие друзья из библиотеки нивхского поселка Ноглики. Но, увы, пока у нас нет возможности вернуться на Сахалин и поработать с носителями. Надеемся, однажды это получится.
— В прошлом интервью для нашего портала вы говорили, что корпус нивхского языка нужно еще расширять. Удалось ли продвинуться в этом направлении?
— До конца этого года мы должны набрать 10 тыс. слов с полноценной разметкой. На данный момент обработано 8 тыс. слов и еще несколько текстов. Предыдущий корпус, созданный нашими коллегами на основе других текстов, составил 5 тыс. слов, а если считать неразмеченный или полуразмеченный формат — порядка 20 тыс. слов. То есть наш размеченный корпус получился даже чуть больше.
Мы бы не хотели на этом останавливаться, но все упирается в финансирование. Мы получили небольшой грант и, надеюсь, сможем и дальше продолжать эту работу, у нас еще много неразобранных текстов. Другой вопрос: кто будет этим заниматься? Сейчас вся работа ведется силами четырех сотрудников НИВЦ.
— Можно ли рассказать о результатах работы по другим малым языкам?
— Наше главное достижение — то, что мы в принципе придумали, как преобразовать малые языки в корпусный формат. Эта технология была отлично отработана с нивхским языком, и я надеюсь, что нам удастся поставить ее на рельсы. Как мы знаем, малых языков в России достаточно много. В частности, сотрудники нашей лаборатории занимались хваршинским языком. Недавно вышла книга Екатерины Анатольевны Лютиковой и Лады Игоревны Паско, представляющая собой введение в цезские языки (это группа языков Дагестана). Там как раз были описаны данные по хваршинскому и другим языкам цезской группы. Надеюсь, мы однажды запустим конвейер по созданию корпусов для этих языков.
Кроме дагестанских языков, мечтаю о работе с караимским языком, тем более что у нас есть хороший контакт с караимами. Это довольно необычный тюркский язык, сильно отличающийся от других языков тюркской семьи. Караимы живут в Крыму и в Прибалтике, но уже, к сожалению, совсем не говорят на караимском. Однако есть большой массив данных, и есть люди, которые занимаются караимской культурой. Да и сами караимы стараются сохранять культурные, религиозные и социальные традиции. Но языком никто не владеет. Мы хотим сделать караимский корпус и начать работу по созданию большого датасета. Но для этого нужны средства.
— Сейчас вы воплощаете в жизнь проект по созданию инструмента для обработки материалов, собираемых в экспедициях. Что это за инструмент и как он будет работать?
— Идея пришла несколько лет назад в процессе создания нивхского корпуса. Лингвисты, работающие в поле, в первую очередь исследуют свои научные проблемы, возможно, интересные только им одним: например, как устроены глагольные формы в том или ином языке. Но при этом любой лингвист, каким бы языком он ни занимался, всегда начинает со сбора текстов, который осуществляется в одном и том же формате и по одним и тем же правилам, которые представлены в Лейпцигской конвенции глоссирования. По этим правилам, в частности, обязательно должна быть верхняя строка на исходном языке, разобранная по морфемам. Далее идет вторая строка с подстрочником, где каждое слово из оригинального языка сопоставляется с переводом на язык-посредник — в нашем случае это русский. Там же есть подстрочник с грамматическими показателями — так называемыми глоссами. И, наконец, третья строка — это перевод предложения.
Мы подумали: раз у нас есть общий формат работы с разными языками, почему бы не создать такой инструмент, который помогал бы лингвистам прямо в поле преобразовывать языковые данные в корпус и сразу же им пользоваться? В итоге сотрудники лаборатории НИВЦ совместно с группой студентов отделения теоретической и прикладной лингвистики (ОТиПЛ) филологического факультета МГУ им. М.В. Ломоносова разработали прототип инструмента машинной обработки малых языков. С разработкой нам помог Сергей Александрович Аверкиев — IT-специалист, известный энтузиаст в области машинного обучения.
Инструмент предполагает, что мы можем сразу перевести текст в нужную для корпуса структуру. Мы также можем выбрать уже разобранный по общим правилам текст и автоматическим методом сделать из него полностью структурированный словарь, подобный англо-русским словарям, где слова, представленные в этом тексте, будут расположены в алфавитном порядке и сопровождены переводом, морфологическими данными и т.д. После того как мы машинным методом приведем текст в структурированный вид, нам будет доступна функция поиска по корпусу. Сейчас мы работаем над созданием интерфейса.
Таким образом, можно будет прямо в поле, без интернета, с помощью компьютерной программы пользоваться всеми возможностями поиска по структурированным данным. На данный момент готов прототип; надеюсь, однажды мы дойдем и до готового продукта.
Павел Гращенков и корреспондент «Научной России» Кирилл Тодоров
— Но технические возможности уже позволяют создать инструмент на основе искусственного интеллекта?
— В данном случае ИИ помогал только писать код, но мы также работали и над созданием языковых моделей. В частности, хочу отметить проект Элеоноры Измайловой и Дарьи Савиной, которая отвечала за бэкенд-дизайн. Они разработали прототип русско-нивхского и нивхско-русского переводчика. Его удалось создать на основе данных, которые мы активно собирали последние три года, так как исходного общего массива нивхских данных у нас не было. Надеюсь, этот переводчик поможет в ревитализации языка. Так что ИИ мы используем, но до того, чтобы он помогал возрождать языки, к сожалению, пока далеко. Тут необходимо участие крупных компаний, занимающихся разработкой больших языковых моделей (Яндекса, Сбера, Т-Банка, МТС), потому что у нас нет достаточных вычислительных мощностей и экспериментальных возможностей для таких задач. Без участия крупных игроков в области нейросетей ситуация вряд ли сдвинется с мертвой точки.
— Но если рассуждать гипотетически, как ИИ можно использовать для сохранения языков?
— Три года назад у нас родилась идея, о которой я рассказывал на разных конференциях. В западных коммерческих компаниях изучали, как помочь детям-билингвам выучить язык предков, если он считается «менее престижным», чем тот, на котором они говорят. В нашем случае это ребенок, например, из нивхской или караимской семьи, родители которого не владеют родным языком. Ему способен помочь виртуальный ассистент, который будет стимулировать ребенка общаться на малом языке: рассказывать сказки, задавать вопросы, играть в лингвистические игры. И это может помочь в ситуации, когда рядом нет людей-носителей. Приведу пример из собственного опыта. У меня есть коллега — филолог-русист, которая живет в Стране Басков. Сначала она самостоятельно научила дочь говорить по-русски, а потом дочери подарили Алису AI. И выяснилось, что девочка отлично общается по-русски с Алисой, при том что это ее единственный русскоязычный собеседник, когда мамы нет рядом. То же самое можно было бы сделать и с малыми языками.
Как разнообразить это общение, сделать его интересным для детей? Этот механизм уже давно разработан для английского и русского языков. Все упирается в политическую волю: нужно не просто поставить задачу, а вовлечь в ее решение крупные технологические компании.
— Эта технология может воскресить уже мертвые языки?
— Да, но для этого нужно приложить много усилий. Уже есть люди, готовые над этим работать, — например, Руслан Ирекович Идрисов, который вместе с Валентином Юрьевичем Гусевым создавал первый нивхский корпус. Он тоже выпускник отделения теоретической и прикладной лингвистики, а сейчас работает в индустрии. Он выразил готовность участвовать в создании звукового помощника для нивхского языка.
Для этого необходимо решить ряд задач. Во-первых, собрать звуковые данные в нужном качестве и количестве (отчасти они уже есть). Во-вторых, провести анализ нивхской речи для корректного перевода в текст. В-третьих, синтезировать речь, чтобы текст переводился в голос, как это уже работает с русским языком. Задача объемная, но вполне выполнимая: подобные технологии работают для большого количества других языков.
— Лингвисты достаточно много общаются с представителями коренных малочисленных народов. Как они воспринимают идею сохранения родного языка?
— Во всех регионах России, где мне доводилось бывать, находились люди, которые хотят, чтобы про их язык, культуру и традиции узнали, и которые готовы что-то для этого делать. Понятно, что в удаленных горных районах или на том же Сахалине жизнь большей части населения связана в первую очередь с решением бытовых проблем. Поэтому таких энтузиастов немного, но они есть, и, если им помогать, позитивный эффект возможен. Ведь в истории известны случаи возрождения даже мертвых языков.
— Можно ли сказать, что за последние годы интерес к обсуждаемой проблеме возрос среди представителей малочисленных народов? Или, наоборот, уменьшился?
— 2026 г. у нас объявили Годом языков и культур, а ранее ЮНЕСКО инициировало десятилетие малых языков. Возможно, связанная с этим социальная активность привела к тому, что люди стали более чуткими к этому вопросу. И хотя я бы не сказал, что есть существенные перемены, но могу отметить ряд социальных проектов в нашей стране, направленных на ревитализацию языков.
— Вы упоминали, что сейчас носители нивхского языка — это в основном пожилые люди. Удается ли найти языковых активистов среди молодежи?
— Есть, например, Михаил Игоревич Гринчевский, геолог по образованию, который не только сам учил нивхский язык, но и пытался приобщить к этому нивхов, ведя тематические группы в социальных сетях. Но это было в студенческие времена, когда было достаточно свободного времени. Теперь же у него много работы, и он уже не может уделять этому прежнее внимание. Молодежь старается помогать, но лишь по мере возможностей. К сожалению, сегодня не находится людей, готовых полностью взять на себя бремя возрождения языка: объективные обстоятельства — работа, семьи, дети — требуют слишком большого количества времени и сил.
— Насколько вообще важна поддержка местного населения в вопросе сохранения языка?
— Это главный вопрос. На этапе сбора данных их главным источником выступают носители языка. Их желание делиться информацией, знаниями играет ключевую роль. Повторюсь, что по всей России представители самых разных языков — тюркских, монгольских, дагестанских и того же нивхского — всегда с пониманием и интересом встречали экспедиции и людей, которые приехали записывать данные. Так что носители языков нам очень помогают в работе.
Интервью проведено при поддержке Министерства науки и высшего образования РФ





















