Ученые Исследовательского центра в сфере искусственного интеллекта МГУ имени М.В. Ломоносова собрали новый датасет из 5200 роликов для обучения систем искусственного интеллекта, повышающих качество потоковых видео. Технологии Super-Resolution, основанные на искусственных нейросетях, способны убирать шумы в видео и дорисовывать мелкие детали, однако нередко ошибаются. На основе нового набора данных ученые обучают ИИ корректно воспринимать объекты на экране и повышают качество работы систем Super-Resolution.

Алгоритмы Super-Resolution, основанные на ИИ, повышающие разрешение изображений и видео, сегодня установлены в смартфонах, в современных телевизорах, кроме того, они работают на стриминговых и видеоплатформах и в онлайн-кинотеатрах. В отдельных ситуациях системы Super-Resolution могут дорисовывать неправильные текстуры объектам, например, добавить перья, приняв самолет за птицу.

Для решения этой проблемы  специалисты МГУ собрали датасет, в который вошли более 5 тыс. видеороликов разных жанров и разного качества, размещенных в открытом доступе. Этот набор данных позволяет проверять методы повышения качества не на искусственно подготовленных примерах, а на материалах, максимально приближенных к тому, что смотрят пользователи на видеоплатформах, и обучить ИИ лучше работать с текстурами.

«Подготовить хороший набор данных для обучения систем Super-Resolution – сегодня достаточно нетривиальное дело. Одна из актуальных задач — научить систему определять, какие искажения возможны в различных областях кадра. Это важно, чтобы избежать серьезных ошибок при генерации. Для решения этой задачи необходим  граундинг — локализация и привязка конкретных типов искажений к соответствующим участкам изображения. Мы собрали новый датасет, в котором аккуратно разметили информацию для граундинга Super-Resolution и выложили в открытый доступ. Набор данных скачали около 43 тыс. раз за первый месяц — это абсолютный рекорд среди опубликованных нами датасетов», — рассказал корреспонденту «Научной России» руководитель лаборатории «Интеллектуальный анализ видео» Института искусственного интеллекта МГУ Дмитрий Ватолин.

На основе этого набора данных ученые сравнили  11 методов повышения разрешения в реальном времени. А также предложили собственную модель, оптимизированную для работы в реальном времени, которая сохраняет скорость, достаточную для обработки видео, и при этом лучше восстанавливает детали.

Собранный набор данных — это часть крупного проекта, связанного с поиском ошибок и повышением качества алгоритмов Super-Resolution. Особенно актуально это становится с растущей популярностью смартфонов и телевизоров с экранами 4К и 8К — при просмотре видео небольшого разрешения на современных больших экранах низкое качество алгоритмов повышения разрешения особенно заметно.

«Мы работаем с крупным китайским производителем смартфонов и улучшаем алгоритмы Super-Resolution для повышения качества фотографий, которые сегодня телефон собирает из видео, а также сотрудничаем с онлайн-кинотеатрами. Если запустить 2К контент на 8К телевизоре с диагональю 3 метра, изображение будет ужасным. Работающие при этом алгоритмы 4x Super-Resolution реального времени увеличивают разрешение в 4 раза, но при этом, по сути, придумывают 15 пикселей из 16. Даже в дорогих моделях телевизоров при этом проблемы хорошо видны на глаз. Соответственно онлайн-кинотеатры заинтересованы в качественных алгоритмах, которые заблаговременно увеличат разрешение старого контента хотя бы до 4К медленными качественными Super-Resolution алгоритмами, что заметно улучшит итоговое качество на дорогом ярком большом 8К экране», — отметил Дмитрий Ватолин.

Новость подготовлена при поддержке Министерства науки и высшего образования РФ

Фото: pe3check / ru.123rf.com