Ученые Исследовательского центра в сфере искусственного интеллекта МГУ имени М.В. Ломоносова собрали новый датасет из 5200 роликов для обучения систем искусственного интеллекта, повышающих качество потоковых видео. Технологии Super-Resolution, основанные на искусственных нейросетях, способны убирать шумы в видео и дорисовывать мелкие детали, однако нередко ошибаются. На основе нового набора данных ученые обучают ИИ корректно воспринимать объекты на экране и повышают качество работы систем Super-Resolution.
Алгоритмы Super-Resolution, основанные на ИИ, повышающие разрешение изображений и видео, сегодня установлены в смартфонах, в современных телевизорах, кроме того, они работают на стриминговых и видеоплатформах и в онлайн-кинотеатрах. В отдельных ситуациях системы Super-Resolution могут дорисовывать неправильные текстуры объектам, например, добавить перья, приняв самолет за птицу.
Для решения этой проблемы специалисты МГУ собрали датасет, в который вошли более 5 тыс. видеороликов разных жанров и разного качества, размещенных в открытом доступе. Этот набор данных позволяет проверять методы повышения качества не на искусственно подготовленных примерах, а на материалах, максимально приближенных к тому, что смотрят пользователи на видеоплатформах, и обучить ИИ лучше работать с текстурами.
«Подготовить хороший набор данных для обучения систем Super-Resolution – сегодня достаточно нетривиальное дело. Одна из актуальных задач — научить систему определять, какие искажения возможны в различных областях кадра. Это важно, чтобы избежать серьезных ошибок при генерации. Для решения этой задачи необходим граундинг — локализация и привязка конкретных типов искажений к соответствующим участкам изображения. Мы собрали новый датасет, в котором аккуратно разметили информацию для граундинга Super-Resolution и выложили в открытый доступ. Набор данных скачали около 43 тыс. раз за первый месяц — это абсолютный рекорд среди опубликованных нами датасетов», — рассказал корреспонденту «Научной России» руководитель лаборатории «Интеллектуальный анализ видео» Института искусственного интеллекта МГУ Дмитрий Ватолин.
На основе этого набора данных ученые сравнили 11 методов повышения разрешения в реальном времени. А также предложили собственную модель, оптимизированную для работы в реальном времени, которая сохраняет скорость, достаточную для обработки видео, и при этом лучше восстанавливает детали.
Собранный набор данных — это часть крупного проекта, связанного с поиском ошибок и повышением качества алгоритмов Super-Resolution. Особенно актуально это становится с растущей популярностью смартфонов и телевизоров с экранами 4К и 8К — при просмотре видео небольшого разрешения на современных больших экранах низкое качество алгоритмов повышения разрешения особенно заметно.
«Мы работаем с крупным китайским производителем смартфонов и улучшаем алгоритмы Super-Resolution для повышения качества фотографий, которые сегодня телефон собирает из видео, а также сотрудничаем с онлайн-кинотеатрами. Если запустить 2К контент на 8К телевизоре с диагональю 3 метра, изображение будет ужасным. Работающие при этом алгоритмы 4x Super-Resolution реального времени увеличивают разрешение в 4 раза, но при этом, по сути, придумывают 15 пикселей из 16. Даже в дорогих моделях телевизоров при этом проблемы хорошо видны на глаз. Соответственно онлайн-кинотеатры заинтересованы в качественных алгоритмах, которые заблаговременно увеличат разрешение старого контента хотя бы до 4К медленными качественными Super-Resolution алгоритмами, что заметно улучшит итоговое качество на дорогом ярком большом 8К экране», — отметил Дмитрий Ватолин.
Новость подготовлена при поддержке Министерства науки и высшего образования РФ
Фото: pe3check / ru.123rf.com



















