Новый подход к координации огромных флотов роботов представила группа ученых из Московского физико-технического института (МФТИ) и Института искусственного интеллекта (AIRI). Исследователи разработали метод активного итеративного дообучения Delta Data Generation (DDG), позволивший их нейросетевой системе впервые среди обучаемых алгоритмов справиться с задачей безаварийного разведения миллиона агентов на общей карте. Руководитель научной группы — доктор физико-математических наук, профессор РАН, директор Центра когнитивного моделирования МФТИ и Лаборатории «Когнитивные системы ИИ» AIRI Александр Игоревич Панов. Работа опубликована в трудах международной конференции IEEE/RSJ IROS 2025.
В основе решения лежит трансформерная модель MAPF-GPT, ранее созданная этой же группой для мультиагентного поиска путей (Multi-Agent Path Finding, MAPF). Предобученная на большом массиве данных, она демонстрировала свойства фундаментальной модели: способность доучиваться на единичных примерах и без дополнительного обучения решать задачи, не встречавшиеся в исходной выборке. Однако масштабирование на очень большое число роботов и сценарии, где цели агентам выставляются последовательно одна за другой, выявило серьезный барьер. Когда в ограниченной зоне видимости отдельного робота оказывается слишком много соседей, модель сталкивается с ситуациями вне распределения (out-of-distribution) и начинает выдавать почти случайные действия.
Чтобы преодолеть это ограничение, авторы предложили алгоритм MAPF-GPT-DDG с активным режимом дообучения. В итеративном процессе система сама выявляет сцены, которые решает плохо, — например, сложные разведения агентов в лабиринтах, — и запрашивает у экспертного планировщика-оракула правильные примеры поведения. Полученные сэмплы добавляются в обучающую выборку, после чего трансформер доучивается, по сути, проходя файн-тюнинг (SFT), но с целенаправленным отбором наиболее трудных образцов.
«Оказалось, что для мультиагентного случая недостаточно стандартных приемов, вроде GRPO для обучения с подкреплением или обычного файн-тюнинга, и приходится придумывать активный режим дообучения. Мы не формируем сразу всю дополнительную выборку с участием эксперта, а спрашиваем только те примеры, которые оказываются сложными для текущей модели», — пояснил Александр Панов.
Именно такой подход позволил не только адаптировать модель к принципиально иному классу задач, но и установить абсолютный рекорд. В тестах на карте размером 2048×2048 система успешно координировала более 524 тысяч агентов со 100-процентной успешностью, а при миллионе агентов успешность составила 99,9%. Скорость принятия решений достигала 163 микросекунд на одного агента. При этом модель, насчитывавшая всего два миллиона параметров, после дообучения по методу DDG показала качество решений, сопоставимое с исходной моделью, имевшей 85 миллионов параметров.
«Наша разработка впервые среди обучаемых систем успешно скоординировала движение миллиона виртуальных агентов на одной карте — это абсолютный рекорд для этого класса задач. Классические подходы либо не масштабируются, либо требуют огромных вычислительных ресурсов. MAPF-GPT-DDG эту проблему решил», — рассказал соавтор работы Александр Панов.
Практическая значимость метода напрямую связана с автоматизацией крупных логистических центров. Задача MAPF уже сейчас решается для сотен и тысяч роботов на сортировочных пунктах Amazon, Почты России и других компаний, где плоские мобильные платформы перевозят стойки с товарами. Умение в реальном времени строить траектории и оперативно исправлять ошибки критически важно для таких складов. Эксперименты с миллионом роботов были, прежде всего, научным вызовом, однако не лишены и футурологической перспективы.
«С практической точки зрения миллионы роботов сейчас менее актуальны. Но когда-нибудь в будущем, когда у нас появится огромный сортировочный центр — на всю планету или на несколько планет Солнечной системы, — тогда, конечно, и миллион роботов во флоте тоже пригодится», — добавил ученый.
Новость подготовлена при поддержке Министерства науки и высшего образования РФ
Источник изображения: Magnific / pikisuperstar



















