Сбербанк выпустил семейство генеративных моделей Kandinsky WM 1.0. Они обучены генерировать видео, более точно соответствующие законам физики и пригодные для обучения систем Physical AI. В основе моделей нейросеть Kandinsky 5.0 Video Lite, дополнительно обученная на видео с камер роботов, беспилотных автомобилей и записях промышленных процессов. Особенно ценны модели будут там, где реальные съемки невозможны или сильно затруднены: они могут генерировать видео редких, сложных или опасных сценариев для тренировки роботов и беспилотного транспорта. Код и веса нейросетей опубликованы под лицензией MIT – и доступны всем разработчикам мира бесплатно. Об этом CNews сообщили представители Сбербанка.
Physical AI или физический ИИ — класс систем искусственного интеллекта, которые способны воспринимать физический мир, понимают его динамику и могут управлять реальными устройствами. В отличие от языковых моделей, для физического ИИ просто нет открытых обучающих данных в достаточном масштабе. Собирать такие данные очень сложно и дорого: нужны устройства, датчики, операторы, контролируемая среда. Автомобиль с камерами и датчиками накапливает порядка 5000 часов записей в год, тогда как современным моделям нужны миллионы часов. А многие редкие и сложные сценарии, например, ДТП, экстремальную погоду, отказы оборудования — вообще нельзя воспроизвести вживую.
По оценке Яна Лекуна, лауреата премии Тьюринга и одного из «отцов» глубокого обучения, четырехлетний ребенок только через зрение получает больше информации, чем содержится во всех текстах, на которых обучены крупнейшие языковые модели. Поэтому следующий рубеж физического ИИ — обучение на видео, а синтетические данные становятся ключевым способом закрыть разрыв в объемах.
Сбер представил семейство генеративных моделей Kandinsky WM 1.0, предназначенных для создания видеоданных, соответствующих законам физики. Разработка ориентирована на обучение систем Physical AI, включая беспилотный транспорт, промышленных роботов и другие автономные решения.
В основу легла модель Kandinsky 5.0 Video Lite, дополнительно обученная на миллионах видеозаписей с камер роботов, беспилотных автомобилей и промышленных объектов. Это позволяет генерировать реалистичные ролики с редкими, опасными или трудно воспроизводимыми ситуациями, которые сложно получить в реальных условиях. Такие синтетические данные помогают ускорить обучение интеллектуальных систем и снизить затраты на сбор информации.
Создаваемые видео длительностью около пяти секунд воспроизводят отдельные действия — от манипуляций с предметами до дорожных эпизодов и производственных операций. Для повышения достоверности разработчики использовали дополнительное обучение и методы обучения с подкреплением, что улучшило передачу движения, геометрии объектов и физических взаимодействий.
Physical AI — это системы искусственного интеллекта, которые взаимодействуют с физическим миром: автомобилями и пешеходами, другими роботами, промышленным оборудованием. Основа их обучения — работа с большими массивами видеоданных. Однако сбор таких данных дорог и трудоемок, а некоторые сценарии — например, аварии, случаи экстремальной погоды или отказа оборудования — и вовсе невозможно записать в реальных условиях. Дообучить робота-погрузчика или беспилотное такси в процессе работы тоже не получится: это не просто дорого, но зачастую еще и опасно.
Использовать для обучения Physical AI видео, сгенерированные другими нейросетями, раньше было затруднительно из-за большого количества ошибок: искажения геометрии, перспективы и появления «мягких» деформирующихся объектов. Решить эту проблему смогли разработчики Сбера под руководством Дениса Димитрова. Они разработали семейство моделей, специально предназначенных для создания физически правдоподобных видеосцен. Новые модели основаны на Kandinsky 5.0 Video Lite, но дообучены на нескольких миллионах видео с камер роботов, беспилотных автомобилей и записях промышленных процессов. По данным разработчиков, это позволило уменьшить типичные ошибки генерации видео.
В результате модели Kandinsky WM научились генерировать физически достоверные видео длительностью около пяти секунд, содержащие отдельные действия и ситуации: манипуляции с предметами, дорожные сцены и этапы производственных процессов. Ролики можно использовать для обучения систем компьютерного зрения и симуляторов беспилотного транспорта. Для улучшения автомобильных сцен разработчики применили дополнительный этап обучения с подкреплением: Kandinsky WM генерировали ролики, а другие нейросети оценивали сохранность формы объектов, геометрию сцены и естественность движения и давали обратную связь.
Что пишут другие издания
- iXBT: Сбер научил ИИ законам физики: Kandinsky поможет роботам и беспилотникам
- N+1: Нейросеть Kandinsky WM 1.0 создала видеоролики для обучения роботов