Компания Nvidia представила новое решение в сфере искусственного интеллекта — нейросеть Video LDM, которая позволяет генерировать видеоролики по текстовому описанию, причём в высоком разрешении. В проекте принимают участие специалисты Nvidia и разработчики из Корнеллского университета.
Отмечается, что нейросеть создаёт ролики с разрешением до 2048×1280 пикселей и частотой в 24 кадра. У ИИ-модели есть 4,1 млрд параметров, 2,7 млрд из них использовали для видеороликов, по которым «тренировали» нейросеть.
Используемый в нейросети механизм Latent Diffusion Models позволяет обходиться без мощного и дорого аппаратного обеспечения, а для работы используется движок Stable Diffusion. Таким образом, Video LDM генерирует ролики покадрово.
Помимо этого, система умеет генерировать видео сцен вождения с разрешением 1024 × 512 пикселей и длительность до 5 минут.
На сайте Nvidia есть целый ряд видео, которые показывают возможности нового ИИ, есть короткие и более длинные ролики. При этом публичной версии Video LDM пока нет, также неясно, когда она появится в общем доступе. Пока что это лишь исследовательский проект, а не коммерческий.
Полноценная презентация ожидается в рамках Конференции по машинному зрению и распознаванию образов, она пройдёт 18–22 июня в Ванкувере, Канада.
Rocket Lab заключила рекордный контракт на 20 пусков ракеты Electron
Бельгийский луноход полетит к южному полюсу Луны на аппарате Blue Origin в 2029 году
Запущенный космический аппарат SMILE зафиксировал полное кольцо полярных сияний у Северного полюса
ChatGPT от OpenAI обзаведется невидимой маркировкой текстов
В России открылся первый воздушный коридор для беспилотников
Астрономы открыли «планету-феникс», возродившуюся из пепла умершей звезды
Сравнение стоимости собственного сервера и облака в 2026 году: расчеты и цифры
«Лаборатория Касперского» предупредила об атаках мошенников на корпоративную почту под видом госведомств