Современные технологии распознавания речи в значительной степени ошибаются. Для описания объекта требуется большое количество аннотаций и транскрипций, чтобы помочь системе понять, на что ссылается пользователь. Для избежания сложности понимания между человеком и машиной учёные разработали систему машинного обучения.
Команда начала с подхода, при котором две нейронные сети обрабатывают одновременно изображение и звуковые спектрограммы. На основе машинного обучения оба направления учатся понимать друг друга, чтобы лучше идентифицировать объект на основе голоса. По словам учёные, это больше похоже на то, как взрослые объясняют ребёнку что-либо, указывая на объект пальцем и описывая его.
Существующая модель была сильно модифицирована. Такая нейросеть разделяет изображение на ячейки памяти, а речь на двухсекундные аудио-отрезки. После чего накладывает одно на другое. Таким образом ИИ обучается за счёт постоянных сопоставлений.
Как перевезти личные вещи на небольшое расстояние: транспорт, упаковка и организация переезда
Продажи товаров для настольного тенниса в М.Видео выросли почти в пять раз
Число продавцов на маркетплейсе М.Видео превысило 12 тысяч
Доступный ветрогенератор для каждого: представлена модель Ventyra R1 мощностью 50 Вт за $180
Russ запустил цифровой суперформат на фасаде ВТБ Арены
Фандом Фест ВКонтакте назвал хедлайнеров 2026 года
Huawei привезла в Европу сверхбыструю зарядку на 720 кВт: 200 км запаса хода за 5 минут
Где списать долги: рейтинг компаний