Компания Microsoft представила искусственный интеллект VALL-E, который способен имитировать любой человеческий голос на основе примера длительностью всего в три секунды. При этом голос имитируется очень достоверно, с сохранением как тембра, так и эмоциональной окраски оригинала.
Сама Microsoft называет VALL-E «языковой моделью нейронного кодека». Разработка опирается на технологии EnCodec. В отличие от других методов преобразования текста в речь, которые зачастую синтезируют речь, манипулируя формами сигналов, разработка Microsoft в основном анализирует, как именно звучит человек, разбивает эту информацию на отдельные «токены» и использует обучающие данные, чтобы сопоставить то, что он «знает» о том, как этот голос будет звучать, если ИИ произнесет другие фразы.
VALL-E обучали на библиотеке LibriLight, содержащей 60 000 часов англоязычной речи от более чем 7000 человек.
Google показала свой ИИ Duplex, который тоже может говорить практически неотличимо от человека, ещё в 2018 году, но суть разработки Microsoft не в самом ИИ, а именно в его обучаемости имитировать разные голоса.
На сайте проекта есть множество примеров работы ИИ, с которыми может ознакомиться любой желающий.

В продаже появился Samsung Galaxy S26 FE: Exynos 2500, батарея 4900 мА·ч, IP68 и 7 лет обновлений за $700
Китай запустит 30 космических аппаратов к 2030 году для контроля пространства между Землей и Луной
Honor выпустила смартфон с выдвижной камерой, а Ulefone — защищенный Xsnap 7 Pro со съемной экшн-камерой со встроенной памятью
Ugreen выпустила линейку магнитных зарядок MagFlow
Первый карманный павербанк Ugreen с жидкостным охлаждением: «живые» фото
Как я обустроил домашнюю YouTube-студию: iPhone, пара светильников и OBS
В Индии состоялся релиз Poco X8: аккумулятор на 9000 мАч и защита IP69K за 320 долларов
Lenovo представила мини-ПК ThinkCentre X Ultra с Ryzen AI Max+ PRO 495 за 3100 евро