Компания Microsoft представила искусственный интеллект VALL-E, который способен имитировать любой человеческий голос на основе примера длительностью всего в три секунды. При этом голос имитируется очень достоверно, с сохранением как тембра, так и эмоциональной окраски оригинала.
Сама Microsoft называет VALL-E «языковой моделью нейронного кодека». Разработка опирается на технологии EnCodec. В отличие от других методов преобразования текста в речь, которые зачастую синтезируют речь, манипулируя формами сигналов, разработка Microsoft в основном анализирует, как именно звучит человек, разбивает эту информацию на отдельные «токены» и использует обучающие данные, чтобы сопоставить то, что он «знает» о том, как этот голос будет звучать, если ИИ произнесет другие фразы.
VALL-E обучали на библиотеке LibriLight, содержащей 60 000 часов англоязычной речи от более чем 7000 человек.
Google показала свой ИИ Duplex, который тоже может говорить практически неотличимо от человека, ещё в 2018 году, но суть разработки Microsoft не в самом ИИ, а именно в его обучаемости имитировать разные голоса.
На сайте проекта есть множество примеров работы ИИ, с которыми может ознакомиться любой желающий.

Годовой доход Илона Маска превысил заработок среднего сотрудника Tesla в 2,5 миллиона раз
85-дюймовый TCL C10M True Wallpaper SQD-Mini LED: 4 см толщины и 2304 зоны подсветки
Концептуальный смартфон iQOO X получил батарею на 15 000 мА·ч и экран 240 Гц
FCC одобрила первый роутер Starlink с поддержкой Wi-Fi 7 от SpaceX
Историческая попытка поймать корабль Starship башней Mechazilla запланирована на сентябрь 2026 года
Почти 5 млн баллов в AnTuTu: до анонса раскрыли мощь новейшего 2-нм чипа Snapdragon
Apple отложила релиз iPhone 18 до 2027 года
Продажи смартфонов дешевле $100 рухнули на 64% из-за их исчезновения с рынка США