ИИ от Microsoft имитирует любой голос на основе трехсекундной записи

Компания Microsoft представили искусственный интеллект VALL-E. Он может генерировать голосовые записи на основе трехсекундного образца. Исследование показало, что модель, обученная на основе множества коротких отрывков, генерирует английскую речь, которую невозможно отличить от голоса оригинала.

Исследователи из Корнуэльского университета использовали модель VALL-E для анализа механизмов генерации речи. В своей работе, препринт которой опубликован на сервере arXiv, ученые исследуют нейронную сеть, обученную на основе 60 тыс. часов английской речи. Это в сотни раз больше, чем у существующих аналогов.

ИИ от Microsoft имитирует любой голос на основе трехсекундной записи

Принцип работы ИИ. Изображение: VALL-E
Анализ показал, что системе достаточно трехсекундного ролика для имитации голоса собеседника. При этом Vall-E значительно превосходит современную систему TTS с точки зрения естественности звучания речи и сходства голоса. Кроме того, она может сохранять эмоции говорящего и акустическую среду (влияние акустических свойств помещения, в котором была сделана оригинальная запись).

Разработанная система генерации пока закрыта для публичного доступа, но исследователи опубликовали примеры образцов и готовых голосовых файлов на сайте в интернете. Примеры сгенерированной речи отличаются по качеству. В то время как некоторые из них звучат естественно, на других слышно, что они сгенерированы машиной. Авторы разработки отмечают, что дальнейшее обучение на разных голосах, в том числе с разными акцентами, повысит качество работы системы.
Образец голоса человека. Аудио: VALL-E Сгенерированная запись, сохраняющая внешние шумы. Аудио: VALL-E
Исследователи также отмечают, что возможность генерации голосов, идентичных оригинальным, создает новые вызовы для безопасности, поскольку может использоваться мошенниками. Они полагают, что до широкого публичного релиза модели необходимо разработать систему, которая будет распознавать записи, сгенерированные ИИ.

ИИ от Microsoft имитирует любой голос на основе трехсекундной записи

ЧИТАЙТЕ ТАКЖЕ:

Добавить комментарий Отменить ответ

ЛУЧШИЕ НОВОСТИ

СВЕЖИЕ НОВОСТИ

16-летняя Анна Пересильд предстала в ретро-платье с глубоким декольте

Путин может устроить облаву на либералов — Хазин

МК: в Красногорске годовалый малыш умер во время тихого часа в детсаду

Эксперт объяснил, как защитить переписки в мессенджерах от посторонних

Липовые перекупы: водителей предупредили о хитрой схеме угона

Разборка городских банд: В столице Бельгии началась стрельба

Франция деградирует до состояния страны «третьего мира»

СК: Актеру Панину грозит до семи лет колонии за оправдание терроризма

Что ждёт россиян, родившихся с 1961 по 1966 годы, объяснил юрист

ЧИТАЙТЕ ТАКЖЕ:

Добавить комментарий Отменить ответ

ЛУЧШИЕ НОВОСТИ

СВЕЖИЕ НОВОСТИ

Читайте также: