Alibaba представила Qwen Audio 3.0 TTS для синтеза речи

GPT/ChatGPT/AI Central Александра Горного··1 мин чтения
Alibaba представила Qwen Audio 3.0 TTS для синтеза речи

Qwen Audio 3.0 TTS озвучивает текст на 16 языках, включая русский. Умеет копировать голос по аудиопримеру. Тембр сохраняется при генерации речи на другом языке. В Artificial Analysis TTS Leaderboard модель заняла 1-е место.

Голосом можно управлять обычными инструкциями. Например, попросить говорить быстрее, тише, испуганно или голосом ведущей утреннего радио. Ещё добавили 86 тегов для точной настройки отдельных фраз.

За один проход модель может озвучить до трёх минут текста. Она также справляется с шумными, гулкими и плохо записанными образцами голоса и выдаёт аудио в качестве до 48 кГц.

Модель пока не выложили в open source. Доступ продают в Alibaba Cloud.

https://funaudiollm.github.io/qwen-audio-3.0-tts/

Авторский взгляд на новости технологий Реклама: https://docs.google.com/presentation/d/1glQMXYyKAYpzNP8VXzM4gl2YkEgLjkeD_Fxvzbu5QUE/edit РКН: https://clck.ru/3FPkup Личный аккаунт: @gornal О рекламе: @Vzuhcha ВП нет

Связанные темы

Читать далее