
Согласно данным независимого отчета издания The Decoder, модель синтеза речи Qwen Audio 3.0 TTS Plus, разработанная компанией Alibaba, заняла первое место в лидерборде Speech Arena от организации Artificial Analysis. Система поддерживает работу с 16 языками и позволяет пользователям управлять стилем произношения с помощью команд на естественном языке или специальных тегов, таких как [angry].
Несмотря на высокое качество вывода, скорость работы модели составляет всего 16 символов в секунду. Это значительно медленнее показателей основных конкурентов на рынке — систем Sonic 3.5 и Simba 3.2, которые демонстрируют более высокую производительность при генерации аудио.
Данные о лидерстве модели основаны исключительно на мета-описании публикации в The Decoder, без доступа к полному тексту отчета или первичным данным тестирования. Информация подтверждает факт занятия первой строчки рейтинга, но не раскрывает подробностей методологии оценки или конкретных числовых показателей качества голоса.
комментарий редакции
Что это значит
Ожидается, что другие игроки рынка ответят улучшением эмоционального интеллекта своих моделей, сохраняя при этом высокую скорость. Следующим наблюдаемым сигналом станет публикация обновленных бенчмарков или анонс новых версий конкурирующих продуктов. Неопределенность сохраняется относительно того, станет ли низкая скорость критическим барьером для массового внедрения этой конкретной модели.