
Согласно данным независимого отчета издания The Decoder, модель синтеза речи Qwen Audio 3.0 TTS Plus, разработанная компанией Alibaba, заняла первое место в лидерборде Speech Arena от организации Artificial Analysis. Система поддерживает работу с 16 языками и позволяет пользователям управлять стилем произношения с помощью команд на естественном языке или специальных тегов, таких как [angry].
出力品質は高いものの、モデルの処理速度は毎秒 16 文字にとどまる。これは市場の主要競合である Sonic 3.5 や Simba 3.2 と比較して著しく遅く、これらの競合製品は音声生成においてより高いパフォーマンスを示している。
本モデルの首位獲得に関するデータは、The Decoder における掲載メタ記述のみに基づいており、報告書の全文や一次テストデータへのアクセスはない。この情報はランキング首位獲得という事実を確認するものであるが、評価手法の詳細や音声品質の数値指標については明らかにしていない。
編集部コメント
なぜ重要か
他の市場参入者は、高速性を維持しつつ自社のモデルの感情知能を向上させることで対応すると予想される。次の観察可能な兆候は、更新されたベンチマークの公表か、競合製品の新バージョンの発表となるだろう。この特定のモデルの大量導入にとって、低速性が決定的な障壁となるかどうかについては、不確実性が残っている。