
De acordo com dados de um relatório independente do veículo The Decoder, o modelo de síntese de voz Qwen Audio 3.0 TTS Plus, desenvolvido pela empresa Alibaba, ocupou o primeiro lugar no leaderboard Speech Arena da organização Artificial Analysis. O sistema suporta operação em 16 idiomas e permite aos usuários gerenciar o estilo de pronúncia usando comandos em linguagem natural ou tags especiais, como [angry].
Apesar da alta qualidade da saída, a velocidade de operação do modelo é de apenas 16 caracteres por segundo. Isso é significativamente mais lento do que os indicadores dos principais concorrentes no mercado — os sistemas Sonic 3.5 e Simba 3.2, que demonstram maior desempenho na geração de áudio.
Os dados sobre a liderança do modelo baseiam-se exclusivamente na metadescrição da publicação no The Decoder, sem acesso ao texto completo do relatório ou aos dados primários de teste. A informação confirma o fato de ocupar o primeiro lugar no ranking, mas não revela detalhes da metodologia de avaliação ou indicadores numéricos específicos da qualidade da voz.
comentário editorial
Por que importa
Espera-se que outros players do mercado respondam melhorando a inteligência emocional de seus modelos, mantendo ao mesmo tempo alta velocidade. O próximo sinal observável será a publicação de benchmarks atualizados ou o anúncio de novas versões de produtos concorrentes. Permanece a incerteza sobre se a baixa velocidade se tornará uma barreira crítica para a adoção em massa deste modelo específico.