
Laut einem unabhängigen Bericht von The Decoder hat das Sprachsynthesemodell Qwen Audio 3.0 TTS Plus von Alibaba den ersten Platz im Speech-Arena-Leaderboard von Artificial Analysis belegt. Das System unterstützt 16 Sprachen und ermöglicht es Nutzern, den Aussprachestil über Befehle in natürlicher Sprache oder spezielle Tags wie [angry] zu steuern.
Trotz der hohen Ausgabequalität liegt die Verarbeitungsgeschwindigkeit des Modells bei nur 16 Zeichen pro Sekunde. Dies ist deutlich langsamer als die Werte der Hauptkonkurrenten auf dem Markt – den Systemen Sonic 3.5 und Simba 3.2 –, die bei der Audiogenerierung eine höhere Leistung demonstrieren.
Die Angaben zur Führungsposition des Modells basieren ausschließlich auf der Metabeschreibung der Veröffentlichung in The Decoder, ohne Zugriff auf den vollständigen Berichtstext oder primäre Testdaten. Die Information bestätigt zwar den Fakt des ersten Platzes in der Rangliste, gibt jedoch keine Details zur Bewertungsmethodik oder spezifischen numerischen Qualitätsindikatoren der Stimme preis.
redaktioneller Kommentar
Warum es wichtig ist
Es wird erwartet, dass andere Marktteilnehmer mit einer Verbesserung des emotionalen Intelligence ihrer Modelle reagieren und dabei die hohe Geschwindigkeit beibehalten. Das nächste zu beobachtende Signal wird die Veröffentlichung aktualisierter Benchmarks oder die Ankündigung neuer Versionen konkurrierender Produkte sein. Unsicherheit besteht weiterhin darüber, ob die niedrige Geschwindigkeit zu einer kritischen Barriere für die Massenadoption dieses spezifischen Modells wird.