
La société Google DeepMind a annoncé le lancement de son tout nouveau modèle audio nommé Gemini 3.1 Flash TTS. Selon les développeurs, ce système représente la prochaine génération de technologies de synthèse vocale, axée sur une expressivité accrue.
La caractéristique clé du modèle est l'introduction d'étiquettes audio granulaires. Ce mécanisme offre aux utilisateurs un contrôle précis sur le processus de génération, leur permettant de définir directement les caractéristiques émotionnelles et intonatives souhaitées pour l'audio créé.
La technologie présentée est positionnée comme un outil pour créer une parole artificielle plus vivante et plus contrôlable. L'intégration de telles étiquettes vise à éliminer les limites des systèmes précédents, où le réglage fin de la voix était difficile.
commentaire éditorial
Pourquoi c’est important
Il est attendu que de tels outils deviennent essentiels pour l'industrie des médias et le développement de jeux, où la génération dynamique de dialogues est requise. Le prochain signal observable sera l'apparition d'exemples pratiques d'utilisation ou l'intégration dans de grandes plateformes. Une incertitude subsiste concernant la qualité réelle de la synthèse par rapport aux concurrents et les conditions d'accès à la technologie.