
Компания Google DeepMind анонсировала выпуск своей новейшей аудио модели под названием Gemini 3.1 Flash TTS. Согласно сообщению разработчиков, эта система представляет собой следующее поколение технологий синтеза речи, ориентированное на повышенную выразительность.
Ключевой особенностью модели является внедрение гранулярных аудиометок. Этот механизм предоставляет пользователям возможность точного контроля над процессом генерации, позволяя напрямую задавать желаемые эмоциональные и интонационные характеристики создаваемого аудио.
Представленная технология позиционируется как инструмент для создания более живой и управляемой искусственной речи. Внедрение таких тегов призвано устранить ограничения предыдущих систем, где тонкая настройка голоса была затруднена.
комментарий редакции
Что это значит
Ожидается, что подобные инструменты станут критически важными для медиаиндустрии и разработки игр, где требуется динамическая генерация диалогов. Следующим наблюдаемым сигналом станет появление практических примеров использования или интеграция в крупные платформы. Неопределенность сохраняется относительно реальной качества синтеза по сравнению с конкурентами и условий доступа к технологии.