
Google DeepMind 社は、Gemini 3.1 Flash TTS と呼ばれる最新のオーディオモデルのリリースを発表しました。開発者からの報告によると、このシステムは高度な表現力に焦点を当てた次世代の音声合成技術です。
このモデルの主な特徴は、細粒度のオーディオタグの導入です。このメカニズムにより、ユーザーは生成プロセスを正確に制御でき、作成されるオーディオの望ましい感情的およびイントネーション的特性を直接指定することが可能になります。
提示された技術は、より生きた制御可能な人工音声を作成するためのツールとして位置づけられています。このようなタグの導入は、声の微調整が困難であった以前のシステムの制限を解消することを目的としています。
編集部コメント
なぜ重要か
こうしたツールは、対話の動的生成が求められるメディア産業やゲーム開発において極めて重要になると予想されます。次に観察される兆候は、実用的な使用例の出現や大手プラットフォームへの統合でしょう。競合他社との比較における合成の実際の品質や、この技術へのアクセス条件については不確実性が残っています。