Gemini 3.1 Flash TTS:下一代富有表现力的人工智能语音
今天,我们推出了Gemini 3.1 Flash TTS,这是最新的文字转语音模型,具备更强的可控性、表现力和质量,旨在帮助开发者、企业和普通用户构建下一代AI语音应用。
### 主要功能
- **新模型**:Gemini 3.1 Flash TTS是一种新的AI语音模型,提供更好的控制性、表现力以及自然的语音质量,较之前版本音质更佳。
- **音频标签**:新加入的音频标签功能允许用户通过自然语言命令精准控制语音风格、节奏和表达。
- **多语言支持**:支持70多种语言,音频生成将带有SynthID水印,以帮助识别AI生成的内容,防止误导信息的传播。
### 主要亮点
- **显著提升的语音质量**:在人工分析的文本到语音排行榜中,该模型获得了1211的高Elo评分,展现了其自然和富有表现力的特性。
- **可定制的用户体验**:开发者可以在Google AI Studio中对声音进行微调,并导出设置,以确保在各种项目中保持一致的使用体验。
- **创新的音频标签设计**:通过音频标签,用户能够更灵活地调整表演的语调、节奏和重音。
### 使用场景
无论是在Google AI Studio、Vertex AI,还是在Workspace用户使用的Google Vids中,开发者们都可以开始使用这些新功能,创造出色的语音互动体验。
### 声音水印
所有由Gemini 3.1 Flash TTS生成的音频内容都经过SynthID水印处理,确保可以可靠地识别出人工智能生成的内容,增加内容的安全性和可靠性。如需了解更多有关安全和责任的信息,请查看我们的[模型卡](https://deepmind.google/models/model-cards/gemini-3-1-flash-audio/)。
---
原文链接:[点击查看](https://deepmind.google/blog/gemini-3-1-flash-tts-the-next-generation-of-expressive-ai-speech/)
### 主要功能
- **新模型**:Gemini 3.1 Flash TTS是一种新的AI语音模型,提供更好的控制性、表现力以及自然的语音质量,较之前版本音质更佳。
- **音频标签**:新加入的音频标签功能允许用户通过自然语言命令精准控制语音风格、节奏和表达。
- **多语言支持**:支持70多种语言,音频生成将带有SynthID水印,以帮助识别AI生成的内容,防止误导信息的传播。
### 主要亮点
- **显著提升的语音质量**:在人工分析的文本到语音排行榜中,该模型获得了1211的高Elo评分,展现了其自然和富有表现力的特性。
- **可定制的用户体验**:开发者可以在Google AI Studio中对声音进行微调,并导出设置,以确保在各种项目中保持一致的使用体验。
- **创新的音频标签设计**:通过音频标签,用户能够更灵活地调整表演的语调、节奏和重音。
### 使用场景
无论是在Google AI Studio、Vertex AI,还是在Workspace用户使用的Google Vids中,开发者们都可以开始使用这些新功能,创造出色的语音互动体验。
### 声音水印
所有由Gemini 3.1 Flash TTS生成的音频内容都经过SynthID水印处理,确保可以可靠地识别出人工智能生成的内容,增加内容的安全性和可靠性。如需了解更多有关安全和责任的信息,请查看我们的[模型卡](https://deepmind.google/models/model-cards/gemini-3-1-flash-audio/)。
---
原文链接:[点击查看](https://deepmind.google/blog/gemini-3-1-flash-tts-the-next-generation-of-expressive-ai-speech/)
评论
暂无评论。