首页 / 大模型动态

Google 推出 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,语音生成分化为创作控制与高并发调用

Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,分别面向角色化语音创作和高量级语音服务,并扩展至 Gemini API 等入口。

今日科技圈头条C编辑部已完成来源核验
查看行业与公司影响↓

本文涉及的模型

当前数据 · 2026-09-22

Google 于9月23日发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型。前者侧重声音设计和逐句演绎控制,后者面向高量级、成本效率导向的语音生成场景。两者均为 Gemini Audio 产品线的新增模型,而不是此前 Gemini 3.8 Live 的实时交互更新。

Google 表示,Flash TTS 支持通过自然语言提示设计声音,并可对逐句演绎方式进行控制;Flash-Lite TTS 则更适合需要较高调用量的任务。两款模型已通过 Gemini API 和 Google AI Studio 提供给开发者。

官方称,模型覆盖100多种语言和方言,生成音频嵌入 SynthID 水印。对于声音复现功能,Google 表示会采用同意验证安排。上述能力范围和语言覆盖均来自厂商披露,不应视为本站对不同语言、口音或具体任务效果的独立测试。

语音模型分层如何改变产品交付

将侧重创作控制的模型与面向高量级调用的模型分开,有助于语音产品按实际任务匹配服务能力。人物塑造、对白编排或品牌声线管理等场景,可能更重视 Flash TTS 的控制能力;批量配音、多语种本地化和语音交互服务,则可能更关注 Flash-Lite TTS 在高调用量下的适配性。对应用方而言,实际交付仍取决于提示设计、声音授权、内容审核和调用稳定性。厂商披露的语言覆盖不代表各语言、口音和长文本任务的表现完全一致;水印与同意验证也只能构成部分约束,平台仍需处理冒用声音、内容标注和分发治理等问题。

涉及行业行业影响分析简要理由
应用软件利好两档模型对应不同语音任务,服务商可围绕创作控制与高量级调用设计产品层级;配音、互动内容和语音服务应用可获得更细分的模型选择,但仍需处理授权与审核。
互联网服务与基础设施中性语音生成调用可能增加在线服务需求,资源变化仍取决于采用率和使用时长。

新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。

进一步了解

从报道到选型

相关报道

专题:AI模型与技术

#Gemini#语音生成#多模态模型#Gemini API