首页 / 大模型动态

Google 发布 Gemini 3.8 Live 双模型,扩展实时语音与多模态理解

Google 于9月15日推出 Gemini 3.8 Live 与 Extended Thinking,扩展实时语音、多模态理解和生成音频水印能力。

今日科技圈头条C编辑部已完成来源核验
查看行业与公司影响↓

Google 于9月15日发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个模型。Google 将前者定位为兼顾实时对话、视觉上下文与成本效率的产品;后者则面向更复杂的多步骤任务。此次更新属于 Gemini 音频模型线的新增型号,而非此前 Gemini 3.8 Flash 的重复发布。

Google 表示,两款模型将通过 Gemini API、Google AI Studio、企业预览或消费级产品逐步提供。官方同时称,模型生成的音频将加入 SynthID 水印。该机制可帮助识别 AI 生成音频,但不等同于对具体音频内容真实性的判断。

厂商披露的功能定位说明了产品方向,实际使用效果仍取决于应用接入方式、使用语言、具体任务及相关管理规则。对于涉及身份确认、外部系统或高风险操作的场景,使用方仍需结合自身流程设置必要的审核与控制措施。

实时语音能力的应用边界

实时语音与视觉上下文能力的结合,可能推动语音交互从单纯问答延伸至更连续的服务流程。客服辅助、协作工具和现场指引等产品,可据此评估是否减少用户在多轮交互中的等待与信息断裂;但模型能力并不会自动消除业务流程中的错误风险。应用开发者需要根据自身数据、语言环境和任务规则验证响应质量、稳定性与异常处理效果。若语音交互涉及账户信息、企业数据或外部服务,权限分级、人工确认、操作记录与异常回退仍是部署环节的重要约束。对产业链而言,新增模型选择有助于丰富语音应用的技术供给,但实际需求能否扩大,仍取决于开发者集成成本、场景成熟度及用户对可靠性的接受程度。

涉及行业行业影响分析简要理由
应用软件利好新的实时语音模型及其分发渠道,为开发者提供了新增模型选择;客服、协作等软件可评估接入连续语音和视觉上下文能力。
互联网服务与基础设施中性实时多模态交互可能带来新的服务调用需求,实际规模取决于应用采用情况。

新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。

专题:AI模型与技术

#Gemini#语音模型#多模态#Google