首页 / 大模型动态

Google 为 Gemini 3.8 Live 增加 Live Avatar,企业版接入实时音视频形象

Google 发布 Gemini 3.8 Live with Live Avatar,将实时对话、视频生成与异步工具调用结合,并在 Gemini Enterprise 提供。

今日科技圈头条C编辑部已完成来源核验
查看行业与公司影响↓

Google 于9月24日发布 Gemini 3.8 Live with Live Avatar。这项功能建立在 Gemini 3.8 Live 的实时对话能力之上,将语音交互与低延迟视频输出结合,为对话生成可见的动态形象。

Google 表示,该功能可同时处理视觉和音频输入,并以音频、视频形式回应。其演示目标包括企业客服和交互式讲解;模型还可在维持对话时异步调用工具并获取后台数据。相关能力属于厂商披露的产品设计与应用定位,并非本站对效果的实测结论。

可用性方面,Google 称 Live Avatar 已在 Gemini Enterprise 提供。预设形象之外,企业可使用参考图创建形象;其中自定义形象创建目前限企业白名单。Google 同时称,输出的音频和视频会加入 SynthID 水印。

实时形象把模型接入从文本窗口推向连续服务

对模型服务商而言,Live Avatar 的变化不只是增加一层视频界面。实时语音、视频生成、工具调用和会话状态需要被编排在同一条交互链路中,企业接入时会更关注延迟、并发稳定性、形象素材授权和生成内容标识。若该能力能在实际业务中保持稳定,客服、培训与导览类应用可减少多套语音、动画和流程系统之间的衔接;但这不意味着所有对话都适合采用数字形象。对于只需检索、表单处理或简短问答的场景,视频输出可能增加计算与运营成本,部署价值仍取决于任务时长、用户接受度和合规要求。

涉及行业行业影响分析简要理由
应用软件中性实时多模态交互扩展了企业调用模型的产品形态;客服、培训和导览软件可接入新能力,但实际需求仍须由场景验证。
互联网服务与基础设施中性音视频实时生成会增加服务编排要求,具体资源影响取决于采用规模。

新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。

进一步了解

从报道到选型

相关报道

专题:AI模型与技术

#Gemini#多模态模型#实时语音#企业AI