Google 于9月24日发布 Gemini 3.8 Live with Live Avatar。这项功能建立在 Gemini 3.8 Live 的实时对话能力之上,将语音交互与低延迟视频输出结合,为对话生成可见的动态形象。
Google 表示,该功能可同时处理视觉和音频输入,并以音频、视频形式回应。其演示目标包括企业客服和交互式讲解;模型还可在维持对话时异步调用工具并获取后台数据。相关能力属于厂商披露的产品设计与应用定位,并非本站对效果的实测结论。
可用性方面,Google 称 Live Avatar 已在 Gemini Enterprise 提供。预设形象之外,企业可使用参考图创建形象;其中自定义形象创建目前限企业白名单。Google 同时称,输出的音频和视频会加入 SynthID 水印。
实时形象把模型接入从文本窗口推向连续服务
对模型服务商而言,Live Avatar 的变化不只是增加一层视频界面。实时语音、视频生成、工具调用和会话状态需要被编排在同一条交互链路中,企业接入时会更关注延迟、并发稳定性、形象素材授权和生成内容标识。若该能力能在实际业务中保持稳定,客服、培训与导览类应用可减少多套语音、动画和流程系统之间的衔接;但这不意味着所有对话都适合采用数字形象。对于只需检索、表单处理或简短问答的场景,视频输出可能增加计算与运营成本,部署价值仍取决于任务时长、用户接受度和合规要求。
| 涉及行业 | 行业影响分析 | 简要理由 |
|---|---|---|
| 应用软件 | 中性 | 实时多模态交互扩展了企业调用模型的产品形态;客服、培训和导览软件可接入新能力,但实际需求仍须由场景验证。 |
| 互联网服务与基础设施 | 中性 | 音视频实时生成会增加服务编排要求,具体资源影响取决于采用规模。 |
新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。
