Alphabet旗下Google DeepMind于8月12日发布手语转文本模型SL2T,并将其接入Pixel 11的Gboard和Live Transcribe。首发功能支持把美国手语转换为英语文本。用户可以在网页搜索、消息、文档撰写和向Gemini提问等原本需要键盘输入的场景中使用手语;面对面对话时,Live Transcribe也可以生成文字回复。Google表示,这项功能不额外收费,后续计划增加设备和语言支持。
当前产品范围仍然有限。SL2T率先处理的是美国手语转英语,尚未覆盖全球200多种手语。罕见手势、快速指拼、被动语态、分类词表达,以及缺少上下文的时态,都可能引起漏译或错译。团队还针对流式延迟、非手语输入导致的错误生成、左利手使用者和单手手语进行了优化。
在处理流程上,Pixel手机先通过MediaPipe Holistic从摄像头画面中提取手、手臂、躯干、头部和面部等人体关键点。Google介绍,发送至服务器的是这些关键点的几何坐标,原始视频会被丢弃。SL2T随后直接把关键点序列转换成文本,没有采用先生成手语词汇标注、再组合句子的两段式流程。
这种处理方式对应了手语翻译的实际难点:手语并非逐个手势替换单词,不同手语拥有各自的语法和词汇,含义也由身体多个部位的动作共同表达。SL2T使用超过10万小时的数据训练,覆盖50多种手语,其中美国手语数据约占四分之一。Google希望借助不同语言、方言和熟练程度的数据,让模型学习其中可共享的结构。
在FLEURS-ASL的美国手语转英语测试中,Google公布的零样本BLEURT分数为70。产品开发过程中,公司成立了AI手语咨询委员会,并邀请聋人社群及相关组织参与影响评估。现阶段的落地重点仍是把美国手语输入带入Pixel手机;扩展语言、生成手语和接入更多AI能力属于后续方向。
手语翻译进入手机后的行业传导
SL2T进入Gboard和Live Transcribe后,模型调用从研究测试延伸到输入、搜索、消息和面对面对话,直接增加了多模态AI模型服务与无障碍应用软件的使用场景。对Google而言,Pixel首发有助于形成终端功能差异,已有应用入口也降低了新功能触达用户的门槛。另一方面,多语言训练数据、社群参与、隐私处理和持续纠错会增加研发及运营投入。由于首发仅覆盖美国手语转英语,且功能不单独收费,短期影响主要体现在Pixel和Google应用的功能完善,而不是新增独立收入。
| 涉及行业 | 行业影响分析 | 简要理由 |
|---|---|---|
| 应用软件 | 利好 | 多模态手语翻译进入消费产品,新增输入、搜索和对话等模型调用场景;Gboard与实时转写获得手语输入能力,扩大无障碍功能覆盖。 |
| 技术硬件、存储与外设 | 中性 | Pixel 11取得首发差异化,但初期语言和设备覆盖仍较有限。 |
| 涉及的上市公司 | 证券代码 | 个股影响分析 | 简要理由 | 公允价值参考 | 分析师平均目标价参考 |
|---|---|---|---|---|---|
| Alphabet | NASDAQ:GOOGL | 中性 | 手语模型强化Pixel与Google应用的无障碍功能,但首发功能不额外收费,覆盖范围也较有限。 | 433美元 | 平均424.17美元 |
公允价值及分析师目标价为截至文章发表时的网上公开数据,数据可能随发布方更新而变化,且因不同口径可能得出不同结果,仅供参考,不等于公司客观价值。
新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。
