Google DeepMind的手语团队正式发布了一款名为SL2T(sign-language-to-text)的多语言手语翻译AI模型,能够将手语视频转换为文字。该模型将率先搭载于2026年8月20日发售的Pixel 11上,届时用户可以直接在Gboard和Live Transcribe中使用手语输入,无需再敲击键盘。 SL2T在超过10万小时、跨越50多种手语的视频数据上完成训练。它不仅能识别手部动作,还会读取手语使用者身体的整体运动,并将其转换为坐标序列,再翻译成文本。Google DeepMind表示,该模型在学术基准测试中已达到当前最优水平,同时也针对真实使用场景进行了优化,比如单手拿着手机时也能进行手语识别。 隐私方面,SL2T在设备本地完成身体姿态追踪,只有将姿态坐标转换为文本时才会发送到服务器,视频画面不会上传。团队还重点解决了实时流式识别中的延迟问题,避免用户没有做手语时产生“幻觉”,并提升了单手手语输入的性能。 手语翻译一直是AI领域公认的难点。Google DeepMind解释,每种手语都有自己独立的语法和词汇体系,AI必须学习从身体动态中理解语言,而高速、精准地追踪全身动作在技术上一度非常困难。SL2T正是针对这些挑战专门设计的。 首发功能将首先支持美国手语(ASL)转英语,后续会逐步扩展到更多设备和语言。Google表示,手语输入功能将作为Pixel 11的默认能力提供,不额外收费。DeepMind团队强调,全球存在超过200种手语,约有7000万聋人和听障人士依赖手语交流,而此前AI语音技术的高速发展并未惠及这一群体。有了SL2T,听障用户可以在任何需要文字输入的场合直接用手语完成操作,包括搜索网页、发送消息、撰写文档,甚至向Gemini提问或安排任务。参与测试的用户反馈,用手语输入比文字输入更快、更自然、也更舒适。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.