多年来,对着手机说话一直是比打字更便捷的输入方式。而随着谷歌Pixel 11的发布,这一选项将扩展到使用美国手语(ASL)交流的人群。 在周三晚间举行的Made by Google活动前夕,谷歌DeepMind宣布推出SL2T——一种能将手语直接翻译成书面文字的新型AI模型。该模型驱动的手语转文字功能,将首发于Pixel 11系列上的Gboard和Live Transcribe应用中。 实际操作中,用户可以通过手机摄像头使用手语完成通常需要键盘操作的任务:用手语进行谷歌搜索、起草短信或邮件、在文档中书写,或向Gemini提问。在Live Transcribe中,用户可以在面对面交谈时用手语回复,而不再需要打字。 该功能最初将ASL翻译成英文。谷歌表示,这项功能将很快以零额外成本推广到更多设备,并计划未来支持更多手语。 教会手机理解手语,远不止向它展示一套手势词典那么简单。ASL是一门独立的语言,其独特的语法和含义通过手、手臂、躯干、头部和脸部的动作来传递,有时这些动作同时发生。 这意味着SL2T必须关注手语者的整个上半身。一套设备端计算机视觉系统追踪人脸部、身体和手部的130个关键点,将视频转化为移动的几何坐标地图。据DeepMind手语团队介绍,原始视频帧会被立即丢弃,只将坐标发送至谷歌服务器进行翻译。谷歌的联合影响报告补充道,除非用户明确同意参与模型评估研究,否则公司不会保留用户所打手语或系统生成文本的日志。 一旦手机完成动作映射,SL2T便将这些动作直接翻译成英文。一种常见的方法是……
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.