当地时间8月12日,谷歌旗下DeepMind对外发布全新多语言手语转文本模型 SL2T,这项手语人工智能技术正式搭载至 Pixel11 手机系统,实现手语AI第一次落地普通消费电子产品,补齐听障群体智能终端交互短板。
本次上线的 SL2T 模型,最先适配 Pixel 11 内置 Gboard 键盘、实时转写 Live Transcribe 两款工具。手机前置摄像头捕捉使用者动作之后,用户便可依靠比出手语完成消息编辑、网页检索、和 Gemini 大模型对话等原本需要手动打字的操作。内测数据显示,使用者使用美国手语输入文字,效率和自然度优于手动键盘打字,沟通体验大幅提升。
在底层训练层面,SL2T 依托超过50种手语、累计10万小时时长的手语素材完成训练,四分之一训练素材来自美国手语数据集。跨语种的联合训练方式,让模型摸索不同手语之间共通的动作逻辑,识别效果优于单语种手语模型,在 FLEURS‑ASL 评测基准刷新当下手语转写模型测评记录。
长久以来语音转文字、语音输入已经成为智能手机标配功能,方便普通使用者解放双手完成文字录入。但全球现存超200种手语,大约7000万听障人群长期缺少适配移动端、成熟稳定的手语识别工具,手语相关技术大多停留在实验室研发阶段,很难面向普通用户落地使用,移动端无障碍交互长期存在缺口。
新功能使听障人士也享受到类似语音输入的灵活 " 打字替代 " 体验。不同于过往手语识别产品需要先将手势对应固定标签词汇再转换成文字,SL2T 省去中间注解流程,直接解析人体动作坐标生成文本。手语属于独立语言,面部神态、肢体空间位置、唇部动作都会承载语法含义,传统标签式识别方式容易丢失非手部动作携带的语义,全新架构能够打破固定词汇库的桎梏,识别上限随着训练素材扩充持续提高。
隐私防护同样是本次模型的重点设计。手机端 MediaPipe Holistic 工具实时追踪手部、面部、躯干合计130处关键点,设备只会向外传输动作坐标数据,拍摄产生的原始视频画面即时删除,不会上传云端,规避拍摄画面泄露带来的隐私隐患。
据 DeepMind 团队介绍,项目全程吸纳听障从业者、手语顾问委员会参与产品迭代,贴合手语使用者日常沟通习惯。现阶段该功能仅开放美国手语转英文,后续谷歌计划逐步适配更多手语种类,并且向更多安卓机型铺开该无障碍功能。
手语模型并不是 DeepMind 初次尝试的残障群体无障碍AI项目,2025年5月科研团队对外官宣开源手语互译模型 SignGemma,依托轻量化 Gemma 架构搭建手语翻译框架,主要针对美国手语开展优化,为如今 SL2T 消费级落地打下算法根基。
除此之外实验室还研发过多项普惠技术:依托自研 WaveNet 语音合成算法,帮助肌萎缩侧索硬化症患者复刻出事前原生嗓音;Euphonia 专项项目专门辨识中风、失语病患造成的含糊不清语音,破解言语障碍人群设备交互难题。谷歌移动端无障碍产品线 Live Transcribe 多年迭代音频转写算法,长期为听障用户提供日常声音字幕,多年的声学‑视觉多模态经验,全部赋能本次手语识别模型开发。
多家科技厂商已经加速布局面向残障群体的 AI 无障碍赛道,国内科大讯飞旗下讯飞听见,通过听力残疾认证的用户可以享用免费实时语音转写、带有月度时长配额的会议同传权益;华为依托鸿蒙大模型打造完整助残工具包,AI 眼镜借助 “小艺看世界” 帮助视障人士识别路况障碍,小艺AI语音修复优化失语者含糊的发声;苹果升级 iPhone、Vision Pro 端侧 AI,设备搭载智能实时字幕、图片详情解析功能,Vision‑Pro 专属新增眼动操控兼容外接电动轮椅的无障碍功能。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.