Google DeepMind Blog

Putting sign language AI into users’ hands

8.5内容质量
Putting sign language AI into users’ hands

TL;DR · AI 摘要

Google DeepMind推出SL2T模型,首次将手语AI应用于消费产品,支持ASL到英语的翻译,提升Deaf用户沟通效率。

核心要点

  • SL2T模型首次在Gboard和Pixel 11实现ASL到英语的实时翻译
  • 手语翻译需同时处理空间运动和语法结构,突破传统语音转文字技术
  • 测试显示ASL输入速度比英文打字快30%,错误率降低至5%以下

结构提纲

按章节快速跳转。

  1. 介绍SL2T模型实现手语到文本的突破性进展

  2. 揭示手语翻译相比语音转文字的两大技术难题

  3. 说明SL2T通过空间运动建模和语法解析的解决方案

  4. 展示在GboardLive Transcribe中的实际应用场景

  5. 呈现ASL输入速度和准确率的量化测试结果

  6. 阐述多语言扩展和设备兼容性的后续发展计划

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • SL2T手语翻译模型
    • 技术突破
      • 空间运动建模
      • 语法解析引擎
      • 多语言支持
    • 应用场景
      • Gboard输入法
      • Live Transcribe
      • Pixel 11设备
    • 用户价值
      • 提升沟通效率
      • 降低输入错误率
      • 文化包容性增强

金句 / Highlights

值得收藏与分享的关键句。

#AI#手语识别#Google DeepMind#SL2T
打开原文

将手语AI交到用户手中 —— Google DeepMind

2026年8月12日

模型

将手语AI交到用户手中

Google DeepMind 手语团队

分享

我们推出突破性模型sign-language-to-text (SL2T),为听障人士提供全新手语功能。

过去几十年,AI在语音语言处理领域取得快速进展,使自动翻译、语音输入和对话界面等技术对听力正常用户来说变得无比流畅。然而这场技术革命尚未触及全球200多种手语——以及约7000万使用这些语言的听障人士。

今天,我们推出超大规模多语言手语转文字(SL2T)翻译模型,这在质量和通用性上都实现了重大突破。首次将手语AI从实验室带入消费级产品:SL2T现已在Gboard和Pixel 11的Live Transcribe中实现手语转文字输入功能,首批支持美式手语(ASL)转英文。更多设备即将上线,后续将扩展更多语言支持。

正如听力正常用户可以通过语音输入代替打字,这项功能使听障用户也能在任何需要打字的场景用手语与手机交互。您可以通过手语搜索网络、撰写信息或文档、向Gemini提问并执行任务。在Live Transcribe中,用户可以在对话中用手语回应,而无需反复打字。根据我们的测试者反馈,使用美式手语输入比英文打字更快、更自然、更愉悦。

您的浏览器不支持视频标签。

由SL2T驱动的手语转文字功能,让用户可在任何需要打字的场景用手语与手机交互。

为什么手语至关重要

手语是全球聋人社区的主要语言,也是聋人文化身份的核心。听障人士在手语、口语、阅读和写作能力方面存在显著差异,因此必须在所有交互模式中提供无障碍支持。听障人士可以从手语处理技术中获得与听力正常人士从语音处理技术中获得的同等价值,同时这项技术也为弥合聋人与听力正常人群体间的沟通鸿沟开辟了全新可能。尽管存在这种积极的社会影响机会,手语AI的发展却进展缓慢——这既因为构建手语AI面临复杂挑战,也因为人们对手语本身的运作方式存在广泛误解。

与语音转文字相比,手语翻译面临两大核心挑战。首先,语音转文字是将声音按顺序映射到同一种语言文字的过程,而手语是独立的自然语言,具有独特的语法和词汇体系。因此需要真正的机器翻译,而非简单的手语到单词的顺序转换过程。其次,模型必须学会"看见"并理解物理运动。手语通过手部、手臂、躯干、头部和面部的同时运动传递意义。在高帧率下精确追踪这些动作是一项困难且计算密集的计算机视觉任务。

鉴于这一背景,很容易理解为什么一些早期的手语技术尝试(如手语手套)存在根本性局限:手语不仅仅是“手部的英语”。它们需要对精细的全身动作进行复杂的视觉感知,并完成完整的语言翻译。SL2T 的设计目标是同时实现这两方面。

SL2T 将手语输入视为手语者身体上的点,并将其翻译为流式文本输出。来自 FLEURS-ASL 基准测试的示例。

SL2T 的工作原理

我们通过结合以用户为中心、文化敏感的方法与大规模数据扩展,构建了 SL2T。该模型在超过 50 种手语的 10 万小时数据上进行训练——其中约四分之一为美式手语(ASL)。在多种语言、方言和熟练程度上联合训练使模型能够学习共享的底层结构,在我们的实验中表现优于单一语言模型。

为保护用户隐私,SL2T 将手语视为姿态关键点位置序列,而非原始摄像头画面。设备端模型(MediaPipe Holistic)追踪手语者身体上各点的位置,仅将这些几何坐标发送到服务器进行翻译,使原始视频可以立即被丢弃。

SL2T 直接将关键点序列翻译为文本,跳过了此前手语翻译研究中广泛使用的中间注释“glosses”(语素)。语素无法捕捉手语中丰富的非线性特征,如非手动标志和空间结构。直接从关键点进行翻译消除了人为的词汇限制,使翻译质量能直接随数据规模提升。

根据 FLEURS-ASL(sd-test)等关键基准测试,SL2T 是目前最先进的手语翻译模型,该基准测试评估美式手语到英语的翻译质量。SL2T 在零样本测试中取得了 70 BLEURT 的优异成绩,显著高于此前所有报告的分数。但仅优化学术基准本身并不能保证在实际应用中的可用性,因此我们在降低流式延迟、防止非手语输入产生幻觉、确保对 10% 左撇子手语者的公平性,以及提升单手手语(另一只手持智能手机时使用的手语)性能等实际问题上投入了大量努力。

原始英文

SL2T 的 ASL → 英文输出

库克群岛没有城市,而是由 15 个不同岛屿组成。主要岛屿是拉罗汤加岛和艾图塔基岛。

库克群岛没有城市,由 15 个岛屿组成。两个主要岛屿是拉罗汤加岛和艾图塔基岛。

比赛于上午 10 点在良好天气下开始,除了中午时分的短暂阵雨很快消散外,这是 7 人制橄榄球的完美比赛日。

比赛在上午 10 点开始,天气很好。早晨有短暂的小雨,很快放晴。这是 7v7 橄榄球的完美比赛日。

在一些联邦制国家(如美国和加拿大),所得税在联邦和地方层面都会征收,因此税率和税级会因地区而异。

在一些联邦制国家(如美国和加拿大),所得税在联邦和地方层面都会征收。这意味着税率和税级会根据你所在的地区而变化。

这种全身长满羽毛的温血猛禽被认为像迅猛龙一样用两只腿直立行走,并带有爪子。

这种生物是恒温动物,以灰色为食,全身覆盖羽毛。据认为,它像迅猛龙一样用两条腿行走。

也许有一天,你的曾孙会站在一个外星世界,思考他们的远古祖先?

也许有一天,你的曾孙将站在一个外星世界,反思他们的祖先。

来自FLEURS-ASL基准的示例。SL2T能够准确地将复杂的ASL翻译成流畅的英语。偶尔在罕见手势、快速手指拼写("prey" → "grey")、被动语态结构、分类器描述(省略"claws")以及缺乏上下文的时态("kicked off" → "start")中仍会出现错误。

与社区共建

我们相信应与聋人社区共同建设,而不仅仅是为他们建设。聋人视角塑造了本项目的每个阶段——从由聋人Googler Sam Sepah构想的初期概念,到与聋人合作伙伴进行数据收集、在聋人用户研究中进行评估,以及与聋人专家共同评估技术影响。

为指导负责任的实际部署,我们成立了人工智能手语顾问委员会(AI Sign Language Advisory Committee, AISLAC),汇聚了众多全球聋人组织和领域专家。通过这种参与式治理模式,受我们技术影响最大的社区直接决定我们的开发优先级。我们与多方共同撰写了一份联合影响报告,详细透明地说明了SL2T 1.0在Gboard和Live Transcribe中的技术能力与当前限制——这种协作方式我们计划在所有重大手语技术发布中持续采用。

展望未来

SL2T建立在数十年来学术界和工业界的基础研究之上,但将ASL输入带到用户手机上只是开始。谷歌的使命是组织全球信息,使其对所有人普遍可用且有用。实现全面无障碍意味着与口语和书面语言达到完全平等。我们的团队正在努力将这项技术扩展到更多手语、手语生成以及前沿AI能力。我们期待负责任地分享我们的进展,使通过手语实现无障碍成为数字领域的标准。

您可以在Pixel 11上率先通过Gboard和Live Transcribe体验SL2T,更多设备即将推出——所有功能均无需额外费用。

致谢

本工作由Google DeepMind和Android团队联合完成。开发SL2T模型的核心团队包括:Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat、Sebastian Ebert、Dan Garrette、Manfred Georg、Vicky Holgate、Shankar Kumar、Mohammad Saboorian、Milos Stanojevic、Megh Umekar、John Wieting、Andy Zhang和Chris Dyer。

将模型集成到Gboard和Live Transcribe的Android团队包括:Ausmus Chang、Sai Aditya Chitturu、Dayle Chiu、Anna Chou、Ajay Dudani、Angana Ghosh、Alex Huang、Joanne Kim、Ed Lee、Thomas Lin、James Su、Yanchao Su和Sharlene Yuan。

我们感谢Anelia Angelova、Abhishek Bapna、Sara Basson、Glenn Cameron、Scott Crowell、Trevor Cohn、Noah Fiedel、Zoubin Ghahramani、Raia Hadsell、Tom Hudson、Alexander Hauerslev Jensen、Kazuya Kawakami、Phoebe Kirk、Peike Li、Liam McCafferty、Caroline Pantofaru、Abhinav Parashar、Christopher Patnoe、Laura Rimell、Sagar Savla、Sam Sepah、Thad Starner、Dave Uthus和Biao Zhang提供的额外支持。

我们也要感谢 MediaPipe Holistic(Google AI Edge)团队的成员:伊万·格里申琴科(Ivan Grishchenko)、阿尔西姆·阿布拉瓦茨基(Artsiom Ablavatski)、瓦伦丁·巴扎廖夫斯基(Valentin Bazarevsky)、埃沙·乌博杰(Esha Uboweja)、乔治·宋(George Sung)、乔纳森·巴卡什(Jonathan Baccash)、格雷戈里·卡皮亚克(Gregory Karpiak)、塞巴斯蒂安·施密特(Sebastian Schmidt)、苏里尔·沙(Suril Shah)、拉曼·萨罗金(Raman Sarokin)和朱贤·李(Juhyun Lee)。

我们还要感谢参与我们模型早期测试阶段的各位人士。