将手语 AI 带入用户手中
# 将手语 AI 带入用户手中
—— Google DeepMind

今天,我们推出了一种多语种手语转文本(SL2T)翻译模型,这是为聋哑和听力障碍用户提供的新手语功能的重大突破。
AI 在处理口语语言方面的能力在过去几十年中取得了迅速的发展,使得自动翻译、听写和自然对话界面等技术变得轻松易用。然而,这场技术革命尚未惠及全球超过 200 种手语,以及大约 7000 万使用它们的聋哑和听力障碍人士。
我们今天推出的大规模多语种手语转文本(SL2T)翻译模型标志着质量和通用性的重大突破。借助它,我们首次将手语 AI 从实验室带入消费者产品:SL2T 支持 Gboard 和 Pixel 11 上的实时转录,首批支持美国手语(ASL)到英语的转录。未来还会推出更多设备,并增加其它语言。
与听力用户可以使用听写代替输入的方式类似,该功能使聋哑用户可以在任何通常需要输入的地方对着手机手势。例如,用户可以使用手势来搜索网页、撰写消息或文档,并询问 Gemini 来解决查询或执行任务。在实时转录中,用户可以在对话中进行手势回应,而不必来回打字。根据我们的测试,使用 ASL 手势比用英语打字更快速、更自然,且更具乐趣。
## 为什么手语重要
手语是全球聋人社区的主要语言,也是聋人文化认同的基石。聋人之间在手语、口语、阅读和写作能力上有很大的差异,因此支持多种交流方式非常重要。聋人利用手语处理信息的好处,与听力人士利用口语处理相似,这项技术也为缩小聋人和听人之间的沟通差距开辟了新可能。尽管这种积极的社会影响机会存在,但手语 AI 的进展一直很缓慢,原因不仅仅在于为手语构建 AI 面临复杂的挑战,还因为存在关于这些语言如何运作的广泛误解。
与口语转录相比,手语翻译面临两个核心挑战。首先,转录语音主要是将声音与文本进行顺序映射,而手语是独立的自然语言,拥有自己独特的语法和词汇。因此,它们需要真正的机器翻译,而非单纯的手势转文字过程。其次,模型必须学会“观察”和理解身体运动。手语通过手、臂、躯干、头部和面部的同时动作传递意义。准确跟踪这些动作在高帧率下是一项困难且计算要求高的计算机视觉任务。
正因为如此,很容易理解为何一些早期的手语技术尝试(如手语手套)存在根本限制:手语并不只是“手上的英语”。它们需要对细微的全身运动进行复杂的视觉感知和完整的语言翻译。SL2T 被设计用来解决这两个问题。
## SL2T 如何工作
我们通过结合以用户为中心的文化视角与大规模数据扩展来构建 SL2T。该模型在超过 50 种手语的 10 万小时以上的数据上进行训练,其中约四分之一的数据来自 ASL。对不同语言、方言和熟练度水平的共同训练使得模型学习到了共享的基础结构,从而在我们的实验中优于单一语言模型。
为了保护用户隐私,SL2T 将手语视为一系列姿态地标位置,而不是原始摄像头画面。设备上的模型([MediaPipe Holistic](https://research.google/blog/mediapipe-holistic-simultaneous-face-hand-and-pose-prediction-on-device/))跟踪手势者的位置,只有这些几何坐标被发送到服务器进行翻译,原始视频数据可以立即丢弃。
SL2T 将这一坐标序列直接转换为文本,跳过在先前手语翻译工作中普遍使用的中间注释(即“光谱”)。光谱未能捕捉到手语的丰富非线性特征,例如非手动标记和空间构造。直接从地标翻译省去了人工词汇限制,使得翻译质量可以直接随着数据规模的增大而提高。
根据像 [FLEURS-ASL](https://www.kaggle.com/datasets/googleai/fleurs-asl) 这样的关键基准,SL2T 是迄今为止最强大的手语翻译模型,该基准评估 ASL 到英语的翻译质量。SL2T 在零样本测试中达到了 70 的 BLEURT 分数,这一分数远高于之前任何报告的分数。然而,优化学术基准的不一定能保证在实际应用中的可用性,因此我们在诸如最小化实时延迟、避免在非手势输入下出现幻觉、确保对 10% 左撇子手势者的公平性以及提高一手手势的性能等实际问题上付出很多努力。
## 与社区共同构建
我们认为在建设过程中要*与*聋人社区合作,而不仅仅是*为*他们服务。聋人视角在这个项目的每个阶段都发挥了作用 —— 从聋人谷歌员工 Sam Sepah 的概念化,到与聋人合作伙伴的数据收集,再到在聋人用户研究中进行评估,以及与聋人专家共同评估技术的影响。
为了指导一切实际部署的责任性,我们成立了 AI 手语咨询委员会(AISLAC),聚集了许多全球聋人组织和学科专家。通过这种参与式治理模式,受我们技术影响最大的社区直接影响我们的发展优先级。我们共同撰写了一份[联合影响报告](https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/putting-sign-language-ai-into-users-hands/aislac-joint-impact-report-for-sl2t-1-0.pdf),详细说明了 SL2T 1.0 在 Gboard 和实时转录中的能力和当前限制 — 这种协作的方式是我们计划在所有主要手语发布中继续进行的。
## 展望未来
SL2T 建立在数十年的基础研究之上,但将 ASL 输入带入用户手机仅仅是个开始。谷歌的使命是组织全球信息并使其普遍可用。实现完全的可及性意味着要与口语和书面语言达到完全平等。我们的团队正在努力将这项技术扩展到更多手语、手语生成和前沿 AI 能力。我们期待在将手语的访问标准化到数字环境中时,负责地分享我们的进展。
您可以在 [Pixel 11](https://store.google.com/magazine/google_pixel_11) 的 Gboard 和实时转录中体验 SL2T,更多设备即将推出 — 完全免费。
## 致谢
这项工作是由 Google DeepMind 和 Android 团队共同完成的。开发 SL2T 模型的核心团队成员包括:Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat、Sebastian Ebert、Dan Garrette、Manfred Georg、Vicky Holgate、Shankar Kumar、Mohammad Saboorian、Miloš Stanojević、Megh Umekar、John Wieting、Andy Zhang 和 Chris Dyer。
将该模型集成到 Gboard 和实时转录中的 Android 团队有:Ausmus Chang、Sai Aditya Chitturu、Dayle Chiu、Anna Chou、Ajay Dudani、Angana Ghosh、Alex Huang、Joanne Kim、Ed Lee、Thomas Lin、James Su、Yanchao Su 和 Sharlene Yuan。
我们感谢参与模型早期测试的人员。
---
原文链接:[点击查看](https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/)
—— Google DeepMind

今天,我们推出了一种多语种手语转文本(SL2T)翻译模型,这是为聋哑和听力障碍用户提供的新手语功能的重大突破。
AI 在处理口语语言方面的能力在过去几十年中取得了迅速的发展,使得自动翻译、听写和自然对话界面等技术变得轻松易用。然而,这场技术革命尚未惠及全球超过 200 种手语,以及大约 7000 万使用它们的聋哑和听力障碍人士。
我们今天推出的大规模多语种手语转文本(SL2T)翻译模型标志着质量和通用性的重大突破。借助它,我们首次将手语 AI 从实验室带入消费者产品:SL2T 支持 Gboard 和 Pixel 11 上的实时转录,首批支持美国手语(ASL)到英语的转录。未来还会推出更多设备,并增加其它语言。
与听力用户可以使用听写代替输入的方式类似,该功能使聋哑用户可以在任何通常需要输入的地方对着手机手势。例如,用户可以使用手势来搜索网页、撰写消息或文档,并询问 Gemini 来解决查询或执行任务。在实时转录中,用户可以在对话中进行手势回应,而不必来回打字。根据我们的测试,使用 ASL 手势比用英语打字更快速、更自然,且更具乐趣。
## 为什么手语重要
手语是全球聋人社区的主要语言,也是聋人文化认同的基石。聋人之间在手语、口语、阅读和写作能力上有很大的差异,因此支持多种交流方式非常重要。聋人利用手语处理信息的好处,与听力人士利用口语处理相似,这项技术也为缩小聋人和听人之间的沟通差距开辟了新可能。尽管这种积极的社会影响机会存在,但手语 AI 的进展一直很缓慢,原因不仅仅在于为手语构建 AI 面临复杂的挑战,还因为存在关于这些语言如何运作的广泛误解。
与口语转录相比,手语翻译面临两个核心挑战。首先,转录语音主要是将声音与文本进行顺序映射,而手语是独立的自然语言,拥有自己独特的语法和词汇。因此,它们需要真正的机器翻译,而非单纯的手势转文字过程。其次,模型必须学会“观察”和理解身体运动。手语通过手、臂、躯干、头部和面部的同时动作传递意义。准确跟踪这些动作在高帧率下是一项困难且计算要求高的计算机视觉任务。
正因为如此,很容易理解为何一些早期的手语技术尝试(如手语手套)存在根本限制:手语并不只是“手上的英语”。它们需要对细微的全身运动进行复杂的视觉感知和完整的语言翻译。SL2T 被设计用来解决这两个问题。
## SL2T 如何工作
我们通过结合以用户为中心的文化视角与大规模数据扩展来构建 SL2T。该模型在超过 50 种手语的 10 万小时以上的数据上进行训练,其中约四分之一的数据来自 ASL。对不同语言、方言和熟练度水平的共同训练使得模型学习到了共享的基础结构,从而在我们的实验中优于单一语言模型。
为了保护用户隐私,SL2T 将手语视为一系列姿态地标位置,而不是原始摄像头画面。设备上的模型([MediaPipe Holistic](https://research.google/blog/mediapipe-holistic-simultaneous-face-hand-and-pose-prediction-on-device/))跟踪手势者的位置,只有这些几何坐标被发送到服务器进行翻译,原始视频数据可以立即丢弃。
SL2T 将这一坐标序列直接转换为文本,跳过在先前手语翻译工作中普遍使用的中间注释(即“光谱”)。光谱未能捕捉到手语的丰富非线性特征,例如非手动标记和空间构造。直接从地标翻译省去了人工词汇限制,使得翻译质量可以直接随着数据规模的增大而提高。
根据像 [FLEURS-ASL](https://www.kaggle.com/datasets/googleai/fleurs-asl) 这样的关键基准,SL2T 是迄今为止最强大的手语翻译模型,该基准评估 ASL 到英语的翻译质量。SL2T 在零样本测试中达到了 70 的 BLEURT 分数,这一分数远高于之前任何报告的分数。然而,优化学术基准的不一定能保证在实际应用中的可用性,因此我们在诸如最小化实时延迟、避免在非手势输入下出现幻觉、确保对 10% 左撇子手势者的公平性以及提高一手手势的性能等实际问题上付出很多努力。
## 与社区共同构建
我们认为在建设过程中要*与*聋人社区合作,而不仅仅是*为*他们服务。聋人视角在这个项目的每个阶段都发挥了作用 —— 从聋人谷歌员工 Sam Sepah 的概念化,到与聋人合作伙伴的数据收集,再到在聋人用户研究中进行评估,以及与聋人专家共同评估技术的影响。
为了指导一切实际部署的责任性,我们成立了 AI 手语咨询委员会(AISLAC),聚集了许多全球聋人组织和学科专家。通过这种参与式治理模式,受我们技术影响最大的社区直接影响我们的发展优先级。我们共同撰写了一份[联合影响报告](https://storage.googleapis.com/deepmind-media/DeepMind.com/Blog/putting-sign-language-ai-into-users-hands/aislac-joint-impact-report-for-sl2t-1-0.pdf),详细说明了 SL2T 1.0 在 Gboard 和实时转录中的能力和当前限制 — 这种协作的方式是我们计划在所有主要手语发布中继续进行的。
## 展望未来
SL2T 建立在数十年的基础研究之上,但将 ASL 输入带入用户手机仅仅是个开始。谷歌的使命是组织全球信息并使其普遍可用。实现完全的可及性意味着要与口语和书面语言达到完全平等。我们的团队正在努力将这项技术扩展到更多手语、手语生成和前沿 AI 能力。我们期待在将手语的访问标准化到数字环境中时,负责地分享我们的进展。
您可以在 [Pixel 11](https://store.google.com/magazine/google_pixel_11) 的 Gboard 和实时转录中体验 SL2T,更多设备即将推出 — 完全免费。
## 致谢
这项工作是由 Google DeepMind 和 Android 团队共同完成的。开发 SL2T 模型的核心团队成员包括:Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat、Sebastian Ebert、Dan Garrette、Manfred Georg、Vicky Holgate、Shankar Kumar、Mohammad Saboorian、Miloš Stanojević、Megh Umekar、John Wieting、Andy Zhang 和 Chris Dyer。
将该模型集成到 Gboard 和实时转录中的 Android 团队有:Ausmus Chang、Sai Aditya Chitturu、Dayle Chiu、Anna Chou、Ajay Dudani、Angana Ghosh、Alex Huang、Joanne Kim、Ed Lee、Thomas Lin、James Su、Yanchao Su 和 Sharlene Yuan。
我们感谢参与模型早期测试的人员。
---
原文链接:[点击查看](https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/)
评论
暂无评论。