手语人工智能首次进入消费级产品,谷歌 DeepMind 推出翻译模型
谷歌 DeepMind 发布了一款大规模多语言手语转文本模型。Pixel 11 系列的 Gboard 和 Live Transcribe 将首先支持美国手语输入,未来计划扩展到更多手语和设备。该模型使用涵盖 50 多种手语的 10 万小时数据训练,能够同时分析身体多个部位的运动,并将手语视为独立的自然语言,而不是简单的手势序列。为保护隐私,系统会将手语转换为身体关键点的位置数据,无需把原始视频流发送到服务器。
本文来源:IT之家,仅供学习参考,版权归原作者所有。