原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.33095
立即前往原文

REALM:面向具身反应式倾听的由粗到细生成框架

REALM 是一套为具身对话代理生成音频驱动面部动作的框架。它将听者的动作历史与说话者音频相结合,并考虑说话线索与听者反应之间的时间延迟。粗阶段解码器预测主要动作轨迹,随后通过音频条件随机调整细化面部表情,同时保留整体姿态。在 ViCo 和 L2L 数据集上的评估中,REALM 在多项动作质量指标上优于受测基线。研究团队还将系统部署到 Ameca 人形机器人上,并通过用户感知研究评估生成的行为。
行业资讯 应用 研究 2026-09-29 12:30:59 170 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。