GazeAnywhere 通过文本和视觉概念估计视线目标
该研究提出可提示式视线目标估计(Promptable Gaze Target Estimation,PGE),这是一种端到端方法,用于识别现实世界图像中人物注视的目标。与依赖头部边界框、人体姿态等独立输入的传统多阶段方法不同,PGE 可通过灵活的文本或视觉提示指定分析对象,例如“穿红色衬衫的男孩”或图像中的某个坐标,从而减少中间步骤中的错误累积。研究团队还开发了 Gaze-Co 数据集和基准,包含 12 万对带提示标注的图像,以及面向 PGE 的 GazeAnywhere 模型。该模型可同时完成目标定位、判断目标是否在画面内,并估计视线目标热力图。在多个 PGE 基准测试中,GazeAnywhere 达到当前最佳水平,并在具有挑战性的跨领域临床数据集上进行了评估。项目代码已开源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。