RESCUE-BENCH:面向关系感知型多方情绪支持对话系统的评测基准
该研究提出RESCUE,用于评估大语言模型在多方情绪支持对话中的表现。数据集来自真实的伴侣和家庭访谈,包含191个样本、7,079个标注对话轮次和1,064.8分钟视频。RESCUE设置了六项任务,评估模型理解人际关系动态以及提供关系敏感型支持的能力。对10个语言模型的实验显示,现有模型在处理局部情绪或干预线索时表现相对较好,但在关系模式预测、观点预测和支持策略预测等依赖关系理解的任务上仍存在明显不足。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。