原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.24983
立即前往原文

onPanda:通过令牌级纠正高效标注大语言模型和智能体的在线策略对齐数据

onPanda是一款用于高效标注大语言模型和智能体对齐数据的交互式工具。标注者在模型回答中找到第一个不恰当的令牌,从模型候选项中选择替代内容或直接输入正确文本,然后从修正后的前缀继续生成。一项小规模对照研究显示,与手动事后编辑相比,该方法可将标注时间中位数缩短52%。由于最终回答中的大多数令牌仍由模型生成,所得数据在很大程度上保留模型的采样分布,适合构建在线策略监督微调和偏好数据。记录的纠正还提供了精确的位置级监督,以及自然配对的正负样本。该项目支持连接外部工具和真实环境中的智能体,并发布Panda-CVL数据集及令牌级纠正基准。
行业资讯 应用 研究 开源 2026-09-22 13:01:02 993 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。