LongWoF-Bench 评估 EvoMap Gene 在可验证长工作流任务中的表现
LongWoF-Bench 研究能否通过 EvoMap 将经过验证的执行经验整理为可复用的结构化“Gene”,以帮助模型完成复杂工作流。该基准包含 778 项可由机器验证的任务,涵盖代码生成、智能体环境合成、数学推理和规则遵循。在拥有 Claude Opus 验证执行轨迹的 252 项任务中,演化后的 Gene 在全部 7 个评测模型上均超过 Skill,优势为 8.7 至 15.5 个百分点。相比之下,从参考数据中蒸馏出的 Gene 并未表现出相同优势,说明经验是否具有经过验证的来源比单纯的压缩表示更重要。对于 Claude Opus,复用 Gene 还多完成了 39 项任务,并将解题过程中的 token 消耗降低了 9.9%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。