原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.02710
立即前往原文

面向科学领域的终端环境自监督扩展

一种新方法利用现有科学软件工作流,为终端智能体生成训练任务和可验证的参考输出,从而减少逐项手工编写参考解答的需求。研究在六个领域、46个软件系列中的500个工作流上进行了测试。由此生成的训练样例使Qwen3.8-27B在Terminal-Bench 2上的平均成绩在三个随机种子下从47.94%提升至53.56%。结果表明,现有软件工作流有望成为大规模、经过验证的训练数据来源。
行业资讯 AI模型 研究 2026-10-06 05:01:05 578 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。