面向科学领域的终端环境自监督扩展
一种新方法利用现有科学软件工作流,为终端智能体生成训练任务和可验证的参考输出,从而减少逐项手工编写参考解答的需求。研究在六个领域、46个软件系列中的500个工作流上进行了测试。由此生成的训练样例使Qwen3.8-27B在Terminal-Bench 2上的平均成绩在三个随机种子下从47.94%提升至53.56%。结果表明,现有软件工作流有望成为大规模、经过验证的训练数据来源。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。