何时仅靠思考仍不够:训练小型推理模型超越其参数知识
一项研究区分了两类瓶颈:可以通过进一步反思解决的执行瓶颈,以及需要外部信息的知识瓶颈。研究提出 FlyBy,让小型推理模型先自行思考,必要时再选择性地查询更强大的模型。在 1,158 道高难度题目上,FlyBy-4B 的 pass@8 达到 45.96%,超过 Qwen3-14B 的 41.64%,服务成本则低 2.7 倍。FlyBy-8B 的 pass@8 达到 51.81%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。