LLM-as-Jev:LLM 已具备 Jev 式决策模型能力——何时以及如何微调
Jev 式决策模型针对预先设定的选项输出概率分布,而不是生成自由文本。本研究考察通用 LLM 原本具备这种能力的程度,以及何时需要微调。LLM-as-Jev 直接从下一个 token 的概率中提取经过校准的决策,并提供免训练推理方案和微调方法。在 Qwen3.5-4B 和 Qwen3-0.6B 上的评估显示,4B 模型无需训练便达到基于相同底座的社区 Jev 式模型水平,还能处理任意数量的选项及图像决策。微调主要提升较弱模型和特定任务(如多选项意图路由)的表现;对强模型的收益则逐渐减少。KL 锚定有助于避免对话文本生成能力退化。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。