迈向临床语言模型的确定性数学求解器
一项研究评估了一种方法:语言模型不直接进行临床计算,而是生成针对具体病例的 Python 代码,再由受限的本地执行器进行确定性求解。在 1,100 个病例和 55 个计算器上,该方法使用 Qwen2.5-7B 时并未稳定优于直接计算;使用 Qwen2.5-32B 时则达到 90.53%,高于直接计算的 83.47%。研究表明,执行器可以提升部分模型的表现,但不能替代经过验证的公式或可靠的变量提取。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。