MetroLLM-Bench 评估语言模型作为交通服务终端运行时
MetroLLM-Bench 是一个包含955个案例的基准测试,用于评估语言模型作为交通服务终端的决策层,覆盖六个真实地铁系统。测试内容包括路线规划、票价计算、运营中断、无障碍服务和对抗性输入等。经过参数高效微调的40亿参数 Qwen 3.5 模型在确定性的 Tier 1 评估中获得91.3分,超过受测的 GPT-5.6 系统,并追平更大型的 GPT-5.4 配置;其 Q4_K_M 模型占用空间为2.6GB。基于规则的基线得分为84.6。基准测试、评估工具、复现指南和微调模型均已公开发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。