FlavourBench:利用可执行的烹饪真值评测前沿语言模型
FlavourBench是一项自动化语言模型基准测试,利用经过版本控制的烹饪系统提供可复现的真值。每项任务给出8种食材,要求模型选择3种组成组合;在运行模型前,系统会先评估全部56种可能组合。研究使用涵盖替代、搭配和受限组合的534项任务,评测了27个前沿模型端点。Grok 4.6的点估计最高,为65.1分;351组模型配对中有101组得出了统计上明确的结论。发布内容包括提示词、原始回答、完整评分图、精确评测路径、内容哈希,以及可离线重建全部结果的验证器。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。