原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.20574
立即前往原文

FlavourBench:利用可执行的烹饪真值评测前沿语言模型

FlavourBench是一项自动化语言模型基准测试,利用经过版本控制的烹饪系统提供可复现的真值。每项任务给出8种食材,要求模型选择3种组成组合;在运行模型前,系统会先评估全部56种可能组合。研究使用涵盖替代、搭配和受限组合的534项任务,评测了27个前沿模型端点。Grok 4.6的点估计最高,为65.1分;351组模型配对中有101组得出了统计上明确的结论。发布内容包括提示词、原始回答、完整评分图、精确评测路径、内容哈希,以及可离线重建全部结果的验证器。
行业资讯 行业新闻 AI模型 研究 2026-08-24 19:31:13 974 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。