多模态大语言模型能否解码创造性飞跃?用于跨概念理解的 C4
研究人员提出了 C4,这是一套受认知科学启发的评估框架,用于测试多模态大语言模型(MLLM)能否从不明显但有意义的概念关系中还原被编码的含义。该框架利用中文成语构建跨概念创造力任务,提供明确的连接路径、可调节的难度和精确答案。C4-Eval 包含 184 个合成题目和 37 个由人类创作的案例,在五种任务设置下形成 884 个主要答案恢复案例。对十个 MLLM 的评估显示,表现最好的闭源模型准确率分别为 50.7% 和 48.0%,开源模型明显落后。候选答案约束大幅提升了准确率,但连接提示和要求模型解释只带来了有限改进。结果表明,当前 MLLM 在解码跨概念的创造性编码意义方面仍存在明显不足。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。