DeepSeek V4.1 Flash 发力,中美顶尖模型 LiveBench 跑分差距缩至 3%
据彭博行业研究,中国顶尖 AI 模型的基准测试得分目前仅落后美国竞争对手约 3%;这一差距在今年 5 月约为 9%,年初则约为 15%。9 月发布的 DeepSeek V4.1 Flash 在 LiveBench 排名第六,得分 81.1,低于排名最高的 Anthropic 模型的 83.4 分。彭博分析师罗伯特·利亚认为,中国 AI 专业能力的深化以及针对国产硬件优化模型,推动了这一进展。他同时提醒,排名会不断变化,基准测试表现出色也未必容易变现。LiveBench 排名前 15 的模型中,只有 3 个来自中国。
本文来源:IT之家,仅供学习参考,版权归原作者所有。