DeepSeek V4 Pro 编程评测排名第二,成本仅为 Kimi K3 的十四分之一
CLUE 团队最新发布的 SuperCLUE-Terminal 评测显示,DeepSeek-V4-Pro-0813 得分 51.52 分,排名第二,仅次于获得 60.61 分的 Kimi K3,同时超过 GLM-5.2 和旧版 DeepSeek-V4-Flash。根据公布结果,该模型每道题的调用成本约为 1.42 元,约是 Kimi K3 的十四分之一。评测面向中国开发者,采用真实中文编程任务,并以 Claude Code 作为统一运行框架。每道题包含 50 至 110 轮交互,考察模型理解需求、规划任务、调用工具、排错和修改代码的能力。测试场景包括网页、3D 游戏和工程脚本。少数创意绘图题目存在轻微结构瑕疵。
本文来源:AIbase,仅供学习参考,版权归原作者所有。