DeepSeek-V4-Pro-0813 正式版发布之后,最值得关注的并不是“模型又更新了一次”,而是它在 Agent、Coding、终端执行、自动化任务等一系列评测中的整体位置发生了明显变化。
这次我把DeepSeek-V4-Pro-0813、DeepSeek-V4-Flash-0731、DeepSeek-V4-Pro-Preview、DeepSeek-V4-Flash-Preview、GLM-5.2、Kimi-K3、Opus-4.8、Fable 5放到同一张表中,对比 11 项 Agent 相关 Benchmark。
先说结论:
如果只看这组公开评测数据,DeepSeek-V4-Pro-0813 已经全面超过 GLM-5.2,并且基本进入当前 Agent 模型的第一梯队。
但“全球第三”这个说法,需要更谨慎地理解。
它不是指某个统一权威榜单已经正式给 DeepSeek-V4-Pro-0813 排到全球第三,而是从这组 Agent Benchmark 的综合表现来看,V4 Pro 0813 已经能够稳定进入头部模型竞争区间,并且在部分项目上超过 Kimi-K3、Opus-4.8 和 Fable 5。
一、先看最直接的对比:V4 Pro 0813 全面超过 GLM-5.2
这一点其实是整张表里最明确的结论。
在 GLM-5.2 已公布成绩的项目中,DeepSeek-V4-Pro-0813 全部领先。
HLE
HLE 原表同时给出了无工具和有工具两种成绩。
无工具:
DeepSeek-V4-Pro-0813:42.7
GLM-5.2:40.5
有工具:
DeepSeek-V4-Pro-0813:60.0
GLM-5.2:54.7
无论是否允许工具调用,V4 Pro 0813 都领先。
二、Terminal Bench 2.1:已经接近最高水平
Terminal Bench 2.1 主要考察模型在终端环境中的实际操作能力。
成绩如下:
DeepSeek-V4-Pro-0813:87.9
DeepSeek-V4-Flash-0731:82.7
GLM-5.2:81.0
Kimi-K3:88.3
Opus-4.8:85.0
Fable 5:88.0
这一项中,V4 Pro 0813 并不是第一。
Kimi-K3 以 88.3 排在前面,Fable 5 为 88.0。
但 V4 Pro 0813 的 87.9 已经非常接近最高分,同时超过了 Opus-4.8 和 GLM-5.2。
换句话说,在终端任务这个维度上,V4 Pro 0813 已经不是“追赶者”,而是直接进入头部模型竞争区间。
三、NL2Repo:明显超过 GLM,但距离 Opus 还有差距
NL2Repo 的结果比较有代表性:
DeepSeek-V4-Pro-0813:61.5
DeepSeek-V4-Flash-0731:54.2
V4-Pro-Preview:38.5
V4-Flash-Preview:39.4
GLM-5.2:48.9
Opus-4.8:69.7
Kimi-K3 和 Fable 5 在原表中没有公布这一项成绩。
这里可以看到两个趋势。
第一,V4 Pro 0813 相比自己的 Preview 版本提升非常大。
第二,它已经明显超过 GLM-5.2,但距离 Opus-4.8 依然存在差距。
所以如果只看 NL2Repo,还不能说 DeepSeek 已经全面达到 Opus 水平。
四、Cybergym:V4 Pro 0813 甚至略高于 Fable 5
Cybergym 是这张表中很值得注意的一项。
成绩如下:
DeepSeek-V4-Pro-0813:83.3
DeepSeek-V4-Flash-0731:76.7
V4-Pro-Preview:52.7
V4-Flash-Preview:38.7
Kimi-K3:80.0
Opus-4.8:78.3
Fable 5:83.1
这一项中,V4 Pro 0813 拿到了83.3。
不仅高于 Kimi-K3 和 Opus-4.8,甚至还比 Fable 5 的 83.1 高 0.2。
这说明 DeepSeek-V4-Pro-0813 在部分复杂 Agent 任务上,已经具备直接拿下头部成绩的能力。
五、DeepSWE:正式版和 Preview 已经完全不是一个级别
如果要找一个最能体现这次升级幅度的 Benchmark,我会选 DeepSWE。
成绩变化非常夸张:
V4-Flash-Preview:7.3
V4-Pro-Preview:12.8
GLM-5.2:46.2
V4-Flash-0731:54.4
Opus-4.8:58.0
V4-Pro-0813:62.7
Kimi-K3:67.5
Fable 5:70.0
从 V4-Pro-Preview 的 12.8 到正式版的 62.7,跨度非常大。
这里最值得关注的不是绝对排名,而是 DeepSeek 自身版本迭代的变化。
Preview 阶段的 V4 Pro 在这一项几乎没有进入头部竞争区间,而 0813 正式版已经超过 Opus-4.8 和 GLM-5.2,仅落后于 Kimi-K3 和 Fable 5。
这已经不是常规意义上的“小版本优化”。
六、Toolathlon-Verified:进入第一梯队,但没有拿第一
Toolathlon-Verified:
DeepSeek-V4-Pro-0813:74.1
DeepSeek-V4-Flash-0731:70.3
V4-Pro-Preview:55.9
V4-Flash-Preview:49.7
GLM-5.2:59.9
Kimi-K3:76.5
Opus-4.8:76.2
Fable 5:77.9
这一项很能说明 V4 Pro 0813 当前的位置。
它已经明显甩开 GLM-5.2 和两个 Preview 版本,但 Kimi-K3、Opus-4.8、Fable 5 仍然更高。
也就是说:
DeepSeek 已经进入第一梯队,但第一梯队内部仍然存在差距。
这可能是描述 V4 Pro 0813 最准确的一句话。
七、Agents' Last Exam:和 Opus-4.8 打平
Agents' Last Exam 的成绩:
DeepSeek-V4-Pro-0813:25.7
DeepSeek-V4-Flash-0731:25.2
V4-Pro-Preview:16.5
V4-Flash-Preview:15.8
GLM-5.2:23.8
Kimi-K3:27.6
Opus-4.8:25.7
Fable 5 没有公布这一项成绩。
这里 V4 Pro 0813 和 Opus-4.8 都是 25.7,Kimi-K3 为 27.6。
对于 Agent 综合任务来说,能够在这一项与 Opus-4.8 打平,本身就说明 V4 Pro 0813 已经进入非常高的位置。
八、AutomationBench:V4 Pro 0813 直接拿下当前表格最高分
AutomationBench 是这次 DeepSeek 表现非常亮眼的一项。
成绩:
DeepSeek-V4-Pro-0813:31.8
DeepSeek-V4-Flash-0731:25.1
V4-Pro-Preview:12.8
V4-Flash-Preview:10.8
GLM-5.2:12.9
Kimi-K3:30.8
Opus-4.8:27.2
Fable 5:29.1
V4 Pro 0813 的31.8是这张表中该项目的最高成绩。
比 Kimi-K3 高 1.0,比 Fable 5 高 2.7,比 Opus-4.8 高 4.6。
如果平时主要关注 Agent 自动化执行、工作流编排、工具链调用,这个成绩很有参考价值。
九、DSBench-FullStack:整体已经非常接近头部模型
DSBench-FullStack:
DeepSeek-V4-Pro-0813:71.1
DeepSeek-V4-Flash-0731:68.7
V4-Pro-Preview:41.8
V4-Flash-Preview:37.0
GLM-5.2:61.8
Kimi-K3:73.7
Opus-4.8:71.6
Fable 5:77.2
这里 V4 Pro 0813 与 Opus-4.8 只有 0.5 分的差距。
虽然 Fable 5 仍然明显领先,但从 41.8 的 Preview 到 71.1 的正式版,提升已经非常明显。
十、DSBench-Hard:Opus-4.8 仍然领先
DSBench-Hard:
DeepSeek-V4-Pro-0813:67.2
DeepSeek-V4-Flash-0731:59.6
V4-Pro-Preview:31.1
V4-Flash-Preview:25.8
GLM-5.2:54.5
Kimi-K3:63.0
Opus-4.8:71.7
Fable 5:68.3
这一项 V4 Pro 0813 超过 Kimi-K3 和 GLM-5.2,也接近 Fable 5,但 Opus-4.8 依然保持明显优势。
这也是为什么不能简单把这组数据解读成“DeepSeek 已经全面超过所有模型”。
十一、为什么说 V4 Pro 0813 已经全面超过 GLM-5.2?
把双方已公布的同项目成绩直接放在一起看:
| Benchmark | V4 Pro 0813 | GLM-5.2 |
|---|---|---|
| HLE 无工具 | 42.7 | 40.5 |
| HLE 有工具 | 60.0 | 54.7 |
| Terminal Bench 2.1 | 87.9 | 81.0 |
| NL2Repo | 61.5 | 48.9 |
| DeepSWE | 62.7 | 46.2 |
| Toolathlon-Verified | 74.1 | 59.9 |
| Agents' Last Exam | 25.7 | 23.8 |
| AutomationBench | 31.8 | 12.9 |
| DSBench-FullStack | 71.1 | 61.8 |
| DSBench-Hard | 67.2 | 54.5 |
Cybergym 中 GLM-5.2 没有给出成绩,因此不参与比较。
从已有数据看,V4 Pro 0813 在双方都公布成绩的项目中全部领先。
所以“全面超过 GLM-5.2”在这张表的范围内,是有数据依据的。
十二、那“全球第三”这个说法成立吗?
这里要区分两个概念。
第一,单项 Benchmark 排名。
V4 Pro 0813 并不是所有项目都能排第三,有些项目甚至拿到第一,有些项目则会落后于 Kimi-K3、Opus-4.8 或 Fable 5。
第二,整体竞争力。
如果综合看这 11 项 Agent 相关任务,V4 Pro 0813 已经非常稳定地出现在头部区间。
它的特点不是“所有项目第一”,而是:
很少出现明显短板;
相比 Preview 版本大幅提升;
全面超过 GLM-5.2;
多项成绩超过 Opus-4.8;
部分项目超过 Kimi-K3;
个别项目甚至超过 Fable 5。
因此,“全球第三?”更适合作为一个讨论性的标题,而不是绝对排名结论。
如果一定要给它一个定位,我更愿意说:
DeepSeek-V4-Pro-0813 已经进入全球第一梯队,并且具备冲击前三的综合实力。
十三、这次升级真正值得关注的是什么?
真正重要的其实不是某一个分数。
而是 DeepSeek V4 从 Preview 到正式版之后,在多种 Agent 类任务中同时完成了一次明显跃升。
尤其是:
DeepSWE:12.8 → 62.7
DSBench-FullStack:41.8 → 71.1
DSBench-Hard:31.1 → 67.2
Cybergym:52.7 → 83.3
这些变化意味着 V4 Pro 0813 在代码工程、终端执行、Agent 工具调用、自动化任务等场景中的能力已经明显成熟。
对于真正把大模型用于开发工作的用户来说,这类提升往往比单纯的知识问答分数更重要。
因为实际开发中最需要的不是模型“知道多少”,而是它能不能:
理解复杂工程;
连续完成多步任务;
正确调用工具;
在终端环境执行操作;
修改代码后继续验证;
在长链路任务中保持稳定。
从这张表来看,V4 Pro 0813 在这些能力上的提升已经非常明显。
总结
如果只看本次公开的 Agent Benchmark 数据,可以得到几个比较明确的结论。
第一,DeepSeek-V4-Pro-0813 已经全面超过 GLM-5.2。
双方共同公布成绩的项目中,V4 Pro 0813 全部领先。
第二,V4 Pro 0813 已经进入全球第一梯队。
它在 Cybergym、AutomationBench、Terminal Bench 等项目中的成绩已经可以与 Kimi-K3、Opus-4.8、Fable 5 正面对比。
第三,它还没有做到全面第一。
Opus-4.8、Kimi-K3、Fable 5 在不同项目中依然各有优势。
第四,这次最重要的变化是整体能力提升,而不是单项刷榜。
从 Preview 到 0813 正式版,DeepSWE、Cybergym、DSBench 等多项任务同时大幅上涨,这说明 DeepSeek 在 Agent 和 Coding 能力上的进步已经开始从“单点提升”变成“整体提升”。
所以回到标题:
全面超过 GLM-5.2,DeepSeek-V4-Pro-0813 全球第三?
“全面超过 GLM-5.2”,从这张表来看基本可以确认。
至于“全球第三”,目前更适合作为一种综合实力判断,而不是严格榜单名次。
但有一点已经很明确:
DeepSeek-V4-Pro-0813 已经不是在追赶第一梯队,而是正式进入第一梯队参与竞争了。