news 2026/8/14 4:47:51

全面超过GLM-5.2,DeepSeek-V4-Pro-0813全球第三?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
全面超过GLM-5.2,DeepSeek-V4-Pro-0813全球第三?

DeepSeek-V4-Pro-0813 正式版发布之后,最值得关注的并不是“模型又更新了一次”,而是它在 Agent、Coding、终端执行、自动化任务等一系列评测中的整体位置发生了明显变化。

这次我把DeepSeek-V4-Pro-0813、DeepSeek-V4-Flash-0731、DeepSeek-V4-Pro-Preview、DeepSeek-V4-Flash-Preview、GLM-5.2、Kimi-K3、Opus-4.8、Fable 5放到同一张表中,对比 11 项 Agent 相关 Benchmark。

先说结论:

如果只看这组公开评测数据,DeepSeek-V4-Pro-0813 已经全面超过 GLM-5.2,并且基本进入当前 Agent 模型的第一梯队。

但“全球第三”这个说法,需要更谨慎地理解。

它不是指某个统一权威榜单已经正式给 DeepSeek-V4-Pro-0813 排到全球第三,而是从这组 Agent Benchmark 的综合表现来看,V4 Pro 0813 已经能够稳定进入头部模型竞争区间,并且在部分项目上超过 Kimi-K3、Opus-4.8 和 Fable 5。


一、先看最直接的对比:V4 Pro 0813 全面超过 GLM-5.2

这一点其实是整张表里最明确的结论。

在 GLM-5.2 已公布成绩的项目中,DeepSeek-V4-Pro-0813 全部领先。

HLE

HLE 原表同时给出了无工具和有工具两种成绩。

无工具:

  • DeepSeek-V4-Pro-0813:42.7

  • GLM-5.2:40.5

有工具:

  • DeepSeek-V4-Pro-0813:60.0

  • GLM-5.2:54.7

无论是否允许工具调用,V4 Pro 0813 都领先。


二、Terminal Bench 2.1:已经接近最高水平

Terminal Bench 2.1 主要考察模型在终端环境中的实际操作能力。

成绩如下:

  • DeepSeek-V4-Pro-0813:87.9

  • DeepSeek-V4-Flash-0731:82.7

  • GLM-5.2:81.0

  • Kimi-K3:88.3

  • Opus-4.8:85.0

  • Fable 5:88.0

这一项中,V4 Pro 0813 并不是第一。

Kimi-K3 以 88.3 排在前面,Fable 5 为 88.0。

但 V4 Pro 0813 的 87.9 已经非常接近最高分,同时超过了 Opus-4.8 和 GLM-5.2。

换句话说,在终端任务这个维度上,V4 Pro 0813 已经不是“追赶者”,而是直接进入头部模型竞争区间。


三、NL2Repo:明显超过 GLM,但距离 Opus 还有差距

NL2Repo 的结果比较有代表性:

  • DeepSeek-V4-Pro-0813:61.5

  • DeepSeek-V4-Flash-0731:54.2

  • V4-Pro-Preview:38.5

  • V4-Flash-Preview:39.4

  • GLM-5.2:48.9

  • Opus-4.8:69.7

Kimi-K3 和 Fable 5 在原表中没有公布这一项成绩。

这里可以看到两个趋势。

第一,V4 Pro 0813 相比自己的 Preview 版本提升非常大。

第二,它已经明显超过 GLM-5.2,但距离 Opus-4.8 依然存在差距。

所以如果只看 NL2Repo,还不能说 DeepSeek 已经全面达到 Opus 水平。


四、Cybergym:V4 Pro 0813 甚至略高于 Fable 5

Cybergym 是这张表中很值得注意的一项。

成绩如下:

  • DeepSeek-V4-Pro-0813:83.3

  • DeepSeek-V4-Flash-0731:76.7

  • V4-Pro-Preview:52.7

  • V4-Flash-Preview:38.7

  • Kimi-K3:80.0

  • Opus-4.8:78.3

  • Fable 5:83.1

这一项中,V4 Pro 0813 拿到了83.3

不仅高于 Kimi-K3 和 Opus-4.8,甚至还比 Fable 5 的 83.1 高 0.2。

这说明 DeepSeek-V4-Pro-0813 在部分复杂 Agent 任务上,已经具备直接拿下头部成绩的能力。


五、DeepSWE:正式版和 Preview 已经完全不是一个级别

如果要找一个最能体现这次升级幅度的 Benchmark,我会选 DeepSWE。

成绩变化非常夸张:

  • V4-Flash-Preview:7.3

  • V4-Pro-Preview:12.8

  • GLM-5.2:46.2

  • V4-Flash-0731:54.4

  • Opus-4.8:58.0

  • V4-Pro-0813:62.7

  • Kimi-K3:67.5

  • Fable 5:70.0

从 V4-Pro-Preview 的 12.8 到正式版的 62.7,跨度非常大。

这里最值得关注的不是绝对排名,而是 DeepSeek 自身版本迭代的变化。

Preview 阶段的 V4 Pro 在这一项几乎没有进入头部竞争区间,而 0813 正式版已经超过 Opus-4.8 和 GLM-5.2,仅落后于 Kimi-K3 和 Fable 5。

这已经不是常规意义上的“小版本优化”。


六、Toolathlon-Verified:进入第一梯队,但没有拿第一

Toolathlon-Verified:

  • DeepSeek-V4-Pro-0813:74.1

  • DeepSeek-V4-Flash-0731:70.3

  • V4-Pro-Preview:55.9

  • V4-Flash-Preview:49.7

  • GLM-5.2:59.9

  • Kimi-K3:76.5

  • Opus-4.8:76.2

  • Fable 5:77.9

这一项很能说明 V4 Pro 0813 当前的位置。

它已经明显甩开 GLM-5.2 和两个 Preview 版本,但 Kimi-K3、Opus-4.8、Fable 5 仍然更高。

也就是说:

DeepSeek 已经进入第一梯队,但第一梯队内部仍然存在差距。

这可能是描述 V4 Pro 0813 最准确的一句话。


七、Agents' Last Exam:和 Opus-4.8 打平

Agents' Last Exam 的成绩:

  • DeepSeek-V4-Pro-0813:25.7

  • DeepSeek-V4-Flash-0731:25.2

  • V4-Pro-Preview:16.5

  • V4-Flash-Preview:15.8

  • GLM-5.2:23.8

  • Kimi-K3:27.6

  • Opus-4.8:25.7

Fable 5 没有公布这一项成绩。

这里 V4 Pro 0813 和 Opus-4.8 都是 25.7,Kimi-K3 为 27.6。

对于 Agent 综合任务来说,能够在这一项与 Opus-4.8 打平,本身就说明 V4 Pro 0813 已经进入非常高的位置。


八、AutomationBench:V4 Pro 0813 直接拿下当前表格最高分

AutomationBench 是这次 DeepSeek 表现非常亮眼的一项。

成绩:

  • DeepSeek-V4-Pro-0813:31.8

  • DeepSeek-V4-Flash-0731:25.1

  • V4-Pro-Preview:12.8

  • V4-Flash-Preview:10.8

  • GLM-5.2:12.9

  • Kimi-K3:30.8

  • Opus-4.8:27.2

  • Fable 5:29.1

V4 Pro 0813 的31.8是这张表中该项目的最高成绩。

比 Kimi-K3 高 1.0,比 Fable 5 高 2.7,比 Opus-4.8 高 4.6。

如果平时主要关注 Agent 自动化执行、工作流编排、工具链调用,这个成绩很有参考价值。


九、DSBench-FullStack:整体已经非常接近头部模型

DSBench-FullStack:

  • DeepSeek-V4-Pro-0813:71.1

  • DeepSeek-V4-Flash-0731:68.7

  • V4-Pro-Preview:41.8

  • V4-Flash-Preview:37.0

  • GLM-5.2:61.8

  • Kimi-K3:73.7

  • Opus-4.8:71.6

  • Fable 5:77.2

这里 V4 Pro 0813 与 Opus-4.8 只有 0.5 分的差距。

虽然 Fable 5 仍然明显领先,但从 41.8 的 Preview 到 71.1 的正式版,提升已经非常明显。


十、DSBench-Hard:Opus-4.8 仍然领先

DSBench-Hard:

  • DeepSeek-V4-Pro-0813:67.2

  • DeepSeek-V4-Flash-0731:59.6

  • V4-Pro-Preview:31.1

  • V4-Flash-Preview:25.8

  • GLM-5.2:54.5

  • Kimi-K3:63.0

  • Opus-4.8:71.7

  • Fable 5:68.3

这一项 V4 Pro 0813 超过 Kimi-K3 和 GLM-5.2,也接近 Fable 5,但 Opus-4.8 依然保持明显优势。

这也是为什么不能简单把这组数据解读成“DeepSeek 已经全面超过所有模型”。


十一、为什么说 V4 Pro 0813 已经全面超过 GLM-5.2?

把双方已公布的同项目成绩直接放在一起看:

BenchmarkV4 Pro 0813GLM-5.2
HLE 无工具42.740.5
HLE 有工具60.054.7
Terminal Bench 2.187.981.0
NL2Repo61.548.9
DeepSWE62.746.2
Toolathlon-Verified74.159.9
Agents' Last Exam25.723.8
AutomationBench31.812.9
DSBench-FullStack71.161.8
DSBench-Hard67.254.5

Cybergym 中 GLM-5.2 没有给出成绩,因此不参与比较。

从已有数据看,V4 Pro 0813 在双方都公布成绩的项目中全部领先。

所以“全面超过 GLM-5.2”在这张表的范围内,是有数据依据的。


十二、那“全球第三”这个说法成立吗?

这里要区分两个概念。

第一,单项 Benchmark 排名。

V4 Pro 0813 并不是所有项目都能排第三,有些项目甚至拿到第一,有些项目则会落后于 Kimi-K3、Opus-4.8 或 Fable 5。

第二,整体竞争力。

如果综合看这 11 项 Agent 相关任务,V4 Pro 0813 已经非常稳定地出现在头部区间。

它的特点不是“所有项目第一”,而是:

  • 很少出现明显短板;

  • 相比 Preview 版本大幅提升;

  • 全面超过 GLM-5.2;

  • 多项成绩超过 Opus-4.8;

  • 部分项目超过 Kimi-K3;

  • 个别项目甚至超过 Fable 5。

因此,“全球第三?”更适合作为一个讨论性的标题,而不是绝对排名结论。

如果一定要给它一个定位,我更愿意说:

DeepSeek-V4-Pro-0813 已经进入全球第一梯队,并且具备冲击前三的综合实力。


十三、这次升级真正值得关注的是什么?

真正重要的其实不是某一个分数。

而是 DeepSeek V4 从 Preview 到正式版之后,在多种 Agent 类任务中同时完成了一次明显跃升。

尤其是:

DeepSWE:12.8 → 62.7

DSBench-FullStack:41.8 → 71.1

DSBench-Hard:31.1 → 67.2

Cybergym:52.7 → 83.3

这些变化意味着 V4 Pro 0813 在代码工程、终端执行、Agent 工具调用、自动化任务等场景中的能力已经明显成熟。

对于真正把大模型用于开发工作的用户来说,这类提升往往比单纯的知识问答分数更重要。

因为实际开发中最需要的不是模型“知道多少”,而是它能不能:

  • 理解复杂工程;

  • 连续完成多步任务;

  • 正确调用工具;

  • 在终端环境执行操作;

  • 修改代码后继续验证;

  • 在长链路任务中保持稳定。

从这张表来看,V4 Pro 0813 在这些能力上的提升已经非常明显。


总结

如果只看本次公开的 Agent Benchmark 数据,可以得到几个比较明确的结论。

第一,DeepSeek-V4-Pro-0813 已经全面超过 GLM-5.2。

双方共同公布成绩的项目中,V4 Pro 0813 全部领先。

第二,V4 Pro 0813 已经进入全球第一梯队。

它在 Cybergym、AutomationBench、Terminal Bench 等项目中的成绩已经可以与 Kimi-K3、Opus-4.8、Fable 5 正面对比。

第三,它还没有做到全面第一。

Opus-4.8、Kimi-K3、Fable 5 在不同项目中依然各有优势。

第四,这次最重要的变化是整体能力提升,而不是单项刷榜。

从 Preview 到 0813 正式版,DeepSWE、Cybergym、DSBench 等多项任务同时大幅上涨,这说明 DeepSeek 在 Agent 和 Coding 能力上的进步已经开始从“单点提升”变成“整体提升”。

所以回到标题:

全面超过 GLM-5.2,DeepSeek-V4-Pro-0813 全球第三?

“全面超过 GLM-5.2”,从这张表来看基本可以确认。

至于“全球第三”,目前更适合作为一种综合实力判断,而不是严格榜单名次。

但有一点已经很明确:

DeepSeek-V4-Pro-0813 已经不是在追赶第一梯队,而是正式进入第一梯队参与竞争了。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/14 4:47:40

AI辅助编程时代的过程控制:从代码生成到质量守护

1. 当AI成为你的“初级程序员” 最近和几个技术团队的朋友聊天,发现一个挺有意思的现象:大家或多或少都在用AI写业务代码了。无论是用GitHub Copilot在IDE里自动补全,还是让ChatGPT、通义灵码这类工具生成一个完整的函数,甚至是一…

作者头像 李华
网站建设 2026/8/14 4:46:52

Grok调试工具全解析:从原理到实战,告别日志解析“黑盒”

1. 从“黑盒”到“白盒”:为什么我们需要Grok调试工具在数据处理和日志分析的日常工作中,我们常常会面对海量的、非结构化的文本数据。这些数据可能来自服务器日志、应用程序输出、传感器报文,或者任何需要被解析成结构化信息的文本流。对于开…

作者头像 李华
网站建设 2026/8/14 4:46:16

从阿里开源2.4万亿参数旗舰看开源AI的尽头:免费开放,钱从哪赚

从阿里开源2.4万亿参数旗舰看开源AI的尽头:免费开放,钱从哪赚 2.4万亿参数的旗舰大模型,权重免费开放给全球开发者下载。放在三年前,这等于一家车企把自己最新的旗舰车型图纸免费公开;放在今天,这是阿里千问…

作者头像 李华
网站建设 2026/8/14 4:44:50

元器件行业心得:用大盛供应链仓储,是供应链最稳的底气

深耕电子元器件供应链多年,越来越觉得:香港仓储不是简单的囤货落脚,而是我们做货最稳的缓冲和底气。 做元器件的同行都清楚,行业货源杂、渠道散、行情波动快,海外采购很难做到一次性整柜到货。很多时候都是多家供应商分…

作者头像 李华
网站建设 2026/8/14 4:44:35

数学建模竞赛全流程实战指南:从团队构建到论文写作

1. 从“Coming...”到“复盘”:一次竞赛的完整生命周期解析 看到“2020年第十届APMCM亚太地区大学生数学建模竞赛Coming...”这个标题,很多参加过数模竞赛的同学可能会心一笑。这短短几个字,背后浓缩了从赛前筹备、赛中鏖战到赛后复盘的一整个…

作者头像 李华
网站建设 2026/8/14 4:42:04

从 Prompt 工程到 Loop 工程的演进之路

2024 年以来,AI Agent 成为人工智能领域最炙手可热的方向。如果说传统的大语言模型(LLM)是一颗聪明的大脑,那么 AI Agent 就是给它装上了眼睛、手和腿——它能自主感知环境、制定计划、调用工具,并在执行过程中不断自省…

作者头像 李华