news 2026/8/2 11:06:06

DeepSeek V4-Flash正式版深度解析:Agent能力暴涨6倍,仅后训练优化逼近Opus 4.8

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
DeepSeek V4-Flash正式版深度解析:Agent能力暴涨6倍,仅后训练优化逼近Opus 4.8

摘要

2026年7月31日,DeepSeek悄然上线V4-Flash正式版API公测。这次更新没有改动模型架构(2840亿总参数/130亿激活参数的MoE),仅通过后训练将Agent能力提升了6倍——DeepSWE从7.3跃升至54.4,TerminalBench达82.7逼近Opus 4.8的85.0。更关键的是,V4-Flash价格仅为Claude的1/90(每百万Token输入$0.14/输出$0.28),原生支持Responses API并适配Codex生态。这次发布并非孤立事件——同一日OpenAI宣布GPT-5.6 Luna降价80%,两件事指向同一个战场:Agent时代的模型供给之争,已经从"堆参数"转向"精调优与生态兼容"

核心结论:DeepSeek V4-Flash正式版证明,对于Agent任务而言,高质量后训练数据的权重正在超过模型参数规模。一个仅130亿激活参数的轻量模型,通过精心的后训练优化,可以在关键Agent基准上逼近百倍规模的旗舰模型。与此同时,原生Responses API支持和Codex生态适配,正在将竞争从"模型能力"推向"开箱即用的Agent工作流兼容性"。


一、一条悄无声息却意味深长的更新日志

7月31日午后,没有发布会、没有预热推文,DeepSeek官网更新日志中多了一行:

“DeepSeek-V4-Flash-0731的模型结构、尺寸和DeepSeek-V4-Flash-preview保持一致,仅重新进行了后训练。”

“仅重新进行了后训练”——这十个字的分量,需要放到基准评测表中才能感受。

评测基准V4-Flash PreviewV4-Flash 正式版V4-Pro PreviewGLM-5.2Opus 4.8
Terminal Bench 2.1-82.772.1 (v2.0)81.085.0
NL2Repo-54.2---
Cybergym-76.7---
DeepSWE7.354.4---
Toolathlon verified-70.3---
Agent Last Exam-25.2---
Automation Bench (Public)-25.1---
DSBench-FullStack-68.7---
DSBench-Hard-59.6---

(数据来源:DeepSeek API Docs Changelog, 2026-07-31;注意Terminal Bench 2.0与2.1非同一版本测试集,跨版本直接对比仅供参考)

最令人震撼的数字是DeepSWE:从Preview版的7.3跃升至正式版的54.4,Agent编程能力提升超过6倍。我们需要理解这意味着什么:

什么是DeepSWE?

DeepSWE是DeepSeek内部的软件工程Agent评测基准,模拟真实开发场景中模型从理解需求、编写代码、调试错误到提交PR的完整流程。7.3分意味着Preview版几乎"不能用"——在大多数任务中会陷入死循环或产生不可用的代码。54.4分则意味着它已经是一个"可用的初级工程师"——能够独立完成中等复杂度的编码任务,且稳定性和一致性达到了生产级别。

这一跨度,仅靠后训练实现。


二、后训练的"魔法":为什么架构不变能带来6倍提升?

DeepSeek V4-Flash正式版的发布,释放了一个清晰的信号:对于Agent能力而言,后训练阶段的优化空间远大于预训练阶段的参数堆叠

2.1 模型规格对比

维度V4-FlashV4-Pro
总参数2,840亿1.6万亿
激活参数130亿490亿
架构MoEMoE
训练方式Preview→正式版仅后训练Preview→正式版待发布

Flash的总参数仅为Pro的17.8%,激活参数仅为26.5%,但在多项Agent基准上已经追平甚至超越了三个月前的Pro Preview。这揭示了一个正在形成的行业共识:

“Agent能力不是’训练进去’的,而是’调教出来’的。”

2.2 后训练优化的四个维度

根据官方技术报告和社区实测,V4-Flash正式版的后训练优化集中在四个维度:

(1)工具调用稳定性:Preview版常见的"工具调用死循环"(模型反复调用同一工具但无法提取有用信息)和"参数解析错误"(JSON格式错误、必填字段遗漏)被基本消除。在需要35次工具调用的复杂任务中,正式版可以一次跑通。

(2)长程任务规划:模型的"全局意识"显著增强。在Web自动化任务中,正式版能够在执行第20步操作时仍然记住第3步获取的信息,而非"做完就忘"。这种连贯性对于Agent任务至关重要。

(3)错误恢复能力:当工具返回错误时,Preview版倾向于"放弃"或"换一个方向硬试",正式版表现出更智能的重试策略——分析错误原因、调整参数、在必要时切换工具。

(4)Codex生态适配:正式版原生支持OpenAI的Responses API格式,并针对Codex CLI、VSCode Codex插件和ChatGPT桌面端进行了专项适配。这不是简单的API兼容层,而是在后训练中注入了Codex工作流的交互模式——如何理解Codex的上下文结构、如何响应代码变更请求、如何在多轮对话中保持一致。

2.3 为什么后训练对Agent如此有效?

传统大模型训练遵循"预训练→监督微调→RLHF"的范式。但在Agent场景中,这个范式有一个根本缺陷:预训练语料中几乎没有Agent行为的"正确答案"

互联网文本告诉模型"什么是好代码",但不会告诉它"当你调用一个API返回403错误时,应该先检查认证头还是先检查请求格式"。这些"操作直觉"只能通过Agent-specific的后训练数据来注入——让模型在模拟环境中反复执行任务,从成功和失败中学习。

DeepSeek的做法类似于"强化学习的课程学习":先让模型在简单Agent任务中摸索,掌握基本工具调用模式;再逐步增加任务复杂度和工具数量;最后引入真实世界的边界条件(网络延迟、API限流、部分失败)。每一轮后训练都在前一轮的基础上微调,而非从头开始。


三、Harness框架:DeepSeek的Agent"秘密武器"首次公开

V4-Flash正式版发布中,一个此前仅见于招聘页面的名字首次出现在官方技术公告中:DeepSeek Harness

“本次公开基准测试中的Code Agent任务,使用了DeepSeek Harness极简模式作为框架进行测试,max档位,topp=0.95,temperature=1.0。”

3.1 Harness是什么?

Harness是DeepSeek内部开发的Agent执行框架,类似于Anthropic的Computer Use或OpenAI的Codex CLI,但设计哲学截然不同:

  • 极简模式(Minimal Mode):去除所有不必要的抽象层,让模型直接与工具交互。这减少了一层"翻译损耗"——传统Agent框架需要将模型输出转化为框架指令再转化为工具调用,极简模式下模型输出直接映射为工具API调用。
  • max档位:将推理时的计算预算推到上限,允许模型在关键决策点进行更深度的思考。这与OpenAI的"extended thinking"异曲同工,但DeepSeek将其作为可配置档位而非二进制开关。

3.2 团队背景

Harness团队负责人崔添翼,90后,浙大计算机系出身,6枚ACM亚洲区域赛金牌,在顶级量化机构Jane Street任职九年后于2026年3月加入DeepSeek。这个背景透露了Harness的设计基因:追求极致的执行效率与可靠性——量化交易中对延迟和正确性的要求远高于普通软件开发。

5月起,DeepSeek大量招聘Agent方向工程师,覆盖工具调用、任务规划、浏览器自动化、代码执行安全等多个子方向。Harness的首次公开亮相,意味着这个内部框架已经达到可以对外展示的成熟度——未来是否会开源,值得密切关注。


四、价格战中的"锚定效应":1/90的极致性价比

就在V4-Flash正式版上线的同一天,OpenAI宣布GPT-5.6 Luna降价80%(从$1/$6降至$0.20/$1.20每百万Token)。两件事同日发生,并非巧合。

4.1 当前主流Agent模型API价格对比

模型输入/百万Token输出/百万Token相对GPT-5.6 Sol成本
DeepSeek V4 Flash$0.14$0.281.7%
小米 MiMo-V2.5$0.14$0.281.7%
GPT-5.6 Luna(降价后)$0.20$1.204.0%
GPT-5.6 Terra(降价后)$2.00$12.0040%
Claude Sonnet 5(推广价)$2.00$10.0036%
GPT-5.6 Sol$5.00$30.00100%

(数据来源:DevTk.AI, 2026-08-01;以2M输入+500K输出标准化计算)

4.2 但价格不是全部——峰谷定价的隐忧

DeepSeek此前宣布将在北京时间的9:00-12:00和14:00-18:00执行2倍峰谷定价,虽然具体生效日期尚未确定,但开发者在做容量规划时必须将其纳入考量。峰谷定价后,V4 Flash在高峰期的实际价格为$0.28/$0.56,仍低于Luna的$0.20/$1.20(因为输出价格优势更大),但与其他廉价模型的差距会缩小。

更重要的是,便宜不等于划算。一个需要反复重试的低价模型,可能比一次成功的旗舰模型更贵。开发者的选型决策正在从"单价比较"转向"任务完成成本"——完成同一个编码任务的端到端Token消耗和重试次数才是真的成本。

4.3 OpenRouter的"锚定效应"与生态锁定

DeepSeek的策略不只是低价。V4-Flash原生支持Responses API并适配Codex,意味着开发者可以将原本为OpenAI生态构建的Agent工作流零成本迁移——不需要修改任何代码,只需要换一个API endpoint。

这种"无缝兼容"策略在平台竞争中极为有效。它对开发者说:你不需要选边站,可以先用DeepSeek的低价跑通业务,等真的需要Sol级别的推理能力时再切换。但实际情况往往是:一旦工作流在某个模型上稳定运行,迁移的惯性成本会远大于Token差价


五、开发者实战指南:如何从V3/V4-Preview迁移到V4-Flash正式版

5.1 API调用(Python示例)

# V4-Flash正式版调用方式(OpenAI兼容接口)importopenai client=openai.OpenAI(api_key="your-deepseek-api-key",base_url="https://api.deepseek.com")# 标准Chat Completions调用response=client.chat.completions.create(model="deepseek-v4-flash",# 直接使用新模型名messages=[{"role":"system","content":"你是一个专业的Python开发助手。"},{"role":"user","content":"帮我写一个异步Web爬虫,支持并发控制和自动重试。"}],temperature=1.0,top_p=0.95,max_tokens=4096)print(response.choices[0].message.content)

5.2 Responses API格式(推荐用于Agent任务)

# 使用Responses API格式(原生支持,无需额外适配层)response=client.responses.create(model="deepseek-v4-flash",input="分析这个GitHub仓库的代码结构,找出所有SQL注入风险点",tools=[{"type":"code_interpreter",},{"type":"web_search",}],tool_choice="auto")

5.3 Codex CLI配置

# 在Codex CLI中配置DeepSeek V4-Flashcodex configsetprovider deepseek codex configsetmodel deepseek-v4-flash codex configsetapi_key$DEEPSEEK_API_KEY# 验证配置codex doctor

5.4 迁移注意事项

  1. deepseek-chat/deepseek-reasoner已停用:这两个旧模型名已于7月24日下线,所有调用必须迁移到deepseek-v4-flashdeepseek-v4-pro
  2. V4-Pro正式版尚未发布:当前V4-Pro API仍为Preview版本,正式版发布日期待定。对于需要最强推理能力的场景,建议暂时保留GPT-5.6 Sol或Claude Opus 5作为后备。
  3. 峰谷定价占位:建议在代码中加入时间段检测逻辑,将非紧急大批量任务调度到低谷期执行。
  4. Codex适配的底层差异:虽然API兼容,但V4-Flash的Codex适配在后训练中完成,某些边界行为(如代码补全的保守性/激进性偏好)可能与Codex原生模型不同,建议做A/B测试。

六、FAQ

Q1:V4-Flash正式版和V4-Pro怎么选?

A:如果你的场景是Agent自动化(编程、网页操作、工具调用),V4-Flash正式版的性价比极高——Agent能力已经接近Pro Preview水平,价格仅为Pro的零头。如果需要最强推理能力或超长上下文的深度理解,建议等V4-Pro正式版发布或继续使用旗舰模型。

Q2:从OpenAI迁移到DeepSeek V4-Flash,工作流需要改多少代码?

A:如果你已经在使用OpenAI的Chat Completions API或Responses API,理论上只需要换base_url和model名称。但需要注意:V4-Flash的system prompt处理方式、tool calling的JSON格式细节可能与GPT-5.6有微妙差异,建议在staging环境充分测试后再上线。

Q3:DeepSwE 54.4分在实际开发中意味着什么?

A:54.4分意味着模型可以作为"初级到中级编程助手"使用——能独立完成函数级代码编写、bug修复和简单功能开发。但对于架构设计、跨文件重构、复杂业务逻辑等高级任务,成功率仍然有限。建议用作Copilot而非Autopilot。

Q4:Harness框架会开源吗?

A:目前官方没有明确表态。但从DeepSeek一贯的开源策略(如V3/R1全量开源)和Harness团队公开招聘的行为来看,未来开源的可能性不低。如果开源,将对当前的Agent框架格局(LangChain、CrewAI、AutoGen等)产生重大冲击。

Q5:V4-Flash和Kimi K3在同一任务上怎么选?

A:V4-Flash在价格上碾压K3(每百万Token成本约为K3的1/32),但在某些需要超强推理的任务上,K3的2.8T参数可能提供更高的成功率。一个实用策略是:将V4-Flash作为默认Agent(处理80%的常规任务),将K3或Sol作为fallback(处理V4-Flash失败的20%高难度任务)。

Q6:后训练优化的"天花板"在哪里?

A:这是当前AI研究的热点问题。V4-Flash的案例表明,130亿激活参数的模型通过后训练可以达到接近旗舰模型的Agent能力。但后训练的边际收益可能会递减——从7.3到54.4是6倍提升,但下一个6倍可能需要指数级增长的后训练数据或全新的训练范式。


参考资料

  1. DeepSeek API Docs Changelog, “DeepSeek-V4-Flash Update”, 2026-07-31. https://api-docs.deepseek.com/updates
  2. 澎湃新闻, “DeepSeek V4正式版来了!Agent能力大幅升级,Harness能力首次亮相”, 2026-07-31.
  3. 凤凰网科技, “DeepSeek V4正式版来了,新能力浮出水面,性价比之王开战”, 2026-07-31.
  4. 网易智能, “DeepSeek-V4-Flash正式版API上线公测,Agent能力大幅提升”, 2026-07-31.
  5. DevTk.AI, “The August 2026 AI API Price War: OpenAI Cuts, DeepSeek V4-0731, and the New Cost Floor”, 2026-08-01.
  6. 东方证券, “计算机行业周报:模型上新叠加API降价,把握AI INFRA与AI应用行情”, 2026-08-01.
  7. 新浪微博 @AI评测先锋, “DeepSeekV4-Flash正式版发布:Agent能力逼近GPT-5.6 Luna”, 2026-08-01.
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/2 11:03:59

云台PID控制算法详解:从原理到实战调参指南

1. 项目概述:从“能动”到“稳如磐石”的跨越 玩过云台的朋友都知道,让它动起来不难,但让它“听话”地动,精准地停在你想让它停的位置,并且面对风吹、电机惯性等干扰时还能纹丝不动,那才是真功夫。 reCame…

作者头像 李华
网站建设 2026/8/2 11:03:35

终极指南:用Godot卡牌游戏框架快速构建专业级卡牌游戏

终极指南:用Godot卡牌游戏框架快速构建专业级卡牌游戏 【免费下载链接】godot-card-game-framework A framework which comes with prepared scenes and classes to kickstart your card game, as well as a powerful scripting engine to use to provide full rule…

作者头像 李华
网站建设 2026/8/2 10:56:26

基于YOLOv8的智能PCB缺陷检测系统:从数据到部署全流程实践

1. 项目概述:为什么PCB缺陷检测需要“智能”化?在电子制造业干了十几年,我经手过的PCB板少说也有几十万片。早期我们怎么检?靠人眼,在强光下拿着放大镜一片片看,效率低不说,人眼疲劳后漏检、误检…

作者头像 李华
网站建设 2026/8/2 10:51:08

终极指南:三步搞定网盘直链下载助手,告别限速烦恼

终极指南:三步搞定网盘直链下载助手,告别限速烦恼 【免费下载链接】Online-disk-direct-link-download-assistant 一个基于 JavaScript 的网盘文件下载地址获取工具。基于【网盘直链下载助手】修改 ,支持 百度网盘 / 阿里云盘 / 中国移动云盘…

作者头像 李华
网站建设 2026/8/2 10:50:54

NodeMCU-32S开发板从入门到精通:ESP32核心功能与物联网项目实战

1. 项目概述:为什么是NodeMCU-32S?如果你玩过Arduino,觉得它简单但性能有限;如果你听说过树莓派Pico,又觉得它生态还不够成熟;那么,NodeMCU-32S这块开发板,大概率会成为你下一个“真…

作者头像 李华