摘要
2026年7月31日,DeepSeek悄然上线V4-Flash正式版API公测。这次更新没有改动模型架构(2840亿总参数/130亿激活参数的MoE),仅通过后训练将Agent能力提升了6倍——DeepSWE从7.3跃升至54.4,TerminalBench达82.7逼近Opus 4.8的85.0。更关键的是,V4-Flash价格仅为Claude的1/90(每百万Token输入$0.14/输出$0.28),原生支持Responses API并适配Codex生态。这次发布并非孤立事件——同一日OpenAI宣布GPT-5.6 Luna降价80%,两件事指向同一个战场:Agent时代的模型供给之争,已经从"堆参数"转向"精调优与生态兼容"。
核心结论:DeepSeek V4-Flash正式版证明,对于Agent任务而言,高质量后训练数据的权重正在超过模型参数规模。一个仅130亿激活参数的轻量模型,通过精心的后训练优化,可以在关键Agent基准上逼近百倍规模的旗舰模型。与此同时,原生Responses API支持和Codex生态适配,正在将竞争从"模型能力"推向"开箱即用的Agent工作流兼容性"。
一、一条悄无声息却意味深长的更新日志
7月31日午后,没有发布会、没有预热推文,DeepSeek官网更新日志中多了一行:
“DeepSeek-V4-Flash-0731的模型结构、尺寸和DeepSeek-V4-Flash-preview保持一致,仅重新进行了后训练。”
“仅重新进行了后训练”——这十个字的分量,需要放到基准评测表中才能感受。
| 评测基准 | V4-Flash Preview | V4-Flash 正式版 | V4-Pro Preview | GLM-5.2 | Opus 4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | - | 82.7 | 72.1 (v2.0) | 81.0 | 85.0 |
| NL2Repo | - | 54.2 | - | - | - |
| Cybergym | - | 76.7 | - | - | - |
| DeepSWE | 7.3 | 54.4 | - | - | - |
| Toolathlon verified | - | 70.3 | - | - | - |
| Agent Last Exam | - | 25.2 | - | - | - |
| Automation Bench (Public) | - | 25.1 | - | - | - |
| DSBench-FullStack | - | 68.7 | - | - | - |
| DSBench-Hard | - | 59.6 | - | - | - |
(数据来源:DeepSeek API Docs Changelog, 2026-07-31;注意Terminal Bench 2.0与2.1非同一版本测试集,跨版本直接对比仅供参考)
最令人震撼的数字是DeepSWE:从Preview版的7.3跃升至正式版的54.4,Agent编程能力提升超过6倍。我们需要理解这意味着什么:
什么是DeepSWE?
DeepSWE是DeepSeek内部的软件工程Agent评测基准,模拟真实开发场景中模型从理解需求、编写代码、调试错误到提交PR的完整流程。7.3分意味着Preview版几乎"不能用"——在大多数任务中会陷入死循环或产生不可用的代码。54.4分则意味着它已经是一个"可用的初级工程师"——能够独立完成中等复杂度的编码任务,且稳定性和一致性达到了生产级别。
这一跨度,仅靠后训练实现。
二、后训练的"魔法":为什么架构不变能带来6倍提升?
DeepSeek V4-Flash正式版的发布,释放了一个清晰的信号:对于Agent能力而言,后训练阶段的优化空间远大于预训练阶段的参数堆叠。
2.1 模型规格对比
| 维度 | V4-Flash | V4-Pro |
|---|---|---|
| 总参数 | 2,840亿 | 1.6万亿 |
| 激活参数 | 130亿 | 490亿 |
| 架构 | MoE | MoE |
| 训练方式 | Preview→正式版仅后训练 | Preview→正式版待发布 |
Flash的总参数仅为Pro的17.8%,激活参数仅为26.5%,但在多项Agent基准上已经追平甚至超越了三个月前的Pro Preview。这揭示了一个正在形成的行业共识:
“Agent能力不是’训练进去’的,而是’调教出来’的。”
2.2 后训练优化的四个维度
根据官方技术报告和社区实测,V4-Flash正式版的后训练优化集中在四个维度:
(1)工具调用稳定性:Preview版常见的"工具调用死循环"(模型反复调用同一工具但无法提取有用信息)和"参数解析错误"(JSON格式错误、必填字段遗漏)被基本消除。在需要35次工具调用的复杂任务中,正式版可以一次跑通。
(2)长程任务规划:模型的"全局意识"显著增强。在Web自动化任务中,正式版能够在执行第20步操作时仍然记住第3步获取的信息,而非"做完就忘"。这种连贯性对于Agent任务至关重要。
(3)错误恢复能力:当工具返回错误时,Preview版倾向于"放弃"或"换一个方向硬试",正式版表现出更智能的重试策略——分析错误原因、调整参数、在必要时切换工具。
(4)Codex生态适配:正式版原生支持OpenAI的Responses API格式,并针对Codex CLI、VSCode Codex插件和ChatGPT桌面端进行了专项适配。这不是简单的API兼容层,而是在后训练中注入了Codex工作流的交互模式——如何理解Codex的上下文结构、如何响应代码变更请求、如何在多轮对话中保持一致。
2.3 为什么后训练对Agent如此有效?
传统大模型训练遵循"预训练→监督微调→RLHF"的范式。但在Agent场景中,这个范式有一个根本缺陷:预训练语料中几乎没有Agent行为的"正确答案"。
互联网文本告诉模型"什么是好代码",但不会告诉它"当你调用一个API返回403错误时,应该先检查认证头还是先检查请求格式"。这些"操作直觉"只能通过Agent-specific的后训练数据来注入——让模型在模拟环境中反复执行任务,从成功和失败中学习。
DeepSeek的做法类似于"强化学习的课程学习":先让模型在简单Agent任务中摸索,掌握基本工具调用模式;再逐步增加任务复杂度和工具数量;最后引入真实世界的边界条件(网络延迟、API限流、部分失败)。每一轮后训练都在前一轮的基础上微调,而非从头开始。
三、Harness框架:DeepSeek的Agent"秘密武器"首次公开
V4-Flash正式版发布中,一个此前仅见于招聘页面的名字首次出现在官方技术公告中:DeepSeek Harness。
“本次公开基准测试中的Code Agent任务,使用了DeepSeek Harness极简模式作为框架进行测试,max档位,topp=0.95,temperature=1.0。”
3.1 Harness是什么?
Harness是DeepSeek内部开发的Agent执行框架,类似于Anthropic的Computer Use或OpenAI的Codex CLI,但设计哲学截然不同:
- 极简模式(Minimal Mode):去除所有不必要的抽象层,让模型直接与工具交互。这减少了一层"翻译损耗"——传统Agent框架需要将模型输出转化为框架指令再转化为工具调用,极简模式下模型输出直接映射为工具API调用。
- max档位:将推理时的计算预算推到上限,允许模型在关键决策点进行更深度的思考。这与OpenAI的"extended thinking"异曲同工,但DeepSeek将其作为可配置档位而非二进制开关。
3.2 团队背景
Harness团队负责人崔添翼,90后,浙大计算机系出身,6枚ACM亚洲区域赛金牌,在顶级量化机构Jane Street任职九年后于2026年3月加入DeepSeek。这个背景透露了Harness的设计基因:追求极致的执行效率与可靠性——量化交易中对延迟和正确性的要求远高于普通软件开发。
5月起,DeepSeek大量招聘Agent方向工程师,覆盖工具调用、任务规划、浏览器自动化、代码执行安全等多个子方向。Harness的首次公开亮相,意味着这个内部框架已经达到可以对外展示的成熟度——未来是否会开源,值得密切关注。
四、价格战中的"锚定效应":1/90的极致性价比
就在V4-Flash正式版上线的同一天,OpenAI宣布GPT-5.6 Luna降价80%(从$1/$6降至$0.20/$1.20每百万Token)。两件事同日发生,并非巧合。
4.1 当前主流Agent模型API价格对比
| 模型 | 输入/百万Token | 输出/百万Token | 相对GPT-5.6 Sol成本 |
|---|---|---|---|
| DeepSeek V4 Flash | $0.14 | $0.28 | 1.7% |
| 小米 MiMo-V2.5 | $0.14 | $0.28 | 1.7% |
| GPT-5.6 Luna(降价后) | $0.20 | $1.20 | 4.0% |
| GPT-5.6 Terra(降价后) | $2.00 | $12.00 | 40% |
| Claude Sonnet 5(推广价) | $2.00 | $10.00 | 36% |
| GPT-5.6 Sol | $5.00 | $30.00 | 100% |
(数据来源:DevTk.AI, 2026-08-01;以2M输入+500K输出标准化计算)
4.2 但价格不是全部——峰谷定价的隐忧
DeepSeek此前宣布将在北京时间的9:00-12:00和14:00-18:00执行2倍峰谷定价,虽然具体生效日期尚未确定,但开发者在做容量规划时必须将其纳入考量。峰谷定价后,V4 Flash在高峰期的实际价格为$0.28/$0.56,仍低于Luna的$0.20/$1.20(因为输出价格优势更大),但与其他廉价模型的差距会缩小。
更重要的是,便宜不等于划算。一个需要反复重试的低价模型,可能比一次成功的旗舰模型更贵。开发者的选型决策正在从"单价比较"转向"任务完成成本"——完成同一个编码任务的端到端Token消耗和重试次数才是真的成本。
4.3 OpenRouter的"锚定效应"与生态锁定
DeepSeek的策略不只是低价。V4-Flash原生支持Responses API并适配Codex,意味着开发者可以将原本为OpenAI生态构建的Agent工作流零成本迁移——不需要修改任何代码,只需要换一个API endpoint。
这种"无缝兼容"策略在平台竞争中极为有效。它对开发者说:你不需要选边站,可以先用DeepSeek的低价跑通业务,等真的需要Sol级别的推理能力时再切换。但实际情况往往是:一旦工作流在某个模型上稳定运行,迁移的惯性成本会远大于Token差价。
五、开发者实战指南:如何从V3/V4-Preview迁移到V4-Flash正式版
5.1 API调用(Python示例)
# V4-Flash正式版调用方式(OpenAI兼容接口)importopenai client=openai.OpenAI(api_key="your-deepseek-api-key",base_url="https://api.deepseek.com")# 标准Chat Completions调用response=client.chat.completions.create(model="deepseek-v4-flash",# 直接使用新模型名messages=[{"role":"system","content":"你是一个专业的Python开发助手。"},{"role":"user","content":"帮我写一个异步Web爬虫,支持并发控制和自动重试。"}],temperature=1.0,top_p=0.95,max_tokens=4096)print(response.choices[0].message.content)5.2 Responses API格式(推荐用于Agent任务)
# 使用Responses API格式(原生支持,无需额外适配层)response=client.responses.create(model="deepseek-v4-flash",input="分析这个GitHub仓库的代码结构,找出所有SQL注入风险点",tools=[{"type":"code_interpreter",},{"type":"web_search",}],tool_choice="auto")5.3 Codex CLI配置
# 在Codex CLI中配置DeepSeek V4-Flashcodex configsetprovider deepseek codex configsetmodel deepseek-v4-flash codex configsetapi_key$DEEPSEEK_API_KEY# 验证配置codex doctor5.4 迁移注意事项
- deepseek-chat/deepseek-reasoner已停用:这两个旧模型名已于7月24日下线,所有调用必须迁移到
deepseek-v4-flash或deepseek-v4-pro。 - V4-Pro正式版尚未发布:当前V4-Pro API仍为Preview版本,正式版发布日期待定。对于需要最强推理能力的场景,建议暂时保留GPT-5.6 Sol或Claude Opus 5作为后备。
- 峰谷定价占位:建议在代码中加入时间段检测逻辑,将非紧急大批量任务调度到低谷期执行。
- Codex适配的底层差异:虽然API兼容,但V4-Flash的Codex适配在后训练中完成,某些边界行为(如代码补全的保守性/激进性偏好)可能与Codex原生模型不同,建议做A/B测试。
六、FAQ
Q1:V4-Flash正式版和V4-Pro怎么选?
A:如果你的场景是Agent自动化(编程、网页操作、工具调用),V4-Flash正式版的性价比极高——Agent能力已经接近Pro Preview水平,价格仅为Pro的零头。如果需要最强推理能力或超长上下文的深度理解,建议等V4-Pro正式版发布或继续使用旗舰模型。
Q2:从OpenAI迁移到DeepSeek V4-Flash,工作流需要改多少代码?
A:如果你已经在使用OpenAI的Chat Completions API或Responses API,理论上只需要换base_url和model名称。但需要注意:V4-Flash的system prompt处理方式、tool calling的JSON格式细节可能与GPT-5.6有微妙差异,建议在staging环境充分测试后再上线。
Q3:DeepSwE 54.4分在实际开发中意味着什么?
A:54.4分意味着模型可以作为"初级到中级编程助手"使用——能独立完成函数级代码编写、bug修复和简单功能开发。但对于架构设计、跨文件重构、复杂业务逻辑等高级任务,成功率仍然有限。建议用作Copilot而非Autopilot。
Q4:Harness框架会开源吗?
A:目前官方没有明确表态。但从DeepSeek一贯的开源策略(如V3/R1全量开源)和Harness团队公开招聘的行为来看,未来开源的可能性不低。如果开源,将对当前的Agent框架格局(LangChain、CrewAI、AutoGen等)产生重大冲击。
Q5:V4-Flash和Kimi K3在同一任务上怎么选?
A:V4-Flash在价格上碾压K3(每百万Token成本约为K3的1/32),但在某些需要超强推理的任务上,K3的2.8T参数可能提供更高的成功率。一个实用策略是:将V4-Flash作为默认Agent(处理80%的常规任务),将K3或Sol作为fallback(处理V4-Flash失败的20%高难度任务)。
Q6:后训练优化的"天花板"在哪里?
A:这是当前AI研究的热点问题。V4-Flash的案例表明,130亿激活参数的模型通过后训练可以达到接近旗舰模型的Agent能力。但后训练的边际收益可能会递减——从7.3到54.4是6倍提升,但下一个6倍可能需要指数级增长的后训练数据或全新的训练范式。
参考资料
- DeepSeek API Docs Changelog, “DeepSeek-V4-Flash Update”, 2026-07-31. https://api-docs.deepseek.com/updates
- 澎湃新闻, “DeepSeek V4正式版来了!Agent能力大幅升级,Harness能力首次亮相”, 2026-07-31.
- 凤凰网科技, “DeepSeek V4正式版来了,新能力浮出水面,性价比之王开战”, 2026-07-31.
- 网易智能, “DeepSeek-V4-Flash正式版API上线公测,Agent能力大幅提升”, 2026-07-31.
- DevTk.AI, “The August 2026 AI API Price War: OpenAI Cuts, DeepSeek V4-0731, and the New Cost Floor”, 2026-08-01.
- 东方证券, “计算机行业周报:模型上新叠加API降价,把握AI INFRA与AI应用行情”, 2026-08-01.
- 新浪微博 @AI评测先锋, “DeepSeekV4-Flash正式版发布:Agent能力逼近GPT-5.6 Luna”, 2026-08-01.