三款热门「Flash」模型对比分析:DeepSeek-V4-Flash vs GLM-5.3-Flash vs Qwen3.8-Flash
2026 年 8 月下旬,三家国产大模型厂商几乎在同一时间窗口放出了各自的「Flash」档位模型。它们都把总参数做大、激活参数做小,用稀疏/状态空间注意力把长上下文成本压到接近极限。本文基于官方文档、技术报告与开源权重/推理框架的实测配置,对三款模型在参数量、激活量、专业能力、成本、部署要求与实际体验上做一次系统性对比。
一 一句话结论
| 模型 | 总参数 | 激活参数 | 定位 |
|---|---|---|---|
| DeepSeek-V4-Flash | 284B | 13B | 极致性价比的文本/Agent 主力,1M 上下文标配 |
| GLM-5.3-Flash | 320B | 18B | 首个「稀疏+线性」混合注意力的开源多模态模型 |
| Qwen3.8-Flash | 125B | 6B | 超稀疏 MoE + N-gram Embedding,Qwen4 架构预览 |
三款都不是单纯「小模型」,而是大 MoE 的稀疏激活版。激活参数从 6B 到 18B,意味着单 token 推理成本都远低于同档稠密模型。
二、架构与参数:谁把「算力杠杆」用到了极致
2.1 总参数与激活参数
| 指标 | DeepSeek-V4-Flash | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|---|
| 总参数 | 284B | 320B | 125B(+51B n-gram +4B MTP) |
| 激活参数 | 13B | 18B | 6B |
| MoE 专家 | 256 routed + 1 shared | 288 routed + 1 shared | 512 experts, 10 routed + 1 shared |
| 层数 | — | 45 | 48 |
| 上下文(原生) | 1M | 1M | 262K(可 YaRN 扩到 1M) |
| 最大输出 | 384K | 128K | 131K |
| 推理框架 | vLLM / SGLang | vLLM / SGLang / TokenSpeed | vLLM / SGLang / TokenSpeed |
关键差异在「效率杠杆」:
Qwen3.8-Flash的 6B 激活参数是三者最低,且引入了51B 的 N-gram Embedding(用双/三元组索引直接在 embedding 层扩参,几乎不增加计算、可 CPU offload)。它继承了 Qwen3-Next 的Gated DeltaNet + Gated Attention,但把 Gated Attention 换成了Qwen Sparse Attention (QSA)——在 micro-block 级别做稀疏选择,而不是逐 token 选。此外还有Gated Residual和按权重类别混用 Muon/AdamW 的定制训练配方。
GLM-5.3-Flash是业内首个开源前沿模型采用稀疏注意力 + 线性注意力混合架构:线性注意力用状态建模捕获局部依赖,稀疏注意力用轻量索引器召回全局上下文。还引入IndexPool(把索引器 4 个 KV 向量加权池化成 1 个)和Manifold-Constrained Hyper-Connections (mHC)。相比兄弟模型 GLM-5.3,注意力计算量降 3.01×、KV 缓存降 4.44×。
- 稀疏注意力是指不再让每个 token 都和序列里所有其他 token 计算 attention,而是只保留一部分“重要”的连接。
- 线性注意力是另一类降低 attention 复杂度的方法。它把 softmax attention 改写成线性核函数形式,使得Q K T QK^TQKT可以先和 VV相乘,从而把复杂度从O ( n 2 ) O(n^2)O(n2)降到O ( n ) O(n)O(n),并能像 RNN / 状态空间模型(SSM)一样用递推或卷积处理超长序列。
DeepSeek-V4-Flash主打Token-wise 压缩 + DSA(DeepSeek Sparse Attention),官方宣称 1M 上下文为默认标准,且专注 Agent 场景的 Code/工具调用。
⚠️版本说明:DeepSeek 侧有两个的版本——
deepseek-v4-flash(模型版本DeepSeek-V4-Flash-0731,纯文本/Agent 主力)与deepseek-v4-flash-vision-exp(多模态实验版,2026-08-21 上线)。官方明确声明 Vision-Exp 在纯文本能力上与 0731 正式版持平,它是给"文本基础上加视觉理解"的多模态版本,而非"更强的 0731"。因此本横评主体的 DeepSeek 文本/Coding/Agent 数据采用0731 正式版口径;仅多模态基准列标注为Vision-Exp 口径。DeepSeek 官方不存在名为deepseek-v4-flash-exp的模型。
2.2 谁更「吃显存」?
三者的 FP8 权重体积直接影响自建部署门槛:
| 模型 | FP8 权重 | 官方推荐部署 |
|---|---|---|
| DeepSeek-V4-Flash | ~284GB | 4×H100(短上下文)/ 4×H200(1M) |
| GLM-5.3-Flash | ~306GB | vLLM TP4 (GB200) 或 TP8 (H100/H200/MI355X) |
| Qwen3.8-Flash | 172.78 GiB(BF16 为 335 GiB) | vLLM 4×GB300 / 8×H200(TEP8)/ 4×MI355X |
Qwen3.8-Flash 的 51B n-gram 表可 offload 到 CPU(
VLLM_PLE_CPU_OFFLOAD=1,需 ≥51GB 主机内存),这让它在显存受限场景(如 4 卡 MI355X、或 262K 上下文)比前两者更灵活。
三 专业能力:Agent / Coding / 多模态 都是抢分点
3.1 Coding 与 Agent 能力
官方公开的可比基准(分数越高越好,--表示未披露):
| 基准 | DeepSeek-V4-Flash(-0731) | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|---|
| DeepSWE v1.1 | 54.4 | 63.4 | 58.7 |
| Terminal Bench 2.1 | 82.7 | 84.3 | — |
| NL2Repo | 54.2 | 56.3 | 48.1 |
| SWE-bench Pro | 56.0 | — | 62.5 |
| SWE-bench Multilingual | — | — | 81.0 |
| Toolathlon Verified | 70.3 | 78.4 | 73.5 |
| Agents’ Last Exam (Pass@1) | 25.2 | 26.3 | 24.3 |
| AutomationBench | 25.1 | 48.8 | — |
| HLE | 33.8 | 55.3(带工具) | 35.9 |
解读:
- GLM-5.3-Flash在 Coding/Agent 类基准上整体领先,DeepSWE v1.1(63.4 vs 46.2)和 AutomationBench(48.8 vs 26.2)相比 GLM-5.2 大幅提升,官方称其「接近 Claude Opus 4.8」。
- Qwen3.8-Flash在SWE-bench Pro / Multilingual这类「真实工程修复」上最强,且以 6B 激活打出了接近 13B-18B 激活模型的成绩;但 NL2Repo 上略逊。
- DeepSeek-V4-Flash是三者中「最稳」的 Agent 通用件,DeepSWE/NL2Repo/Toolathlon 都处于第一梯队,且并发上限最高(2500)。
3.2 多模态(视觉 / 视频)
| 基准 | DeepSeek-V4-Flash(-Vision-Exp) | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|---|
| Chartography (w/ tools) | 64.3 | 78.0 | — |
| CharXiv Reasoning | 80.4 | 89.4 | 84.6 |
| AndroidWorld | — | — | 84.5 |
| OSWorld 2.0 (partial) | — | — | 52.3 |
| Vision2Web | — | — | 64.0 |
| MVBench | 69.4 | 77.8 | — |
| MMVU | 72.7 | 80.5 | — |
📌口径提示:此表 DeepSeek 数据来自 Z.ai(GLM-5.3-Flash 博客)引用的
DeepSeek-V4-Vision-Exp。注意各家厂商对 DeepSeek 的具体版本取样有别——Z.ai 用 Vision-Exp,Qwen 模型卡用DeepSeek-V4-Flash-0731,因此 DeepSeek 在「Coding 表」和「多模态表」的数值不可直接同列比较。
关键区别:
- DeepSeek的视觉是「后补」的:V4-Flash 本体纯文本,V4-Flash-Vision-Exp 在 8 月 21 日才上线,共享同一套结构参数,纯文本能力与正式版持平,视觉 Agent 能力接近 Opus-4.8。它的多模态只在 API 侧,开源权重本身不带 vision encoder。
- GLM-5.3-Flash是原生多模态(图片/视频/文件),视觉直接融入 Coding 循环——能自主「观察」界面、渲染结果与交互反馈并迭代。这也是它的核心卖点。
- Qwen3.8-Flash同样是原生多模态(图/视频),在 AndroidWorld/OSWorld/Vision2Web 等「真实使用/复刻」类任务上突出,适合 CUA(Computer Use)场景。
四 成本:谁能用一分钱买到一分「高级智能」
4.1 API 定价对照(人民币,百万 tokens)
统一换算成¥/M,缓存命中数据也已收录:
| 项目 | DeepSeek-V4-Flash | GLM-5.3-Flash(限时5折→原价) | Qwen3.8-Flash(海外) |
|---|---|---|---|
| 输入(未命中,高峰) | 3.0 | 0.8 →0.4 | — |
| 输入(未命中,闲时) | 1.5 | — | — |
| 输出(高峰) | 9.0 | 2.8 →1.4 | — |
| 输出(闲时) | 4.5 | — | — |
| 输入(缓存命中) | 0.10(高峰)/0.05(闲时) | 0.23 →0.115 | $0.016 |
| 备注 | 峰谷定价,工作日高峰打折 50% | 5 折限时两周 | $0.15 输入 / $0.47 输出 |
注:DeepSeek 采用峰谷定价(工作日 9:00-12:00、14:00-18:00 为高峰,其余闲时);GLM 国内价 5 折限时两周;Qwen3.8-Flash 国内走阿里云百炼(DASHSCOPE),海外 QwenCloud 上$0.15/$0.47。
直观结论(按人民币折算成美元,~7 ¥/USD):
| 模型 | 输入(峰值) | 输出(峰值) | 相对成本 |
|---|---|---|---|
| DeepSeek-V4-Flash | ~$0.43 | ~$1.29 | 中 |
| GLM-5.3-Flash | ~$0.11(限时)/ $0.15(海外) | ~$0.20 / $0.50 | 最低 |
| Qwen3.8-Flash | ~$0.15 | ~$0.47 | 低 |
GLM-5.3-Flash 和 Qwen3.8-Flash 在输出侧都做到了 $0.47-0.50/M,而 DeepSeek-V4-Flash 输出要 $1.29(高峰),成本约是前二者的2.5×。
4.2 开源 + 自建成本
三者均提供开源权重(MIT License 或等同):
| 模型 | 生命周期 | 自建门槛 |
|---|---|---|
| DeepSeek-V4-Flash | 权重已开源(HF / ModelScope),1M 上下文 | 4×H100 起,1M 需 4×H200,约 284GB FP8 |
| GLM-5.3-Flash | 权重已开源(HuggingFacezai-org/GLM-5.3-Flash),MIT | 约 306GB FP8,TP4(GB200)/TP8(H100/H200) |
| Qwen3.8-Flash | 权重已开源(HF / ModelScope),Qwen3.8-Flash-Next | 约 180GB,4×GB300 / 8×H200 / 4×MI355X;n-gram 可 offload |
五 实际体验与生态
| 维度 | DeepSeek-V4-Flash | GLM-5.3-Flash | Qwen3.8-Flash |
|---|---|---|---|
| 默认思考模式 | 有(thinking/non-thinking) | 仅思考(thinking only) | 默认思考(xhigh/medium/low) |
| 思考强度控制 | low/high/max 三档 | reasoning_effort(low/high/max 近似) | xhigh/medium/low |
| API 兼容 | OpenAI + Anthropic + Responses | OpenAI(智谱风格,兼容) | OpenAI + Anthropic + Responses |
| 工具/Agent 适配 | Claude Code、OpenCode、Codex | ZCode/BUA/CUA、大量生态工具 | Claude Code、Codex |
| 并发上限 | 2500 | 50 | 15K RPM / 2M TPM |
| 强项场景 | 通用 Agent、代码补全、长文档 | 视觉 Coding、Office/金融交付、国产芯片 | 计算机/移动端操控、高并发生产 |
体验层面的几个值得注意的点:
- Qwen3.8-Flash 的
preserve_thinking:默认保留历史所有思考块,牺牲一部分 token 换取 Agent 场景的决策一致性和 KV 复用,实测在长程任务上更稳。 - GLM-5.3-Flash 的思考模式是「强制开启」(
thinking.type只能enabled),不支持关闭;官方建议temperature=1, top_p=0.95, reasoning_effort=max,流式同时开stream+tool_stream。 - DeepSeek 的峰谷定价:闲时(晚上/周末)价格砍半,适合把批处理任务挪到非高峰的团队,能再省一截。
- 并发:Qwen3.8-Flash 给到 15K RPM / 2M TPM,远超 DeepSeek 的 2500,适合高并发在线服务;DeepSeek 的 2500 并发更适合大模型 Agent 编排的墙钟调用。
七 怎么选
| 你的场景 | 首选 |
|---|---|
| 需要极致低成本 + 原生多模态 + Coding 闭环 | GLM-5.3-Flash(输出 $0.50/M,视觉 Coding 最强,国内 5 折更划算) |
| 需要 6B 激活、超稀疏架构、高并发 API + 多模态 CUA | Qwen3.8-Flash(6B 激活、$0.47 输出、15K RPM) |
| 需要 1M 默认上下文 + 通用 Agent 稳定 + 峰谷省钱 | DeepSeek-V4-Flash(1M 标配、并发 2500、闲时半价) |
| 想彻底自建、避开云依赖 | 三者都开源;显存紧选 Qwen(n-gram offload),要长上下文 1M 选 DeepSeek 或 GLM |
| 国产芯片 / 信创环境 | GLM-5.3-Flash(官方已在国产加速芯片集群跑通,MI355X 有官方 recipe) |
八 局限与风险提示
- 三家厂商各自的基准都用自家评测框架(DeepSeek Harness、Z.ai Code Bench、Qwen 自家 Cowork/RecreationBench),不同厂商横评不能直接 pk 分数,只能看相对趋势。
- GLM-5.3-Flash 国内 0.4/1.4 元是限时 5 折,两周后恢复 0.8/2.8 元;海外 $0.15/$0.50 是稳定价。
- Qwen3.8-Flash-Next 是「架构预览」版本(262K 原生),生产接入请用 API 版
qwen3.8-flash(1M 默认、内置工具)。 - DeepSeek 的
deepseek-chat/deepseek-reasoner旧模型名已于 2026-07-24 停止使用,需迁移到deepseek-v4-flash。 - 三方都在快速迭代,基准数字会随版本变化,落地前请核对官方文档。
参考资料
官方来源(首选):
- DeepSeek:
- DeepSeek V4 Preview Release(官方公告,参数/上下文/开源)
- DeepSeek API 更新日志(V4-Flash-0731 / Vision-Exp 上线)
- DeepSeek 模型 & 价格(峰谷定价表)
- DeepSeek-V4-Flash-Vision-Exp 上线公告
- 智谱 GLM:
- GLM-5.3-Flash 官方文档(320B/18B、架构、部署)
- GLM-5.3-Flash 技术博客(Z.ai 英文原版,含基准表)
- 智谱模型概览
- 智谱开放平台定价页
- 阿里 Qwen:
- Qwen3.8-Flash-Next 官方博客
- Qwen3.8-Flash-Next HF 模型卡(架构与基准明细)
- Qwen3.8-Flash API 概览与定价(QwenCloud)
部署与专业延伸:
- vLLM — DeepSeek V4 部署指南
- vLLM Recipes — GLM-5.3-Flash 部署
- vLLM Recipes — Qwen3.8-Flash-Next 部署
- GLM-5.3-Flash 模型权重(HuggingFace)
- DeepSeek-V4-Flash 模型权重(HuggingFace)
- Apidog:如何在本地运行 DeepSeek V4(盈亏平衡分析)
- Spheron:在 GPU 云部署 DeepSeek-V4-Flash