从 14.8 万亿 tokens 看 DeepSeek-V3 预训练数据分布:语言占比、领域覆盖与能力边界
【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3
DeepSeek-V3 是深度求索(DeepSeek)开源的混合专家(MoE)大模型,总参数671B、每次推理仅激活37B,以14.8 万亿 tokens完成预训练。本文聚焦 DeepSeek-V3 预训练数据分布,从规模成本、语言占比、领域覆盖与质量信号四个维度逐层拆解,并用评测成绩反推官方未公开的数据构成比例,为开发者画出一份可落地的能力边界参考图。
一个反常识的起点:参数更大,为什么反而更便宜?
DeepSeek-V3 总参数671B,比同为开源旗舰的 LLaMA 3.1 405B 大出六成以上,但完整训练仅耗2.788M H800 GPU 小时,其中预训练阶段2.664M H800 GPU 小时,后续监督微调与强化学习阶段只剩0.1M GPU 小时。
这个"便宜"并非靠压缩数据换来的——预训练数据量高达14.8 万亿 tokens,稳居开源第一梯队。参数更大、数据更多、成本反而更低,秘密藏在三处:FP8 混合精度训练框架、无辅助损失(auxiliary-loss-free)的负载均衡策略,以及算法—框架—硬件协同设计的通信优化。算力几乎不浪费在梯度同步与专家负载失衡上。
于是核心问题浮出水面:这 14.8 万亿 tokens 里,到底装了什么?本文用四把尺子逐一丈量。
分析框架:四把尺子,量一份数据集
| 维度 | 要回答的问题 | 证据来源 |
|---|---|---|
| 规模与成本 | 数据多大、训练多贵、值不值 | 官方训练报告与 README |
| 语言构成 | 各语种占比如何、为何中英更强 | 分语言评测成绩(反推) |
| 领域覆盖 | 代码/数学/知识各占多少权重 | 分任务基准分数 |
| 质量信号 | 数据"成色"如何、有无明显杂质 | 长文本测试与训练稳定性 |
四个维度互为印证:规模决定能力上限,语言与领域构成决定能力形状,质量决定能力下限。下面逐尺展开。
规模与成本账本:14.8 万亿 tokens 与 2.664M GPU 小时
先摆账本,再下结论。
| 项目 | 数值 | 说明 |
|---|---|---|
| 预训练数据量 | 14.8 万亿 tokens | 多样化、高质量,覆盖多语种多领域 |
| 预训练算力 | 2.664M H800 GPU 小时 | 全程 FP8 混合精度训练 |
| 完整训练算力 | 2.788M H800 GPU 小时 | 含 SFT 与 RL 阶段(约0.1M) |
| 训练稳定性 | 全程无不可恢复 loss 尖峰 | 无回滚、无灾难性失败 |
| 上下文长度 | 128K tokens | 长文本能力写入基线 |
这份账本说明三件事。第一,数据规模与算力效率同时达标——FP8 训练首次在超大规模模型上得到工程验证。第二,训练"零事故"侧面印证了数据清洗管线(SimHash 去重、质量分类器打分、领域比例动态均衡)足够扎实。第三,成本优势直接转化为开源可及性,社区用普通多卡集群即可完成部署与复现。
图 1:DeepSeek-V3 与主流开源/闭源模型的多基准对比,数学与代码任务的优势直接源于数据分布侧重
多语言模型数据占比反推:英语是主食、中文是硬菜、多语是配菜
官方没有公布精确的语言占比表,但根据"数据越充分 → 同语言任务分数越高"的强相关性,可以从评测表现反推合理区间。注意:下表占比为推断值,非官方数据。
| 语系 | 代表基准与得分 | 推断占比区间(非官方) |
|---|---|---|
| 英语 | MMLU87.1%、BBH87.5%、MMLU-Pro64.4% | 高于 50% |
| 中文 | C-Eval90.1%、CMMLU88.8%、CMath90.7% | 20%~30% |
| 其他语言 | MMMLU-non-English79.4% | 10%~20% |
反推逻辑链条清晰:英语成绩全面压制同代开源模型,说明英文语料(学术文献、网页、代码注释)占比最高;中文在 C-Eval 与 CMath 上甚至反超英语任务,这并非中文语料数量更多,而是中文数据质量与针对性更强;多语言总分79.4%说明日语、西语、法语等语种有系统性覆盖,但单语深度有限。
落到用户侧的影响:中文开发者可以放心用 DeepSeek-V3 承接问答、写作与检索场景;英语场景同样可靠;小众语言场景建议先跑一轮小样本试测再决定是否上生产。
领域覆盖拆解:代码、数学、知识与长文本的四张成绩单
按任务领域归类后,数据分布的"形状"立刻清晰起来。
| 领域 | 基准与得分 | 推断的数据侧重 |
|---|---|---|
| 代码 | HumanEval65.2%、MBPP75.4%、CRUXEval-I/O67.3% / 69.8% | GitHub 代码库、技术文档大规模纳入 |
| 数学 | MATH61.6%、GSM8K89.3%、MGSM79.8%、CMath90.7% | 学术论文、竞赛题、教科书 |
| 知识问答 | TriviaQA82.9%、NaturalQuestions40.0% | 百科、新闻、网页长尾知识 |
| 长文本 | NIAH 2K→128K 全区间高分、LongBench v248.7% | 书籍、论文、代码仓库等长文档 |
每一行都遵循"数据表现 → 原因解释 → 实际影响"的闭环。代码类成绩全面领先,说明代码语料占比高且清洗到位,直接影响是代码辅助开发体验出色;数学在开源阵营断层领先,影响是推理类任务可当主力;而 NaturalQuestions 仅40.0%,暴露知识长尾的短板——细粒度事实查询建议搭配检索增强(RAG)使用。
图 2:Needle In A Haystack 测试,2K 至 128K 上下文全区间保持高分,验证长文本语料训练的有效性
开源模型能力边界分析:谁该用它,谁需要三思
推荐优先使用的场景:
- 中英文对话与写作——覆盖最充分,指令跟随稳定(Arena-Hard85.5、AlpacaEval 2.0 胜率70.0%)
- 代码生成与补全——HumanEval、MBPP、CRUXEval 全面领先
- 数学与逻辑推理——AIME 202439.2%、MATH-50090.2%,开源最强档
- 超长文档理解——128K 上下文的检索、摘要与多文档问答表现稳定
需要谨慎的边界:
- 低资源语言:非中英语种覆盖有限,务必先用小语种样本实测
- 专业垂直领域:医疗、法律、金融的高频专业语料占比未知,落地前建议领域微调
- 细粒度事实检索:NaturalQuestions40.0%提示知识存在长尾遗漏,配合 RAG 更稳妥
结论与展望:数据分布是下一个分水岭
回到开头的反常识:DeepSeek-V3 的 14.8 万亿 tokens 没有"均匀撒胡椒面",而是英语为主、中文为重、代码与数学为尖刀的聚焦式分布。这份分布直接定义了模型的能力形状——通用对话不掉队、代码与数学出彩,也正是它能在 2.664M GPU 小时预算下对标闭源模型的关键。
展望层面,多 token 预测(MTP)目标函数已在训练中被验证有效,并可用于投机解码加速推理;随着社区在 MTP 模块上的持续开发,同一份数据还能被榨出更高性价比。对开发者的下一步行动很具体:clone 仓库https://gitcode.com/GitHub_Trending/de/DeepSeek-V3,对照 inference/configs/ 理解模型结构,用 inference/fp8_cast_bf16.py 完成 FP8→BF16 权重转换,再用 inference/generate.py 跑通第一次对话,亲手验证这份预训练数据分布是否符合你的业务预期。
【免费下载链接】DeepSeek-V3项目地址: https://gitcode.com/GitHub_Trending/de/DeepSeek-V3
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考