【边界层 · 技术架构】
一个观察:DeepSeek用557万美元训练出GPT-4级别的模型时,整个行业都在问"怎么做到的"。但更值得追问的是——为什么是DeepSeek?为什么是此刻?
答案可能在于:他们从一开始就把成本当成了架构设计的边界条件,而不是后期优化的目标。
一个模式
数据平台这十年经历了从数据仓库到湖仓一体的演进。Oracle、微软、Snowflake、Databricks们都在积极扩展AI能力,服务企业智能化的需求。
但另一边,OpenAI、#DeepSeek、#月之暗面 这些领先的AI公司,却选择了自建或深度定制数据基础设施。
这不是简单的"重复造轮子"。当面对极端的AI训练需求时,传统的数据架构决策逻辑可能不再适用。
我研究了九家头部AI公司,最终聚焦三个典型案例。它们分别代表了三种极端需求,以及三种不同的架构响应。
三个案例:三种极端需求
其他六家——Google、Meta、阿里云、Anthropic、xAI、字节——被排除的原因各不相同:有的属于Type A路径(在现有云基础设施上深度定制而非从零自建),有的技术披露不足,有的基础设施自主性受限。
三个入选案例的共同点是:完全拥有基础设施决策权,且各自面对的极端需求迫使它们进行架构创新,而非渐进优化。
OpenAI:当学习速度成为核心指标
ChatGPT的规模创造了一个传统AI不存在的数据机会:每天数亿次真实用户交互,每一次都包含潜在的训练信号。
极端需求是:用户反馈数据必须在小时级别回流到训练流程,而不是传统的周级或月级。
传统AI系统的循环很熟悉:收集用户行为数据→离线分析→月度模型重训。但对于ChatGPT这种规模的对话AI,这个节奏太慢了。安全问题需要即时响应,对话质量不快速迭代就会下滑。更重要的是——竞争对手不会等你。
OpenAI的架构响应是"数据飞轮":
实时采集:对话日志、点赞点踩、API调用模式——以流式而非批处理的方式捕获
质量筛选:启发式规则结合小模型分类器,筛选高价值训练样本
增量融合:新数据与历史训练集高效融合,避免全量重建
持续训练触发:积累足够新数据后自动启动微调或持续预训练
在线A/B验证:模型变体立即投入生产流量测试
这里的关键转变是:数据平台优化目标变了。传统平台优化存储效率和查询性能,#OpenAI 的平台优化学习速度——用户反馈转化为模型改进的速率。
这改变了每一个设计决策。存储格式优先保证与训练框架的兼容性,而非支持分析查询。处理管道优化到GPU集群的延迟,而非人类分析师的响应时间。质量控制前移——坏数据不只是污染报表,而是直接污染模型。
DeepSeek:成本不是结果,是约束
DeepSeek的557万美元训练成本不只是工程上的惊艳。它代表了一种不同的哲学:成本效率从架构层面就设计进去,而非后期优化进来。
技术论文展示了这种哲学如何在每一层落地:
模型架构:MoE(混合专家模型),总参数6710亿,但每个token只激活370亿(5.5%稀疏度)。这不只是训练技巧——它从根本上改变了数据需求。稀疏激活意味着数据管道必须支持传统稠密模型不需要的路由决策。
训练精度:FP8混合精度而非FP16或FP32。内存需求和通信开销减半,但要求数据管道支持量化感知预处理。
数据管道(推断):虽然论文聚焦训练优化,但工程哲学暗示了激进的数据管道优化——智能去重避免冗余训练、优化加载减少GPU空闲、智能缓存策略。
硬件协同设计:论文提到的"DualPipe"算法针对H800集群优化流水线并行。数据移动模式与硬件拓扑协同设计。
核心洞察:DeepSeek不是从标准架构出发然后寻找成本优化。他们从成本作为绑定约束出发,让它驱动架构选择——从MoE选择到精度格式到数据管道设计。
这是"我们有预算,来优化"和"这个预算就是设计空间,什么架构能装进去?"的区别。
月之暗面:差异化如何重构架构
当大多数大模型在通用能力上竞争时,月之暗面押注了一个不同的方向:200万字(约200万token)长上下文,大概是行业标准12.8万-20万token的10倍。
这不只是模型架构挑战。它从根本上重构了数据管道:
存储挑战:单条训练样本可达数MB——比标准训练的KB级文本大几个数量级。存储格式和压缩策略必须重新思考。
I/O挑战:读取长序列需要更高存储带宽和更复杂的并行加载。数据管道可能成为训练瓶颈。
处理挑战:长文档的质量评估、去重、分词逻辑与短文本不同。文档级vs段落级去重成为影响质量的关键设计决策。
成本挑战:长上下文训练成本随序列长度平方增长。数据管道效率直接影响整体训练经济性。
月之暗面的响应(基于公开信息和行业知识推断):
分块存储:长文档切分为可随机访问的块,支持训练时灵活采样
混合加载:预加载结合流式读取,减少长序列I/O等待时间
文档级质量体系:完整性、结构、内容价值的文档粒度评估框架
合成数据管道:长上下文能力需要大量长文档训练数据,可能驱动合成生成投入
更广的启示是:月之暗面的案例展示了差异化策略如何驱动架构创新。他们没有沿用标准数据管道然后优化,而是面对非标准需求,建造了非标准管道来匹配。
跨案例比较:模式提炼
三类极端需求,三种架构响应
需求 | 响应模式 | 关键设计 |
|---|---|---|
反馈速度 | 实时飞轮 | 流式摄取、增量更新、在线验证 |
成本效率 | 约束驱动架构 | MoE、FP8、硬件协同、激进管道优化 |
差异化功能 | 架构重构 | 分块存储、混合加载、文档级质量体系 |
五个核心特征
从这些模式中,我提炼AI原生数据平台的五个特征——不是作为"优于传统",而是作为对不同约束的不同响应:
规模特殊性:EB级数据(DeepSeek 14.8T tokens,OpenAI估计10T+)。这不只是"更多数据"——是改变每个设计决策的不同数量级。
类型特殊性:训练语料、用户反馈、合成数据——与传统平台设计的交易或分析数据有本质区别。
成本作为设计约束:不是"设计后优化成本",而是"让成本从一开始就约束设计空间"。
迭代速度:小时级反馈闭环而非周级或月级。平台价值以学习速度衡量,而非存储容量。
硬件深度协同:存储格式、加载策略、数据移动模式与GPU/TPU特性协同设计——而非从中抽象隔离。
六层参考模型
跨案例呈现出一个共同的架构模式:
各层的核心设计考量:
数据源层(Layer 1):数据多样性管理,包括授权合规、多语言处理、多模态统一。
数据摄取层(Layer 2):实时性与吞吐量的平衡,增量更新机制。
数据存储层(Layer 3):冷热分层策略,成本-性能权衡。
数据处理层(Layer 4):可扩展的处理流水线,质量可观测性。
数据服务层(Layer 5):GPU利用率最大化,I/O瓶颈消除。
模型交互层(Layer 6):实验可复现性,训练-评估闭环。
每一层对AI训练工作负载都有独特设计考量——从数据源层的多样性管理,到摄取层的实时/吞吐量权衡,到服务层的GPU利用率最大化。
启示
对平台厂商
OpenAI、DeepSeek、月之暗面的极端实践代表了可能向主流迁移的需求:
成本效率服务:智能去重、AI优化存储分层、训练框架协同优化
实时反馈基础设施:流式摄取、ML框架集成、摄取时质量评估
差异化支持:可配置处理管道、场景特定存储优化、合成数据工具
Snowflake、Databricks、AWS、Azure、GCP、阿里云都在这些方向投资。问题是执行速度,而非投资是否正确。
对企业决策者
评估是否自建基础设施的简单框架:
因素 | 阈值 | 含义 |
|---|---|---|
训练规模 | <100B tokens | 使用成熟平台 |
训练规模 | >1T tokens | 评估深度定制 |
成本敏感度 | 核心约束 | 研究DeepSeek的约束驱动方法 |
差异化需求 | 独特要求 | 评估是否需要架构重构 |
团队能力 | 分布式系统+AI基础设施经验 | 自建必需 |
默认建议:大多数企业应使用成熟平台。它们正在快速演进,能满足绝大多数AI数据需求。
与传统平台的关系
这项研究不是说AI原生平台"优于"传统数据平台。传统平台已经演进出了令人印象深刻的能力——流批一体、湖仓一体、亚秒级分析。
我的判断是:不同约束驱动不同架构。AI公司面对极端需求(EB级规模、小时级反馈、威胁商业可行性的成本约束),这些需求证明了不同方法的合理性。这些方法可能启发传统平台演进,但不会取代它们。
局限与未来
这项研究有清晰的边界:
来源依赖:主要依赖公开信息。部分分析是中等置信度推断,特别是OpenAI技术披露极少
幸存者偏差:三个案例都是成功的公司。失败的自建基础设施尝试未被代表
时间局限:AI基础设施格局快速演进。基于2024-2025实践的结论可能需要更新
地域集中:三个案例中两个是中国公司,虽然聚焦技术架构时地域因素相关性有限
未来研究方向:纵向追踪这些案例、分析失败的自建基础设施项目、定量的成本性能数据比较、与其他高性能计算场景的跨域比较。
边界层笔记
OpenAI、DeepSeek、月之暗面建造的数据平台代表了比渐进优化更有趣的东西。它们是对极端需求的响应——这些需求是传统基础设施未曾设计来满足的,是成为架构约束而非优化目标的。
OpenAI的小时级反馈、DeepSeek的1/20成本效率、月之暗面的200万字上下文,各自需要不同的架构响应。合在一起,它们勾勒出一个新兴图景:为学习速度和成本效率优化的AI原生数据基础设施,与硬件协同设计,为模型服务而非为分析师服务。
对大多数企业,正确选择仍是快速吸收这些能力的成熟平台。但对那些在前沿建造的人——或那些想知道前沿往哪走的人——这些案例提供了一张有用的地图。
#AI原生数据平台、#大语言模型训练、#数据基础设施、#案例研究
本分析完成于2025年4月。作者与文中提及的任何公司无经济利益关系。所有信息来源于公开可获取的技术论文、官方博客和行业报告。
科里(Coralyx),发表于「边界层」2026.04