湖仓里躺着 PB 级数据,业务方却还在问「这个月的闭环耗时是多少?哪个环节在积压?」——数据在库里,不等于数据在手上。从原始事实到业务方能直接消费的产品,中间隔着一次关键的「产品化」加工:把散落在 DWD/DWS 层的明细与聚合,按业务问题物化成一张张开箱即用的表。
前四篇我们讲完了闭环全景、行业对标、架构蓝图与全局 ID。本篇看蓝图的最后一块拼图——ADS 应用数据层:StarRocks 离线加工 DWS/DWD 层数据并物化为StarRocks 内表(毫秒级直查),共11 张开箱即用的数据产品表,从闭环效率大盘到存储成本看板,直接服务各业务平台。
这是「小周谈智驾数据闭环」系列一的第五篇。你将看到:
一、为什么需要「门面」层:数据 ≠ 产品
先看三个真实的业务问题:
这些问题如果每次都从 ODS/DWD 明细现场聚合,要么查询太慢,要么口径各写各的。ADS 层的职责就是把答案预先算好:StarRocks 离线加工 DWS/DWD 层数据,物化为 StarRocks 内表,T+1 批加工、毫秒级直查。每张表都回答一类明确的业务问题,业务平台直接取数渲染,无需理解湖仓分层。
一句话定位:ODS/DWD 存事实,DWS 存聚合,ADS 存答案。
二、11 张表全景:按业务问题归类的产品矩阵
11 张表不是随意堆出来的,而是按「谁在什么场景下要回答什么问题」设计的。先看全景:
按业务主题归成六组:闭环健康度(1、2)、数据质量资产(3、4、5)、资产运营(6)、模型迭代与上车(7、8、9)、成本治理(10)、挖掘运营(11)。下面按组逐一拆解,每张表给出服务对象、核心指标与一个真实业务场景。
三、闭环健康度:大盘与瓶颈的两级下钻
表 1 · 闭环大盘指标表
按「统计日期 × 项目代码」T+1 加工,回答闭环整体健康度:总数据量与月度新增、平均闭环耗时(车端触发 → OTA 部署各环节时长汇总)、Badcase 解决率、各状态数据量分布、数据增长率与效率提升率。大屏首屏用 KPI 指标卡 + 多线趋势图,一眼看闭环转得快不快、质量好不好。
一个真实的优化案例:
表 2 · 产线瓶颈分析表
是大盘的下钻层:按「统计日期 × 项目代码 × 产线环节(上云/前处理/标注/质检)」计算各环节平均耗时、瓶颈环节标识(耗时占比超阈值或环比恶化自动标记)、积压数据量与吞吐量/质检通过率。典型场景:产线连续 3 天告警,标注环节被识别为瓶颈——积压1.5 万条、平均耗时 72 小时占全链路 55%;数据管理平台调度标注团队扩容并引入预标注模型,一周后标注耗时降至36 小时、积压清零,产线恢复满吞吐。
两级下钻的分工:大盘看「闭环慢不慢」,瓶颈表定位「慢在哪个环节」——度量先行,优化才有靶心。
四、Badcase 即资产:根因、场景、难例三张表
闭环里最值钱的不是原始数据,而是从问题中提炼出的定向改进线索。三张表把 Badcase 变成可运营的资产:
根因分布表(表 3)
按根因分类/子分类统计数量、占比与趋势。模型 v3.2 评测产出 3,200 个 Badcase,分布显示感知漏检占45%,其中夜间行人占28%且趋势上升 → 问题分析平台把结论推送挖掘平台,定向补采 2,000 条重训,该类漏检下降 60%
场景库汇总表(表 4)
按「场景类型 × 场景标签」统计总量、高质量量、关联 Badcase 与覆盖度。场景库定义 1,200 个标签、覆盖度82%;盘点发现「施工区域」仅150 条(达标线 2,000 条)且 Badcase 逐月上升 → 生成场景缺口清单,定向补采两周后达标、状态流转 COVERED
难例库表(表 5)
按「难例类别 × 来源 × 模型版本」统计数量、采纳率与闭环验证效果。v3.2 评测挖出3,200 条难例(夜间行人 900、逆光车辆 700),训练平台采纳2,800 条(采纳率 87.5%)混入 v3.3 训练集,重训后夜间行人漏检率下降60%——难例闭环的价值被完整量化
三张表串起来是一条完整的线索链:根因表告诉你「错在哪类问题」,场景表告诉你「哪类场景缺数据」,难例表告诉你「补进去有没有效」。Badcase 从事故记录变成了驱动下一轮采集与训练的燃料。
五、迭代与上车:版本对比、OTA 与触发热力图
模型从训练完成到真正上车,还要过三道「数据产品」关:
表 7 · 模型版本对比表
按「模型版本 × 数据集 × 场景类型」对比通过率、Badcase 率、平均指标分与基线对比。真实案例:v3.3 与 v3.2 在「城区 NOA 评测集 v5」对比——总体通过率91.2% vs 87.5%,夜间场景显著提升+8.3pp(难例闭环见效);但高速场景回归-1.2pp→ 评测平台标记回归项,定位到车道线检测变更,修复后再 OTA,避免带病上车。
表 8 · OTA 部署汇总表
按「统计日期 × 车型 × 软件版本」统计升级任务数/车辆数、成功率、灰度进度与发布后回传触发量。v3.3 灰度推送 500 台车:升级成功率99.2%,发布后一周回传触发量环比增长30%(新版本主动采集策略生效),安全相关问题 0 起 → 确认全量推送,回传数据反哺下一轮训练,闭环真正转动起来。
表 9 · 触发事件热力图表
按「统计日期 × 车型 × 触发类型 × 地理网格」统计触发总量、上传/处理完成率与入数据集量。热力图显示触发集中在城区晚高峰路口;某区域「AEB 误触发」周环比上升45%→ 问题分析平台关联该区域回传数据定位到逆光路口场景,挖掘平台下发定向采集需求,补数重训后误触发率回落。
三张表首尾相接:版本对比守住「不上带病模型」的底线,OTA 汇总盯住「上车过程可控」,热力图把「上车后的问题」变成下一轮闭环的入口——部署不是终点,而是新数据的起点。
六、运营底盘:资产目录、存储成本与挖掘标签
最后一组表服务于「让闭环可持续运转」的运营视角:
表 6 · 数据资产目录表
按「资产类型 × 负责人」登记数据集/场景库/难例库/评测集的注册数、使用次数与质量评分。「城区 NOA 主数据集 v12」本季度被12 个训练任务引用、质量评分4.6,列为核心资产;同期 3 个低分老旧数据集长期无人使用 → 标记归档释放存储,资产目录保持「新鲜可用」。
表 10 · 存储成本看板表
是成本治理的仪表盘,按「存储介质 × 生命周期分层 × 数据类型」呈现容量、成本、治理动作量与节省额。月末复盘的真实数据:
成本增速 1.8% 对数据增速 35%——这就是治理规则有效的直接证据;同期预热命中率 91%、归档取回 23 次/日均处健康区间,无需调阈值。
表 11 · 挖掘标签分布看板表
盯住标签资产的健康度:三来源(采集/规则/模型)标签量构成、clip 覆盖率、向量化率、检索热度与候选池待审量。周会看盘实例:SCENE 类标签覆盖率78%(环比 +5pp),规则挖掘贡献 42%、VLM 推理 31%、采集携带 27%;「雨天夜间」标签 7 日增长+23%且检索命中156 次(全库 Top3)→ 优先保障其向量化队列;同期候选池待审 320 个,触发审核流清理,防止标签爆炸。