news 2026/8/31 15:16:45

京东数据分析笔试全解析:SQL、AB实验与业务案例备考指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
京东数据分析笔试全解析:SQL、AB实验与业务案例备考指南

开始之前,先说说这份试卷为什么值得翻出来看看

2019年京东春季校招的数据分析岗试卷,放在今天回头看,依然有很强的参考价值。不是说题目有多新,恰恰相反,它考察的东西——SQL取数、指标拆解、业务归因、AB实验设计——在六年后的数据分析面试中依然是主流。甚至可以说,当下很多大厂数分岗的笔试,核心逻辑和这份试卷是一脉相承的。

我当时拿到这份试卷的第一感觉是:它不考偏题怪题,不考编程语言语法细节,而是用京东自己的业务场景(电商、物流、用户增长)来包装每一道题。这意味着什么?意味着它考察的不是“你会不会写代码”,而是“你能不能带着业务视角去用数据解决问题”。这套考察逻辑,正是数据分析岗位日常工作的真实映射。

这篇文章会带你把这份试卷的核心考点逐层拆开,从SQL到统计,从指标体系到业务案例分析,每一部分我都会给出解题思路、踩坑提醒和实操心得。不管你是正在准备大厂数分岗校招的应届生,还是工作两年想跳槽的初级数据分析师,这篇文章都能给你一套可以直接对照复盘的备考框架。

1. 京东数据分析笔试的整体定位与考察逻辑

1.1 从试卷看京东对数分岗的能力预期

先聊一个很多人忽略的点:笔试不是单纯考知识,它在筛“适不适合干这行”。

京东那份试卷,前几道题基本锁定在SQL和数据处理上,中间穿插统计推断和概率计算,最后落到一两道业务分析大题。这个结构透露出的岗位预期非常清晰——数据分析师不是纯技术岗,也不是纯业务岗,而是两者的交汇点。你得能从数据库里把数取出来,还得能把这些数变成业务决策依据。

对比一下同期的其他大厂试卷会更明显。有的公司侧重机器学习算法推导,有的公司侧重产品Sense和A/B测试设计,京东这份卷子则更偏向“电商业务分析师”的画像:SQL必须熟练,统计要能落地,业务逻辑要清晰。它的业务场景设定通常围绕GMV变动归因、促销活动效果评估、用户分层运营效果分析、供应链库存周转这类电商核心问题展开。

所以你在复习时,就别花太多精力去啃那些偏算法的深度内容了。把SQL窗口函数练熟,把假设检验和AB实验的流程吃透,再配合一套业务分析框架去练案例题,基本就能覆盖这份试卷90%的考察面。方向对了,努力才有效。

1.2 题型分布与分值权重透露出的复习优先级

我根据考过同学的回忆和公开的帖子,整理了这份试卷大致的题型结构。虽然版本不完全一致,但分布逻辑是一致的:基础数据处理能力占大头,业务分析能力紧随其后,统计和概率穿插其中。

题型大致占比考察核心
SQL取数与数据清洗30%-35%多表关联、聚合、窗口函数、去重
概率统计与AB实验20%-25%假设检验、置信区间、实验设计
指标体系与业务理解15%-20%指标口径、漏斗拆解、归因分析
业务案例主观题25%-30%分析框架、逻辑表达、落地建议

这个分值分布说明了一个问题:SQL和业务案例加起来占了半壁江山。如果时间有限,这两个板块的优先级最高。统计部分虽然占比不小,但考察的深度通常是应用层的,不会让你手推复杂公式。至于概率题,主要看你有没有基本的统计直觉。

另外注意一个细节:这套试卷是限时的,通常90到120分钟要完成上面所有题目。时间紧张意味着你不仅要会做,还要做得快。很多人栽在最后的大题上,不是不会分析,而是前面小题耗时太久。这个策略问题我后面会专门展开说。

2. SQL与数据提取:绕不开的第一道门槛

2.1 京东场景下的SQL考点:从取数到业务口径

京东的SQL题和LeetCode那种纯算法题完全是两码事。它不会扔给你一张员工表和一张部门表让你join一下完事,而是模拟一个电商业务场景,比如订单表、用户表、商品表、促销活动表——然后问你“计算2023年第一季度各品类的复购率”或者“找出客单价高于品类平均值的前100个SPU”。

这种题目表面上考SQL语法,实际上在考两件事。第一,你能不能把业务问题翻译成SQL逻辑。第二,你懂不懂电商数据背后的口径和坑。比如“复购率”就有好几种口径,按用户算还是按订单算,时间窗口定在多少天,新客要不要排除——口径不同,答案完全不同。笔试里通常不会明确告诉你这些细节,你需要自己定义并在答案里写清楚。

我见过太多人在这一步翻车:SQL写得很顺,但口径考虑不周,比如没排除测试订单和异常退款单,或者没处理同一天多笔订单的去重逻辑。这些细节恰恰是京东这种规模的公司特别在意的,因为日常业务决策依赖的数据报表,一点点口径偏差都会被放大。

2.2 高频题型拆解:留存、复购、GMV拆解

结合试卷实际考点和后续考生反馈,我整理了三个最高频的SQL题型和解法。

第一类:用户留存分析。给你一张用户登录记录表,让你计算某日新增用户在第7天的留存率。核心逻辑是先圈定新增用户(当天首次登录),再LEFT JOIN第7天还有登录记录的用户,最终按时段分组计算比例。这里的常用技巧是DATE_DIFF函数配合条件聚合,或者用窗口函数对每个用户计算首次登录日期。

-- 以2023-01-01新增用户7日留存为例 WITH new_users AS ( SELECT user_id, MIN(login_date) AS first_login FROM login_log GROUP BY user_id HAVING MIN(login_date) = '2023-01-01' ) SELECT COUNT(DISTINCT n.user_id) AS new_user_cnt, COUNT(DISTINCT CASE WHEN l.login_date = DATE_ADD(n.first_login, INTERVAL 7 DAY) THEN n.user_id END) AS retained_cnt, COUNT(DISTINCT CASE WHEN l.login_date = DATE_ADD(n.first_login, INTERVAL 7 DAY) THEN n.user_id END) / COUNT(DISTINCT n.user_id) AS retention_7d FROM new_users n LEFT JOIN login_log l ON n.user_id = l.user_id

第二类:复购率分析。区别在于需要定义“购”的维度,是订单ID还是下单次数,以及时间窗口。推荐在SQL里用带注释的子查询把口径写清楚,哪怕代码长一点,阅卷人看了会觉得你有业务sense。

第三类:GMV拆解。比如“统计2023年6月各一级类目GMV环比变化及贡献度”。这题单纯用SUM + GROUP BY就能完成80%,但如果你想拿高分,就要多算一步“各品类GMV变化对大盘GMV变化的贡献率”。这需要在拆解时保留上月GMV、本月GMV、差额、贡献率这几个字段,而不是只交一个汇总表上去。

2.3 手写SQL的答题规范和细节技巧

笔试现场手写SQL和你在本地编辑器里写完全不一样,没有自动补全,没有报错提示,写错了就是错了。几个实操细节分享给你。

第一,养成写WITH子句的习惯。复杂逻辑拆成一段一段的临时表,既方便自己理清思路,也方便阅卷人看懂你的解题链路。不要在一条SELECT里堆十几个CASE WHEN,那会给阅卷人留下“逻辑混乱”的负面印象。

第二,时刻关注NULL值的处理。LEFT JOIN 后右表字段大概率出现NULL,COUNT、SUM、AVG这些聚合函数对NULL的处理又各不相同。比如AVG会忽略NULL行,但如果你用SUM/NULLIF(COUNT,0)手动计算平均值,NULLIF就非常关键。这些细节在笔试题里经常成为区分度。

第三,写完SQL务必检查边界条件。日期临界点是否包含当天,金额单位是元还是分,订单状态是否需要过滤“已支付”——每个动作背后都可能影响最终结果。我常用的检查方式是:结果先做总量级估算,看看算出来的数是不是符合常理。比如“日活5000万”这种量级在京东场景下是合理的,如果算出来5万,那一定哪里出了问题。

3. 统计基础与AB实验:别背公式,要理解业务含义

3.1 假设检验在电商场景中的实际落地

统计部分京东这份试卷不会让你手推中心极限定理的证明,而是给一个业务场景,让你判断用什么方法、为什么、怎么解读结果。典型的题目长这样:“促销页改版后,我们观察到点击率从2.0%提升到2.3%,请问这个提升是否显著?应该用什么检验方法?需要注意什么?”

这道题的考点拆开来看有三层。第一层,识别问题类型:点击率属于二项分布数据,样本量足够大时可以用Z检验,更严谨的做法是用卡方检验或两比例检验。第二层,解释显著性水平与P值:P值小于0.05只说明在统计意义上拒绝原假设,但不代表实际业务效果一定显著(需要结合效应量)。第三层,指出常见陷阱:样本量是否事先计算,两组的流量分配是否随机,有没有辛普森悖论的可能。

答题时我建议按“原假设→备择假设→检验方法→样本量→结果解读→业务建议”这个顺序写,逻辑链条完整。比如:

原假设H0:改版前后点击率无差异(p1 = p2);备择假设H1:改版后点击率显著提升(p1 > p2)。本场景属于大样本二分类比例检验,可采用两比例Z检验。显著性水平取0.05,检验功效设为0.8,事前计算每组所需样本量不低于8600。实际结果显示P值<0.001,在95%置信水平下拒绝H0,认为改版对点击率有显著正向影响。考虑到置信下限为0.2个百分点,虽然统计显著但业务提升幅度有限,建议结合运营成本综合判断是否全量上线。

你看,同样是结论,这个回答把方法选择、样本量估算、结论边界和业务建议都覆盖到了。阅卷人一眼就能看出你是有实战经验的人,而不是只会背公式。

3.2 AB实验设计题目:从分组到评估的完整流程

AB实验的完整流程是京东数据分析岗笔试和面试的共同重点。记住标准套路:确定实验单位(用户还是请求)→ 确定指标(核心指标+护栏指标)→ 计算样本量 → 随机分组 → 设定实验周期 → 上线观察 → 显著性检验 → 结果解读与决策。

笔试中最常考的两个点是样本量计算和实验周期。样本量计算涉及一个公式:n = (Zalpha + Zbeta)^2 * 2 * p * (1-p) / (p1 - p2)^2。如果在笔试中给出提升阈值的场景,你要能直接把数字代入算出来,这属于基本功。

实验周期这块有个坑。很多人以为实验跑满7天就够了,但实际要考虑一周的周期性波动(工作日vs周末)和用户行为延迟效应(新用户需要激活期,老用户可能受到新奇效应影响)。所以笔试里如果问“实验要跑多久”,正确答案通常不是“7天”,而是“至少覆盖一个完整业务周期(如7天),且要照顾到行为延迟,通常建议14天或21天,并在上线第3天、第7天分别做一次中间检查”。

3.3 概率题与业务直觉

概率部分通常不会太难,但会披着电商外衣。比如“某商品加入购物车后购买的概率为30%,三个独立用户加入购物车,至少一人完成的概率是多少”——这就是1 - (1-0.3)^3 = 0.657,考的是概率论基础。

这类题想全对不难,就怕你在“独立”这个假设上栽跟头。现实业务里用户行为从来不是完全独立的,但笔试默认在理想条件下计算,别把问题复杂化。我做这类题的习惯是,先判断是不是独立事件,再看是“至少”还是“恰好”,最后再套公式。每道题我都在草稿上写清楚这两个判断,再动笔算。

4. 业务案例分析题:拉开差距的地方

4.1 案例题的三种典型出题形式

案例分析题在试卷中的权重最高,也是最难临时抱佛脚的部分。京东的案例题通常从以下三种形式中选。

形式一:指标异动归因。比如“某品类6月GMV环比下降12%,请分析可能原因”。这种题的考察核心是归因逻辑和拆解能力。你不能一上来就猜“是因为竞品搞活动”,而是要把GMV按“流量×转化率×客单价”拆开,再层层下钻到“新客/老客”“各品类/各品牌”“各渠道/各区域”,最后结合内外部因素给出假设清单。

形式二:业务方案设计。比如“设计一套会员召回方案,目标是在预算有限的情况下最大化召回率”。这种题考察的是方案设计能力和数据预估能力。你要把目标人群分层、触达方式、成本测算、预期效果、监控指标都说清楚,尤其是用什么数据指标衡量方案是否成功。

形式三:指标体系搭建。比如“为一个同城零售业务设计核心指标体系”。这种题要你从北极星指标出发,拆分出用户获取、转化、留存、履约、供应等模块的关键指标,并给出各指标之间的逻辑关系。

4.2 高分答题框架:假设驱动+数据验证+落地建议

无论案例题长什么样,我都推荐用“三步法”来组织答案。这套框架我从实际写分析报告的经验里提炼出来,笔试和面试都适用。

第一步,明确问题边界。把题目里模糊的表述转化成可量化的问题。比如“GMV下降了”,你要反问自己:下降的起点是什么时候、对比口径是什么、哪个品类最先异动?在纸上写清楚问题边界,后续回答就不会跑偏。

第二步,分层拆解+假设列表。用MECE原则把问题拆成互斥且穷尽的子项,再针对每个子项给出可能的假设。以GMV下降为例:流量端口(DAU、访问深度)、转化端口(浏览→加购→下单各环节转化率)、客单端口(件单价、连带率)。每个拆分维度下再列出具体假设,比如“首页改版导致入口流量大幅下滑”“某个大促活动结束后用户需求被提前透支”。

第三步,验证方式+落地建议。这一步最体现经验,因为你要说明用什么数据去验证假设。比如“用渠道漏斗日志确认各环节转化率,用分品类日销趋势图定位异动爆发点”。验证完毕后,还要给出可操作的改进建议,而不是停留在“建议优化流量结构”这种空话。例如:“建议次日上线首页核心入口回归A/B测试,同时针对流失最大的品类启动定向促销,预算控制在50万以内,评估周期为7天。”

4.3 结合京东业务特色的回答思路

京东的业务是“零售+物流”一体化的,这意味着数据分析不只盯着前端流量转化,还要关注供应链效率和履约成本。笔试案例题偶尔会涉及“单均履约成本上升如何归因”“库存周转天数异常怎么分析”这类偏供应链的题目。

如果遇到这类题,你要把“采购—仓储—配送—售后”全链路的关键指标串起来。采购端看采购周期和批次规模,仓储端看周转天数和滞销占比,配送端看妥投时长和运力利用率,售后端看退货率和逆向物流成本。带着这个链路去拆解,比你孤立地分析某一环节要全面得多。

即便题目本身是典型的电商前端问题,你在回答最后如果补一句“同时要关注这个指标变动对复购和用户口碑的长期影响”,也能让阅卷人感受到你理解京东“零售+物流”闭环的商业模式,而不只是盯着前台GMV看。

5. 备考策略与常见失分点复盘

5.1 刷题之外,更要练的是“限时决策”

很多人在准备时把重点放在刷题上,但缺少“限时模拟”这个关键环节。京东这份试卷90到120分钟,题目量不小,我第一次模拟时前面的SQL题抠了太久,最后一道案例分析题只写了三行字。后来我调整了策略:先花3分钟通读全卷,评估每道题的时间成本,先做自己最有把握的题,再做需要思考的题,案例题至少留出25分钟。

这个时间分配策略让我多拿了至少15%的分数。笔试不仅是考你会不会,还考你在有限时间内能不能稳定发挥。我建议你在复习后期至少做三次完整限时模拟,每次结束后认真复盘:哪类题耗时超标,哪类题容易卡壳,哪些知识点在紧张状态下就容易空白。

5.2 高频失分点清单

结合试卷反馈和我自己踩过的坑,整理了一份高频失分点清单,对照自查。

失分点具体表现应对方法
SQL口径不清未说明剔除退款/测试订单,留存定义含糊答案开头先写口径假设,再写SQL
统计方法误用小样本用Z检验,无视正态性假设先判断数据类型和样本量,再选检验方法
案例题空谈只列原因不给验证方法,建议不可落地每个假设配一个数据验证方案和量化结论
答题缺乏结构想到哪写到哪,阅卷人抓不住重点按“结论→证据→行动”顺序组织答案
疏于复查计算题单位错误,SQL拼写错误留5分钟检查,重点看单位、日期边界和空值处理

第五点“疏于复查”是很多人最容易忽略的,但它可能是性价比最高的一项。笔试那种高压环境下写出来的代码,多多少少会有小毛病:漏了个逗号、日期没加引号、表名写错。留出几分钟从头扫一遍代码,成本极低,但可能帮你把“会做”变成“得分”。

5.3 从“会做题”到“能拿offer”的最后一公里

笔试只是第一关,它的成绩直接影响你能不能进面试。站在出题人角度想,这份试卷真正想筛选的人,不是SQL写得多华丽的,而是“遇到业务问题时能形成闭环”的人。所谓闭环,就是从问题定义、数据提取、分析方法、结果验证到策略建议,跑完整个链路。

因此我建议你在备考阶段就刻意用“闭环思维”来对待每一道练习题。每次做完一道SQL题,强迫自己再用三句话解释这个查询结果对业务意味着什么;每写一道案例题,逼自己给出数据验证方案而不是堆假设。长期这样练习,你会发现笔试中的主观题越写越顺,因为它们不过是你日常分析工作的小型复刻。

如果你想在案例分析题上再精进一步,可以主动找一些公开的电商数据集练手,比如公开的订单流水数据。用SQL跑出每日GMV趋势,尝试做一次GMV下降归因分析,再把结论写成一页PPT式分析报告。这个过程模拟了笔试案例题从取数到结论的完整链路,也是我个人认为最有价值的备考方式之一。

写在最后:这类试卷考察的核心是一种“数据直觉”

说到底,京东2019春招这份数据分析试卷,和市面上各种“数分笔试100题”最大的区别在于:它不是拼知识储备,而是拼数据直觉。数据直觉不是靠背题背出来的,而是靠你不断用数据去解释真实业务问题、再拿数据结果去检验业务判断的循环来养成的。

根据我个人带新人和当时备考的经验,如果能完整走一遍“SQL取数→统计推断→案例归因→方案落地”这个闭环,你对数据分析岗位的认知会比刷一百道题更扎实。这份试卷最好的用法,不是考前刷一遍找手感,而是把它当作一面镜子——找到自己最薄弱的环节,然后针对性地去补。数据这条路上没有捷径,但你走过的每一个坑,都会变成未来面试和工作中实实在在的竞争力。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/31 15:16:40

改进YOLOv8与DeepSeek微调:智能交通监控与问答系统实战

简介&#xff1a;本资源是一套面向计算机科学与技术专业本科生的智能交通系统综合实践方案&#xff0c;适用于毕业设计、课程设计及AI项目实战学习&#xff0c;聚焦交通场景下的目标检测与自然语言交互双重任务。压缩包共50个文件&#xff0c;含9个核心Python脚本&#xff08;如…

作者头像 李华
网站建设 2026/8/31 15:16:15

16QAM+LDPC+FFT频偏估计:Matlab通信链路仿真与误码率分析

简介&#xff1a;本资源是一套面向通信工程专业高年级本科生及研究生的MATLAB通信系统仿真完整实现&#xff0c;聚焦16QAM软解调、LDPC编译码与FFT频偏估计三大关键技术环节&#xff0c;解决实际无线传输中频偏失步与信道误码联合建模难的问题。压缩包共14个文件&#xff08;9个…

作者头像 李华
网站建设 2026/8/31 15:15:26

HTTP协议基础知识梳理、实现与简单应用

HTTP基础知识 一、网址的构成 1.协议 告诉浏览器用户用什么规则访问。 2.域名 域名通过域名解析转变为ip地址&#xff0c;对于对外提供服务的Web服务器默认使用80&#xff08;HTTP&#xff09;和443&#xff08;HTTPS&#xff09;端口&#xff0c;如果没写端口号&#xff0c…

作者头像 李华
网站建设 2026/8/31 15:15:09

机器学习系统学习路线:从数学基础到实战项目

很多人在学习机器学习时&#xff0c;都会陷入一个相似的困境&#xff1a;收藏夹里存了几十个教程链接&#xff0c;网盘里躺着好几个G的视频资源&#xff0c;今天看一集线性代数&#xff0c;明天刷一个Python语法&#xff0c;后天又去啃一会儿决策树。碎片信息越攒越多&#xff…

作者头像 李华
网站建设 2026/8/31 15:15:00

基于Qt的PID调试上位机:实时曲线与参数整定实战

简介&#xff1a;这是一份面向自动化控制初学者与嵌入式/工业软件开发者的Qt可视化PID调试工具&#xff0c;解决PID参数整定缺乏直观反馈、调试过程依赖命令行或MATLAB的痛点&#xff0c;适用于电机控制、温控系统、机器人姿态调节等典型闭环控制场景。资源共7个文件&#xff0…

作者头像 李华
网站建设 2026/8/31 15:14:32

MATLAB优化算法工具箱核心函数详解与混合优化实战

在实际的工程计算和科研项目中&#xff0c;很多问题最终都会落到同一个数学任务上&#xff1a;在给定资源、成本、工艺等约束条件下&#xff0c;让利润最大、能耗最低&#xff0c;或者让某个系统响应与期望目标之间的误差最小。这类问题在数学上统一称为优化问题。很多新手一开…

作者头像 李华