为什么神经网络总是预测全0?LeadQualifier 销售线索预测 TensorFlow 实验深度复盘与调优清单
【免费下载链接】LeadQualifier:dart: Qualify sales leads with machine learning项目地址: https://gitcode.com/gh_mirrors/le/LeadQualifier
如果你用 TensorFlow 训练神经网络做二分类,模型却总是预测全 0 或全 1,这篇文章会用一个真实的失败案例帮你定位原因。开源项目LeadQualifier用机器学习为销售线索自动打分(qualified=1 / disqualified=0),其中随机森林和 SGD 线性模型拿到了 F1 0.878~0.905 的不错成绩,但 TensorFlow 神经网络实验版却直接"摆烂"——输出全是 0。作者在 xeneta_qualifier/nn.py 里亲自在代码注释中承认了这个现象。我们逐行复盘,并给出一份可复用的调优清单。
项目速览:一个半成功的销售线索预测器
LeadQualifier 把任务拆成两个可独立运行的模块:
- train_algorithm/run.py:读取自己公司的 Excel 数据(URL + Description 两列),做文本清洗、TF-IDF 向量化,训练模型并保存三个文件(模型、向量化器、TF-IDF 转换器)。
- qualify_leads/run.py:加载训练好的模型,对新线索做批量预测,输出带Prediction列的 Excel 表格。
输入数据长这样:一家公司的网址 + 一段业务描述(如电力公司、兽医服务集团等)。模型要回答的问题是:这家公司值不值得销售跟进?
官方排行榜(见 README.md):
| 算法 | Precision | Recall | F1 |
|---|---|---|---|
| SGD 线性分类器 | 0.872 | 0.940 | 0.905 |
| 随机森林 | 0.845 | 0.915 | 0.878 |
| TensorFlow 神经网络 | — | — | ≈0(预测全 0) |
线性模型和随机森林都跑通了,唯独神经网络翻车——这正是本文的复盘对象。
问题现场:神经网络的输入是 5000 维稀疏向量
先看清楚模型面对的是什么数据(xeneta_qualifier/data/train.csv):
| 数据特征 | 数值 |
|---|---|
| 特征维度 | 5000 维 TF-IDF 向量(代码中硬编码shape=[None, 5000]) |
| 训练 / 测试样本 | 1547 行 / 664 行 |
| 正负样本比 | 约 58% : 42%(基本均衡,不是类别不平衡问题) |
| 稀疏度 | 每行绝大多数元素为 0,只有少量非零值 |
这一点很关键:模型输出全 0 不是数据不平衡导致的,问题出在网络本身和训练方式上。
逐行拆解 nn.py:神经网络预测全 0 的 4 个原因
原因一(最致命):损失函数喂错了参数,双重 Softmax
看 nn.py 的输出层和损失函数:
- 第 61 行:
y = tf.nn.softmax(...)—— 输出层已经做了 softmax,y是概率分布; - 第 68~70 行:
tf.nn.softmax_cross_entropy_with_logits(y, y_)—— 该函数的签名是(logits, labels),第一个参数必须是未经激活的 logits。
把已经平滑过的概率再当 logits 传进去,相当于做了第二次 log-softmax:概率本身在 (0,1) 区间,log 之后梯度极小,网络几乎收不到有效的学习信号,输出就停在了初始化附近的"常数区"——表现为全部预测同一类。
原因二:5000 维输入配 0.5 的学习率,梯度直接爆炸
nn.py 中优化器配置为GradientDescentOptimizer(0.5)。输入维度高达 5000,每个参数的梯度是对 5000 个维度的求和,梯度尺度天然很大;0.5 的学习率会让权重在训练初期大幅震荡甚至发散,网络同样容易卡死在"恒定输出"状态。常见做法是 0.01~0.001 起步,或直接用 Adam。
原因三:固定 0.1 偏置 + 稀疏输入 = 隐层饱和
nn.py 把所有偏置初始化为常数 0.1,而输入向量绝大部分是 0。于是隐层输入W·x + 0.1对绝大多数神经元近似等于常数 0.1,经过 sigmoid 后输出也近似常数——整个隐层退化成"常数函数",无论输入什么公司描述,两层 500 个神经元给出的都是同一组激活值,最终输出自然全 0 或全 1。
原因四:Accuracy 会骗人,全 0 模型也有 40% "准确率"
nn.py 用argmax比较来算 accuracy。测试集中负样本占 265/664 ≈ 40%,一个"无脑全 0"的模型就能拿到约 40% 的 accuracy,看起来似乎"还行",实际上完全不可用。评估二分类时必须看Precision / Recall / F1(参考 xeneta_qualifier/run.py 里用precision_recall_fscore_support的做法),才能一眼识破这种"假象"。
下面是正常工作时的预测输出对照——每一行都有合理的 0/1 判断:
调优清单:神经网络预测全 0 的 8 项排查步骤
拿到这份清单后,你可以按顺序逐项排查自己的模型:
- 核对损失函数参数:
softmax_cross_entropy_with_logits的第二个参数(labels)是否真的是 one-hot 标签、第一个参数(logits)是否误传了 softmax 后的概率。 - 消灭双重激活:输出层若已接 softmax,损失函数就不能再套 softmax 变体,反之亦然。
- 调低学习率:高维输入(上千维)从 0.01 或 0.001 起步,或直接换 Adam。
- 换初始化方案:偏置初始化为 0,权重用 He/ Xavier 初始化,避免隐层饱和。
- 打印中间状态:训练几步后检查隐层激活和梯度幅度,是否接近常数或梯度消失。
- 警惕 Accuracy 假象:同时监控 Precision/Recall/F1,与"永远预测多数类"的基线对比。
- 先跑线性基线:本项目的 SGD 基线 F1 已高达 0.905,神经网络打不赢基线就没有上线价值(基线代码见 xeneta_qualifier/run.py)。
- 检查数据读取:核对维度、标签对齐、batch 切片边界(nn.py 中
randrange(0, 1447)是写死的魔法数字,换数据就会越界)。
相关文件路径速查
| 文件 | 用途 |
|---|---|
| xeneta_qualifier/nn.py | TensorFlow 神经网络实验(本次复盘主角) |
| xeneta_qualifier/run.py | 随机森林 / SGD 基线模型 |
| xeneta_qualifier/data/train.csv | 官方训练数据(5000 维向量) |
| train_algorithm/run.py | 用自有 Excel 数据训练自己的模型 |
| qualify_leads/run.py | 对销售线索批量预测并输出 Excel |
| qualify_leads/output/predictions.xls | 预测结果示例文件 |
结语
这次复盘的结论可以总结为一句话:神经网络预测全 0,通常不是"模型能力不够",而是"接线错了"——损失函数误用、学习率过大、隐层饱和这三个"管道问题",比任何高级技巧都更优先需要排查。对照上面的 8 项清单逐个排除,再和线性基线(F1 0.905)对比,你的神经网络就有机会真正打平甚至超越它。
【免费下载链接】LeadQualifier:dart: Qualify sales leads with machine learning项目地址: https://gitcode.com/gh_mirrors/le/LeadQualifier
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考