羽山数智本地AI大脑解决方案 · 系列教程第 1/6篇
适合人群:架构师 / AI 工程师 / 企业技术负责人 / 对私有化大模型感兴趣的开发者
全系列 6 篇,手把手从 0 搭建一个可离线运行、可审计、可私有化部署的本地 AI 大脑。
一、先讲清楚:我们为什么要"造轮子"?
2026 年,大模型 API 已经非常成熟:DeepSeek、GPT、Claude……调用一个接口就能得到不错的回答。但真正落到企业生产环境,你会发现四条绕不过去的硬约束:
约束 | API 方案的痛点 |
数据主权 | 核电、金融、工程设计文档直接发给云端 API,合规上就是事故 |
网络依赖 | 断网、内网隔离环境(核电 DCS 机房)里,云端大脑直接失明 |
成本失控 | 高频查询 × 长上下文,月度账单像滚雪球 |
不可审计 | 云端黑盒,回答没有证据链,工程事故追责时拿不出推理过程 |
所以「羽山数智」的立项初衷只有一句话:
造一个跑在自己机房里的、确定性的、每一步都可审计的本地AI大脑。
它不是要取代大模型——而是要做一个大模型之外的确定性推理引擎,专攻工业场景:核电、金融、工程、化工。这些场景要的不是"聪明",是可复现:同一个问题,今天答和明天答必须一样;每一个答案,都必须能追到知识来源和推理步骤。
二、总体设计:三层架构,一次说清
图:羽山数智本地AI大脑系统架构(v4.6,GENEPOOL 实时数据)
羽山数智的本地AI大脑的整个系统(当前版本 v0.23,代码约 85 个 Python 模块)可以压缩成一张图:
用户输入 + 会话上下文
│
▼
┌─────────────────────────────────────────────┐
│ Thalamus 丘脑(意图分类层) │
│ 6 意图: FACT知识 / TOOL工具 / FORMULA公式 │
│ REASON推理 / DATA数据 / MODEL模型 │
│ 正则快速路由 + 语义相似度回退 │
└─────────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────┐
│ Dispatcher 调度器 → 5 根皮层柱(独立超时+降级) │
│ ├─ FactColumn 知识检索柱 │
│ ├─ ToolColumn 工具计算柱 │
│ ├─ FormulaColumn 公式引擎柱 │
│ ├─ ReasonColumn 推理组合柱 │
│ └─ ModelColumn 本地模型调度柱(可选) │
└─────────────────────────────────────────────┘
│
▼
┌─────────────────────────────────────────────┐
│ 知识基因库 GENEPOOL(长期记忆) │
│ 13,743 条知识 · 49 个领域 · Git 版本控制 │
│ BM25 稀疏 → Dense 语义 → Reranker 多特征重排 │
└─────────────────────────────────────────────┘
│
▼
输出:答案 + 置信度 + CoT 思维链追踪(可审计)
架构上就三个词:分层、路由、降级。
1. 分层:知识(JSON)与推理(代码)彻底分离
这是羽山数智的本地AI大脑最核心的一条设计原则,也是和"大模型用参数存知识"最本质的区别:
- 知识 = 数据:存在learned.json里,13,743 条结构化知识条目,每一条都是纯 JSON,可以增删改查、可以 diff、可以回滚。
- 推理 = 代码:意图识别、检索排序、推理组合、公式计算全部是确定的 Python 代码。
好处是爆炸性的:知识错了改 JSON,推理错了改代码,互不污染。大模型的知识和权重纠缠在一起,改一条知识要重新训练;羽山数智改一条知识只需要一次文件写入。
2. 路由:Thalamus 意图分类 + Dispatcher 五柱调度
模拟人脑结构:丘脑(Thalamus)是感觉信息的中继站,负责把输入分类;大脑皮层分成不同的功能柱(Column),各司其职。羽山数智照搬了这个结构:
- Thalamus:识别用户意图——是查知识(FACT)、算公式(FORMULA)、还是做推理(REASON)?先走正则快速匹配(毫秒级),匹配置信度低时自动降级到 TF-IDF 语义相似度分类。
- Dispatcher:根据意图把请求路由到对应的皮层柱。5 根柱各自独立超时、独立降级,一根柱子挂了不影响其他四根。
3. 降级:永远不裸奔
羽山数智的本地AI大脑每一层都有兜底:
主路径失败 → 神经核 4 核推理链(PFC→ACC→BG→DMN)
→ GENEPOOL jieba 关键词兜底
→ 结构化 GAP 响应(告诉用户"知识库暂未覆盖",而不是胡说)
宁可诚实地说"不知道",也绝不编造答案——这是工业级大脑的底线。
三、关键设计决策:我们踩过的 5 个"坑"
坑 1:知识库安全阀(数据不能越修越少)
知识注入脚本跑挂一次,可能把 14,000 条知识截断成 2 条。我们上了三层保护:
# brain/genepool_safe.py — 三层保护
# 1. 绝对最小值: 少于 100 条拒写
# 2. 比例检查: 写入后 < 写入前 × 95% 拒写
# 3. 文件锁: fcntl.LOCK_EX 防并发写
# 4. 自动恢复: 加载时发现文件 < 100KB → 从最新备份恢复
坑 2:路由劫持(Gradio 曾吃掉所有 API 路由)
早期用 Gradio 挂 WebUI,mount_gradio_app("/")会把所有/api/*POST 请求全部拦截,返回 422。最终方案是彻底移除 Gradio,换成FastAPI + Jinja2 + htmx单端口架构,WebUI 与 API 共存于:8765。
坑 3:CDN 不可达(内网环境连 htmx 都加载不出来)
把 htmx、Tailwind、Three.js、OrbitControls 全部下载到本地web/static/js/,零外部依赖。现在整个系统拔掉网线也能完整运行——这本身就是"本地大脑"的合格证。
坑 4:检索不准(BM25 答非所问)
单靠 BM25 稀疏检索,语义相近的知识召回不了。升级为FactColumn v2 四阶段管线:
Phase 1: BM25 稀疏召回(Top-50 候选)
Phase 2: Dense 语义检索(自建 TF-IDF→PPMI→SVD 向量引擎)
Phase 3: Reranker 多特征重排
(BM25×0.25 + Embedding×0.30 + 领域×0.15 + Schema×0.15 + 角色×0.15)
Phase 4: BM25 兜底(语义分过低时回退)
坑 5:死代码悬空(写了 500 行没人调用的"大脑")
架构审计发现:一条 500 行的脑核推理管线因 stub 占位从未被调用,4 个神经核(ACC/BG/DMN)在主路径上完全悬空。修复后,Dispatcher 失败时自动降级到神经核推理链,ACC 冲突检测注入主路径——每次返回结果前都做一次质量验证。
四、技术栈总览(全是你能复刻的)
层 | 选型 | 说明 |
语言 | Python 3.11 | 生态成熟,推理代码可读性优先 |
API | FastAPI | 单端口 8765,REST + OpenAI 兼容/v1双协议 |
WebUI | Jinja2 + htmx 2.0 | 12 个页面,29 个 htmx 局部刷新端点,无前端构建链 |
存储 | JSON + SQLite | 知识库 JSON(可 diff),会话/任务/账号 SQLite |
检索 | BM25 + 自建向量引擎 | 纯 Python 实现,零外部依赖,无向量数据库 |
公式 | 自研 YFC 公式核心 | 单位系统 + DAG 公式链 + 符号求导 + ODE/PDE 求解器 |
部署 | Docker / Gunicorn / launchd | 单机可跑,多 Worker 可扩 |
外部接入 | MCP / Python SDK / OpenAI 兼容 | 上层 Agent 直接调用 |
成本账:整套系统跑在一台 M2 Pro / 16GB 的 Mac mini 上,零 API 费用(除知识注入期的 DeepSeek 精写,约 ¥0.00016/条),月成本 = 电费。
五、系列预告
- 第 2 篇:知识基因库 GENEPOOL——大脑的长期记忆是怎么建起来的(知识注入、检索、安全保护)
- 第 3 篇:认知管线——Thalamus 意图识别与五柱调度,大脑是怎么"想"的
- 第 4 篇:会算也能做——公式引擎与工具生态,大脑的"双手"
- 第 5 篇:仿生增强与工程化落地——从"能用"到"能上线"
- 总结篇:羽山数智全景路线图——从 0 搭建本地大脑的完整方法论与踩坑清单
📌关于羽山数据
面向企业数智化转型需求,羽山数据通过数据产品、智能体应用、场景化 Demo、PoC 验证与 FDE 项目制交付,帮助客户把数据真正转化为可分析、可执行、可审计、可落地的业务能力。在 AI 编程工具应用领域,羽山强调“人机协同”的工程实践:AI 负责加速可标准化部分,人负责架构判断、代码审查和质量把控,确保 AI 提升的是团队真实的交付能力,而不只是代码提交量。
● 商务合作:孟经理
● Email:mengfanhui@yushanshuju.com
● 公司官网:www.usendata.com/
● 地址:上海市虹口区飞虹路 118 号
© 2026 羽山数据 | 转载请注明出处
*羽山数智 · 本地大脑解决方案:数据不出机房,推理全可审计。*
*下一篇:知识基因库 GENEPOOL——大脑的长期记忆是怎么建起来的。*