news 2026/8/22 5:14:00

一台内网 GPU 全科室共用:Ollama 校对引擎部署记

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
一台内网 GPU 全科室共用:Ollama 校对引擎部署记

科室八个人都要用 AI 校对,但机器是涉密内网,外网一个包都进不来;全科室只有一台机器有 GPU。这是上个月我接到的活。最后落地方案:那台 GPU 机器跑 Ollama 当推理底座,全科室共用,所有人 WPS 里的察元AI文档助手都指向它——文档和模型全程不出内网。这篇把部署过程按步骤记下来。

为什么选 Ollama 当底座

察元的模型配置支持任意 OpenAI 兼容端点:Ollama、LM Studio、Xinference、OneAPI 都行。选 Ollama 是因为部署最省事、社区包最多,配上 Qwen、DeepSeek 这些国产开源模型,校对和润色的活够用。这两年国产模型本地部署的热度一直没降,内网场景里它不是选择题,是唯一解。

第一步:GPU 机器装 Ollama,拉模型

内网装包走离线安装,这里不展开。模型提前在外网用好机器拉好,摆渡进内网后导入,或者直接在 GPU 机器上执行:

ollama pull qwen2.5:7b

显存够就上更大的模型,校对任务对推理要求不高,7b 级别是性价比起点。拉完用ollama list确认模型都在,免得端点配好了才发现模型名拼错——离线环境里排查这种低级错误格外烦人。

第二步:让 Ollama 监听内网地址

Ollama 默认只听本机回环,全科室共用必须改成监听所有网卡:

OLLAMA_HOST=0.0.0.0 ollama serve

改完在内网另一台机器上 curl 一下这个端口,通了才算数。别忘了在内网防火墙上给这台机器放行对应端口,这一步漏了能排查一下午。

第三步:各客户端配置察元的模型端点

每台机器上的察元加载项里,把模型端点指向http://GPU机器内网IP:11434——Ollama 的默认端口,协议本来就是 OpenAI 兼容,察元直接认。科室级更彻底的做法是上服务版(Docker 网络版),全科室共用一套服务,管理起来比逐台配省心。逐台配置的小团队注意统一写法:地址、端口、模型名三样做成一张卡片发群里,谁配错了照着抄。别低估这件事——八台机器八种写法,排查的时候够喝一壶。

第四步:两跳各验一次,再收工

验证别只验一半。先验文档工具链:

curlhttp://127.0.0.1:62588/healthz

返回online说明本机 sidecar 正常。再验推理链路,让任何一台客户端跑一遍校对 dryRun:

先跑一遍校对(dryRun),汇总问题列表,不要先改正文;我确认后再写成批注

如果这一步报MODEL_NOT_CONFIGURED,说明端点没配对——回第三步查三件事:地址写没写对、端口通没通、防火墙放没放行。清一色的低级错误,但占了部署问题的九成。还有一类隐蔽问题:端点通了但模型名对不上,报错不一定直观。让科室里最先跑通的那台机器当模板,其余照抄配置,是最笨也最稳的推广路径。

部署后的账

八个人共用一块 GPU,白天高峰期推理排队几乎无感;所有文档处理、模型推理都在内网完成,一个字节不出域,安全科那边一次验收通过。后续运维也省心:模型升级只动 GPU 机器一台,八台客户端无感知;真要换推理底座——比如多模型并存的场景换 Xinference——客户端只改端点地址,其他一律不动。唯一的代价是模型能力天花板摆在那儿,复杂改写不如云端大模型——但内网场景里,"能用且合规"的优先级永远排在"效果拔群"前面。

边界照例讲清楚:本地模型做校对建议,最终采纳要人工过目;密级标识、涉军涉装这类敏感判断,工具提示只能当参考,定密必须走人工流程。另外内网部署前记得照例走单位审批,合规动作一个不能省。还有条经验:先拿非涉密的日常材料试跑一周,把误报率摸清楚再正式上量,科室里对工具的信任,是一次一次靠谱攒出来的。一台 GPU 撬动一个科室的 AI 校对,这事在 2026 年已经不算稀奇,稀奇的是有人还在把文档往外网传。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/22 5:12:24

IEEE 754浮点数运算:加法与乘法的性质、误差与工程实践

你有没有遇到过这样的场景:写了一段看似简单的数值计算代码,比如0.1 0.2,结果打印出来不是0.3,而是0.30000000000000004?或者,在一个循环里累加一个很小的浮点数,期望得到一个精确的总和&#…

作者头像 李华
网站建设 2026/8/22 5:09:05

Java全栈面试核心技巧与高频考点解析

1. 面试全貌与核心考察维度作为经历过数十场Java全栈面试的"老油条",我发现大多数候选人失败的原因不是技术不行,而是对面试的认知存在偏差。面试官真正在意的,往往不是你能背出多少概念,而是你如何将知识串联成体系。去…

作者头像 李华
网站建设 2026/8/22 5:00:35

AI简历优化工具:职照优的核心功能与使用体验

1. 项目概述"灵猫简历模块"(官网称之为"职照优")是一款面向求职者的智能简历优化工具。作为一位长期关注人力资源科技产品的从业者,我最近对这个产品进行了深度测试和评估。不同于市面上普通的简历模板工具,它…

作者头像 李华
网站建设 2026/8/22 5:00:20

PyTorch深度学习入门:从环境搭建到Logistic回归模型实战

1. 项目概述:从“Hello World”到第一个模型 对于任何想踏入深度学习领域的朋友来说,PyTorch 几乎是一个绕不开的名字。它以其直观的动态计算图和 Python 式的编程风格,成为了学术界和工业界许多研究者和工程师的首选工具。但当你第一次打开…

作者头像 李华
网站建设 2026/8/22 4:59:21

Java面试高频考点解析与避坑指南

1. 项目背景与核心价值 最近整理电脑文件时翻到三年前的一段面试录音,当时作为某大厂技术面试官与候选人"谢飞机"的对话实在令人印象深刻。这段长达90分钟的录音完美呈现了技术面试中的经典场景:一个准备不足的候选人与坚持技术底线的面试官之…

作者头像 李华