企业培训做了十年,第一次见到学员主动要求"加课"的AI系统
我在企业培训领域做了十年,从最早的e-learning平台到后来的移动学习,再到这两年的AI辅助培训,几乎每一波技术浪潮都经历过。
但说实话,之前每一波的最终效果都差不多:课程做得再精美,完课率也就30%-40%。学员对着屏幕看视频、做选择题,本质上还是"单向灌输",只是从教室搬到了屏幕上。
直到去年,我给一家制造业企业做了一套基于具身交互智能的内训系统,第一次看到有学员在培训结束后主动说"能不能再多练几轮"。
这篇文章不是教程,更多是从架构师的角度,拆解一下为什么企业培训需要具身交互智能,以及技术上怎么实现。
企业培训的核心痛点不是内容,是交互
做了十年培训,我越来越觉得:企业培训效果差的根本原因不是内容不好,而是交互方式太单一。
传统的培训是"一个人讲、一群人听"。e-learning时代变成了"一段视频、一群人看"。到了移动学习时代,好歹加了碎片化和进度追踪,但交互模式没变——信息从屏幕到人,单向流动。
问题是,很多培训场景需要的是"对话式学习"。比如新员工入职培训,他需要了解公司文化、规章制度、工作流程,这些东西靠看视频效率很低。如果有一个"人"能和他一问一答,根据他的理解程度调整讲解方式,效果会好得多。
再比如销售培训,话术练习需要"对练"。你让新员工看十遍销售话术视频,不如让他和一个"客户"实战对话三轮。
这些场景需要的不是更精美的课件,而是一个能实时对话的交互对象。
技术架构的思考
从架构层面看,企业培训的AI系统需要三层能力:
第一层是知识层。大模型负责理解学员的问题,结合企业知识库生成回答。这一层现在很成熟了,通义千问、DeepSeek、文心一言都能做。
第二层是调度层。Agent负责根据培训场景编排流程——是知识问答、模拟对练还是考核评估?不同场景走不同的流程。
第三层是交互层。这是之前最薄弱的一环。传统的方案要么纯文本(打字交互,体验差),要么预录视频(不能应对开放性问题),要么传统数字人(延迟高、成本高)。
具身交互智能的核心价值,就是补上了第三层。让AI培训系统不仅能"想",还能"说"、能"表达"、能和学员进行自然的面对面对话。
为什么选端侧渲染方案
在企业培训场景,我对比了云端渲染和端侧渲染两种技术路线,最终选了端侧。
原因很实际:
企业培训的终端通常是会议室的大屏或者员工的电脑。这些设备的本地算力完全够用,没必要把渲染任务放到云端去。
端侧渲染的延迟更低。魔珐星云的SDK走的是参数流+端侧解算的路线,端到端延迟约500ms。在模拟对练场景中(比如销售话术练习),学员说完一句话,"客户"几乎立刻就能回应,这个节奏感很重要——延迟一高,对话的自然感就没了。
成本方面,端侧渲染不需要额外的GPU服务器。企业培训系统的使用高峰一般是上午10点和下午3点,如果走云端渲染,峰值时段的算力成本会很高。端侧渲染把这个成本转嫁到了终端设备上,而企业本来就有这些设备。
核心实现
// 企业培训数字人教练 - 星云SDK const sdk = new XmovAvatar({ containerId: "#training-coach", appId: TRAIN_APP_ID, appSecret: TRAIN_APP_SECRET, gatewayServer: "https://nebula-agent.xingyun3d.com/user/v1/ttsa/session", onMessage: (msg) => { if (msg.type === "voice_state_change") { const state = msg.state || msg; if (state === "idle") { // 教练说完一段话,等待学员回应 enableStudentInput(); } } }, proxyWidget: { // 培训PPT展示 "widget_slideshow": (data) => { if (data.url) { const slide = document.getElementById("training-slide"); slide.src = data.url; slide.style.display = "block"; } }, "subtitle_on": (data) => { document.getElementById("coach-subtitle").innerText = data.text; document.getElementById("coach-subtitle").style.display = "block"; return false; }, "subtitle_off": () => { document.getElementById("coach-subtitle").style.display = "none"; return false; } } }); await sdk.init({ onDownloadProgress: (p) => { if (p < 100) updateProgress(p); } });模拟对练的核心逻辑:
// 销售话术模拟对练 async function runRolePlay(scenario) { // 大模型扮演客户 const customerPrompt = `你现在是一个挑剔的客户,场景是:${scenario}。 请根据学员的回应给出真实反应。`; // 数字人教练先介绍规则 const intro = "好,我们现在开始模拟练习。我会扮演客户,你来尝试说服我。准备好了吗?"; sdk.speak(intro, true, true); // 对练循环 while (true) { const studentResponse = await getStudentInput(); // 学员说话 const customerReply = await getLLMResponse(studentResponse, customerPrompt); // 检查对练是否结束 if (checkEndCondition(customerReply)) break; sdk.speak(customerReply, true, true); } // 对练结束,教练给出点评 const feedback = await generateFeedback(conversationHistory); sdk.speak(feedback, true, true); }一些观察
这套系统在某制造业企业的销售培训中试点了三个月。几个有意思的发现:
完课率从之前的35%提升到了78%。当然这个数字有新鲜感因素,但三个月后仍然维持在70%以上。
模拟对练的使用频率最高。学员平均每人做了8轮模拟对话,最多的一个做了23轮。对比之前看视频+做选择题的模式,学员的参与度明显更高。
一个销售主管跟我说:之前新人入职后第一次见客户,基本都会紧张得语无伦次。现在至少和"AI客户"练了好几轮,上场的时候从容多了。
写在最后
企业培训这个领域,技术一直在变,但核心需求没变:让学习者更高效地掌握知识和技能。
大模型解决了AI的理解和推理能力,Agent解决了任务编排能力,而具身交互智能解决的是"让AI成为一个可以面对面交流的伙伴"的能力。这三层合在一起,才让"AI教练"从概念变成了可用的产品。
星云SDK在这个技术栈里扮演的角色很清晰:它不是大模型,不是Agent框架,它是交互层——负责让AI有形象、有声音、有表情,能和学员进行自然的实时对话。
对企业培训感兴趣的朋友,可以去星云官网看看SDK和文档,自己搭一个Demo试试效果。
官网地址:https://xingyun3d.com/?utm_campaign=daily&utm_source=juzhen