一句话讲清楚👉🏻香港科技大学联合多所高校发布智能体协同进化综述:单体智能体的自我进化会撞上固定环境的天花板,让对手、任务、反馈乃至进化规则本身一起进化,才能持续突破。
一个智能体部署上线之后,还能不能继续变强?这个问题在今天的 Agent (智能体)系统里越来越现实:模型在训练时见过的任务有限,落地后要面对新工具、新界面、新需求,靠一次性训练很难覆盖全部情况。于是「自我进化」成了一个热门方向——让智能体在运行中不断从经验里学习,更新自己的记忆、技能甚至模型参数。
但这类自我进化有个隐蔽的瓶颈:它默认环境是不动的。任务池是固定的,反馈规则是固定的,对手或用户的行为也是固定的。一个人对着同一本习题册反复刷题,进步会很快见顶;一个智能体对着同一批任务反复自我改进,能力曲线同样会进入平台期。生物学里有个著名的「红皇后效应」:在共同演化的竞赛里,只有一方拼命跑是不够的,对手和环境也在变,你必须在奔跑中保持相对位置,否则就会停滞甚至落后。论文把这句来自《爱丽丝镜中奇遇记》的寓言用在了智能体系统上:持续进步需要双方共同适应;只改自己这一侧,跑得再快也会被不断变化的环境甩下。
这篇综述(香港科技大学领衔,联合 UIUC 、香港中文大学、香港大学、北京大学)把散落在各方向的文献收拢成一个统一视角:协同进化( co-evolution )。多个智能体以及它们所处的环境,互相给对方施加适应压力,共同变化、互相重塑。它梳理了 2017 年到 2026 年的一百多篇相关工作,并提出一个三阶段递进分类法,回答三个问题:哪些组件在共同进化、进化自由的边界如何一步步扩大、这个过程最终会走向什么形态。
左侧是单体自我进化:任务和反馈被锁死,进步撞上平台期;右侧是多组件协同进化:任务、反馈、交互空间都随智能体一起变化。
先分清:什么才算协同进化
论文先给了两个基础定义。一个智能体系统由智能体集合和它身处的环境组成;每个智能体可以看作两部分组合:骨干模型(模型本身的能力)加 harness (模型外围的持久组件,含记忆、工具、技能、 prompt 、工作流)。智能体进化,意味着骨干模型或 harness 发生了变化。环境则是智能体之外的一切:它要完成的任务、得到的反馈、活动的交互空间。
协同进化的定义比「多个智能体一起干活」要严格。论文强调:多个 Agent 之间互相通信、协作、竞争,只要没有产生持久的更新,就只是普通交互;协同进化要求至少两个进化单元都在改变,而且一方的变化会持续重塑另一方后续的进化条件。用论文的话说,这要求双方互相施加「进化压力」;只是交换信息、没有产生持久改变的协作,不算协同进化。举个最直白的例子:攻击者越进化,防御者就越难防;防御者的新防御又逼攻击者换新招,两边的改变互相锁死对方的下一步。
在这个定义下,论文按「系统被允许进化什么」画了一条递进线,从只进化智能体自己,到连环境一起进化,再到连进化机制本身都可以进化。每一级都卸掉一层人类预先设定的约束。
三阶段递进分类法:进化自由的边界从智能体(蓝色),扩展到智能体+环境(绿色),最终到达进化机制本身(紫色)。
第一阶段: Agent 与 Agent 互相进化
第一阶段的共同点:环境固定,进化发生在智能体集体内部。论文按目标关系把它分成三类。
对抗式协同进化。 双方目标相反,一方的进步直接抬高另一方的难度。这条线最早可以追溯到 GAN :生成器造假图、判别器辨真伪,两者互相逼着对方变强。之后进入强化学习领域:对抗扰动训练让控制策略对真实干扰更鲁棒,格斗游戏和捉迷藏环境里,智能体在对战中学会了用工具和反制策略。到了大语言模型时代,这个思路最典型的应用是安全攻防:攻击者 Agent 生成越狱 prompt (绕过安全限制的提示词),防御者 Agent 学习拒绝,两方互相驱动。 MAGIC 把攻防做成多轮博弈,让攻击方找到单轮攻击发现不了的漏洞; CHASE 不用预设攻击模板,逼防御方对没见过的攻击也保持鲁棒。当对手不止一个时,就进入多源对抗: AlphaStar 的联赛训练是经典例子,主智能体、针对弱点的攻击者、防止遗忘的旧版本智能体在一个联赛里共同进化。
协作式协同进化。 目标一致,一方的改进迫使同伴调整协作方式。基础来自多智能体强化学习( MARL ):多个智能体共享任务奖励,彼此适应对方的变化。 LLM 时代的协作更进一步,常见「生产者-修订者」回路:一个 Agent 出答案,另一个 Agent 挑错修订,两者周期性互换角色保持耦合,批评 Agent 只有在建议真的让同伴下一次回答变好时才获得奖励。有的方法用公共品博弈(模拟「有人出力、有人白拿」的博弈模型)抑制搭便车行为,有的方法维护一份共享的合作提示清单。论文还提到科学家场景:研究员 Agent 和工程师 Agent 各自积累跨任务经验,再通过持久记忆互相受益。
组织级协同进化。 角色和交互结构本身也可以进化。有的方法从行为数据里发现角色,再让角色与策略一起适应;有的方法同时更新智能体的技能和团队结构,执行过程暴露出不匹配时就重组;还有方法把「工作流设计者」和「执行者」两个 Agent 一起训练,让它们互相改进。
第二阶段:环境跟着 Agent 一起变
第一阶段的协同进化能持续改变智能体,但环境仍然是固定的。任务就那些,反馈就那套,智能体遇到的新情况终究有限。第二阶段把进化扩展到环境本身:环境不是铁板一块,任务、打分方式、活动空间都可以跟着智能体一起动,论文就按这三块分别梳理。
任务空间:智能体面对什么问题在变。 一类做法是「选」:任务池不变,但动态调整智能体看到哪些任务。课程学习(像上课一样由易到难安排任务)按学习进度调整采样权重;基于短板差距的方法优先给智能体安排它明显落后于强参考的任务;服务型 Agent 的训练里,模拟用户画像会随着 Agent 变强而变难。另一类做法是「生成」:直接造新任务。工具使用场景里,生成器按求解器的成功率校准难度,把失败的经历改写成新任务;软件工程场景里,从修复过程构造仓库修复任务; RLAnything 更进一步,把任务、策略和奖励模型放在一个动态系统里一起重写。
换个方式打分。 环境不仅决定任务,还决定怎么打分。一类是偏好驱动:奖励模型(给智能体行为打分的模型)从轨迹对比(同一问题不同回答的优劣对照)里学习, DUO 专挑那些不同评分模型打分差异大、行为差别明显的样本,减少人工标注。另一类是结果驱动:根据任务成败反推奖励函数,有的方法共同搜索奖励候选与策略变体,留下表现最好的组合; CURE 让编码 Agent 和单元测试 Agent 互相进化,测试从执行失败中长出新的测试用例。还有工作加一致性约束: ARCO 训练一个逐步打分的评估器,要求每一步的分数加起来等于最终任务结果。
交互空间:智能体在哪里活动在变。 一种路线是构造可执行的世界: POET 同时进化环境和智能体群体; XLand 根据 Agent 的表现调整游戏规则和布局;工具使用场景里, Agent-World 不断扩充工具组合和数据库状态,暴露新的能力缺口。另一种路线是用世界模型(用神经网络模拟环境、让智能体在里面预演)代替真实环境: WebEvolver 同时训练一个网页世界模型和 Agent 策略,用虚拟网页服务器做合成演练和前瞻; EvolvingWorld 让世界模型自己决定跟踪哪些方面,进化出的世界状态反过来塑造角色进化;自动驾驶场景里, LCDrive 把世界模型生成的内部表示与驾驶动作,一起放进「边开边学」的训练循环里优化。
第三阶段:进化机制本身开始进化
前两个阶段里,进化机制都是人设计的:系统能改变自己的内容,但不能改变「自己如何被改变」。第三阶段元协同进化( Meta Co-Evolution )要解决的就是这个问题:让系统自己修订自己的进化机制。
论文把进化机制拆成五个自适应决策:进化什么(骨干模型、 harness 、组织、任务、奖励、世界)、何时进化(失败后、平台期、分布变化时)、怎么进化(训练、修订、生成、结构编辑)、在哪里进化(工具、网页、机器人、沙盒、仿真、真实环境)、如何评价(性能、新颖性、安全、鲁棒性)。元协同进化的判据很严格,翻译成大白话:改进化规则这件事,得由系统自身进化过程中积累的完整历史自主触发,外部脚本或人类定期改写都不算数;而且改完的规则还要反过来改变整个系统的进化环境,形成闭环。
目前真正满足这个判据的工作还很少。大多数相关方法是「单体元进化」前驱:它们都让进化机制可进化,比如 PromptBreeder 进化的是控制未来任务 prompt 如何变化的变异 prompt ,有的方法进化 Agent 自身的自我修改机制,有的进化管理经验复用的记忆架构,有的用历史行为反馈在 harness 更新和权重更新之间做选择,但都缺一个下层协同进化系统。论文认为 RQGM 是目前最接近的实践:它让任务 Agent 和评估者共同进化,元 Agent 把双方的表现汇总成联合反馈,再据此指导后续进化。
论文地图:蓝色轨道是第一阶段( Agent–Agent )的代表工作,绿色轨道是第二阶段( Agent–Environment ),右侧是第三阶段的前驱与元协同进化闭环。
这一层的意义在于通向「无终点进化」( open-endedness ):真正开放的系统应该持续产出有意义的新颖性,不该收敛到某个固定终点。实现它需要两个条件:进化机制本身持续变化,每次修订都产生新的规则;系统的适应能力没有有限上界,理论上可以无限提升。在论文看来,元协同进化超出了第三阶段里其他方法的地位:它是从「在既定规则下适应」走向「自我扩张的智能体系统」的一步。
证据:让对手和环境进化,普遍有效
综述本身没有跑新实验,但论文做了一个跨论文证据汇总:只收录在同一骨干模型、同一评测设置下同时报告「冻结对照」和「进化对照」的论文(冻结指对手和环境保持不变,进化指它们也在变),在每篇论文内部做匹配对比。
A 面板展示了六组受控对比的成绩(每篇论文取各自匹配设置下的均值):把对手、环境或任务从「冻结」换成「进化」之后,六组全部提升,平均相对提升约 8%。需要说明的是,这些分数来自各论文自设的评测指标,彼此不能直接横向比较,真正有意义的是同一篇论文内部的组内差距。其中提升最明显的是 GenEnv ,从 40.8 涨到 45.8 (约 12%);最温和的是 RLAnything ,从 40.7 涨到 43.1 (约 6%); CoVerRL 、 WaltzRL 、 MAGIC 、 SEAL 也各自上涨了 3.4 到 4.4 分。
B 面板把每篇论文做了几组「冻结 vs 进化」对照、平均涨了多少分、几组对照里正向提升占多大比例,都画在一起,阶段一和阶段二的工作都落在正向区域。 C 面板是 8 条归一化性能轨迹(换算到同一尺度后的曲线,来自 Tool-R0 、 Agent0 、 GenEnv 、 Search Self-Play 、 WaltzRL 、 RL Tango 、 CoVerRL 、 CoEvolve ),平均曲线在进化后期明显放缓。这正好呼应论文的判断:阶段一和阶段二能带来普遍提升,但收益在逼近平台期时递减,需要第三阶段打开新的改进方向。
跨论文证据: A 面板六组「冻结 vs 进化」对照全部提升; B 面板按论文统计增益与一致性; C 面板归一化轨迹显示后期收益放缓。
和相邻综述比,这篇的定位差异也很清楚:已有的自我进化综述把协同进化当作一个分支或未来方向;多智能体综述和 harness 综述几乎不设协同进化类别。这篇综述把协同进化作为组织全文的主轴,覆盖智能体、环境、进化机制三个层面,并严格区分「互相适应」与「仅仅交互或交换信息」。
与相邻综述的对比:多数综述把协同进化当作分支、未来方向或散落例子,本文将其作为主线。
没解决的问题:评估、扩展与治理
综述最后列出三组开放问题,都直接关系到协同进化能不能落地。
动态评估。 现有基准大多测量智能体的最终能力。协同进化需要回答更难的问题:所有进化组件是否都在变好、收益能否迁移到没见过的伙伴和环境、每个组件对联合进步贡献了多少。论文特别提醒,任务成功率升高可能掩盖「刷分」:评估器被利用、对固定伙伴过拟合、多样性塌缩(所有智能体最后都变成同一种套路)都是协同进化特有的失败模式。因此评估应该把固定基准和过程级测试结合起来,比如历史交叉对局、组件消融测试(逐个拆掉某个组件,看整体效果掉多少),还要把评估器本身当成被检验对象,防止智能体把打分器「骗」到失灵。
扩展。 现有系统大多研究局部回路:攻防两方、策略与奖励、 Agent 与任务生成。真正的难点在于拿捏分寸:哪些组件该放开进化、哪些该保持稳定,以及各组件的更新如何互相影响,如何让协同压力保持有效又不至于不稳定或被某个组件主导。元协同进化让系统自己做这些决策,算是朝这个方向迈出的一步。
安全与治理。 协同进化越自治,人类越可能失去对系统行为的掌控。进化中的 Agent 可能发展出超出人类理解、难以监控的攻击策略、工具使用模式、通信协议或组织行为;在元协同进化层面,系统甚至可能改变「哪些行为被奖励和保留」。论文提出的治理方向包括沙盒部署、持续监控、回滚到已验证状态、保留人类干预点。但作者也坦承,这些目前停留在愿望层面,没有具体的保障协议。
判断
这篇综述的价值在于把一堆零散现象收进一个可操作的分析框架:任何「持续改进」的智能体系统,都可以问一句:除了自己,还有谁在进化?如果答案是「没有」,那么平台期大概率就在前方。三阶段分类法给出的路线图也足够直白:先让 Agent 之间互相进化,再放开环境,最后放开进化规则本身。需要注意的是,第三阶段目前几乎只有概念和少数前驱工作, RQGM 也只是雏形;把进化机制交给系统自己,同时还要保证可审计、可回滚、可干预,这条路才刚刚开始。作者还维护了一份配套资源清单( Awesome Co-Evolution , github.com/zongqing0068/awesome-co-evolution ),按同一套三阶段框架收录了 142 篇相关论文并持续更新,想顺着这条线深挖的读者可以收藏。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~