AI4AI at Scale:有界探索框架下的智能体系统规模化优化
论文重点
本文提出了一种名为AI4AI的有界探索(bounded-exploration)、验证门控(verification-gated)框架,用于系统性地提升大语言模型的智能体(Agentic)能力。研究团队基于 Qwen3.6-35B-A3B 和 Qwen3.5-397B-A17B 构建了 XYZ-Aquila-mini 和 XYZ-Aquila-pro 两个 Deep Search 智能体,在 BrowseComp、BrowseComp-ZH、LiveBrowseComp、WideSearch 等多个基准测试中取得了同参数量级下的最优成绩。
核心研究内容
问题定义
提升 LLM 的智能体能力是一项复杂的系统工程。一个 capable 的智能体需要具备长程规划、工具调用、证据核查、故障恢复、约束遵循等多维能力,而这些能力并非仅由模型 checkpoint 决定,而是从模型选择、数据构建、后训练策略、工具接口、验证器设计、上下文管理、基础设施等耦合组件的交互中涌现。传统方法中,孤立地优化单一组件往往带来脆弱的收益、隐蔽的性能退化,或无法迁移到开发环境之外。更关键的是,让当前的 LLM 智能体自主完成端到端的系统优化仍然远超其可靠能力范围——搜索空间巨大、组件间交互微妙,而 naive 的自动化可能掩盖变更的真正原因、过拟合于可用反馈、或模糊不安全决策的责任归属。
创新方法
论文的核心创新在于提出了一个有界探索的 AI4AI 优化机制,其关键设计包括:
人类定义优化契约:人类设定目标能力、私有代理基准、资源与工具范围、风险边界和接受标准,形成一个版本化的契约 H(νt)。
四阶段循环:AI 智能体在契约约束下执行研究(Research)→ 开发(Development)→ 评审(Review)→ 记录(Record)的迭代循环。
隔离评估器与验收门控:独立的评估器 E_gate 返回指标和诊断信号,但绝不暴露答案键或私有标签;验收策略 G 根据证据决定采纳或拒绝。
共享经验记忆:无论采纳还是拒绝的尝试,都被完整记录在持久化的共享记忆 F_t 中,包含溯源信息、适用条件、置信度等,使后续循环能够避免重复失败、复用成功经验。
人机协作:人类通过契约和例外评审行使权威,AI 负责具体运营工作,而非要求人类审批每一个底层步骤。
研究成果
XYZ-Aquila 系列在多个权威智能体基准测试中表现优异:
| 基准 | XYZ-Aquila-mini (<40B) | XYZ-Aquila-pro (<400B) |
|---|---|---|
| BrowseComp | 78.8%(同級第1) | 84.8%(同級第1) |
| BrowseComp-ZH | 82.9%(同級第1) | 85.1%(同級第1) |
| LiveBrowseComp | 48.7%(同級第1) | 53.7%(同級第1) |
| WideSearch | 80.8%(同級第1) | 81.2%(同級第1) |
| DeepSearchQA | 89.5%(同級第1) | 92.5%(同級第2) |
| Humanity’s Last Exam | 51.1%(同級第1) | 53.3%(同級第1) |
XYZ-Aquila-pro 在 BrowseComp-ZH、LiveBrowseComp 和 WideSearch 上更是刷新了所有公开系统的最高记录(包括超过 1T 参数的闭源模型)。
实际落地应用的可能性
该框架具有广泛的适用性——论文明确指出,AI4AI 的优化机制不仅限于 Deep Search,而是可以推广到任何复杂的 AI 系统开发场景。具体应用场景包括:
- LLM 后训练流水线优化:自动诊断 SFT/RL/DPO 策略的缺陷并迭代改进
- RAG 系统调优:优化检索策略、上下文窗口、工具调用配置
- 软件工程智能体:辅助代码生成、测试、调试的迭代优化
- 科研自动化:类似 AI Scientist 的思路,但增加了有界约束和审计能力
技术细节
优化契约的形式化定义
论文将智能体系统形式化为一个配置 θ,涵盖模型、学习过程、策略、工具、数据、评估和基础设施七个维度:
θ∈Θ,Θ⊆Θmodel×Θlearn×Θpolicy×Θtool×Θdata×Θdev-eval×Θinfra \theta \in \Theta, \quad \Theta \subseteq \Theta_{\text{model}} \times \Theta_{\text{learn}} \times \Theta_{\text{policy}} \times \Theta_{\text{tool}} \times \Theta_{\text{data}} \times \Theta_{\text{dev-eval}} \times \Theta_{\text{infra}}θ∈Θ,Θ⊆Θmodel×Θlearn×Θpolicy×Θtool×Θdata×Θdev-eval×Θinfra
人类定义的版本化优化契约为:
H(νt)=⟨J,Bpriv,Egate,CH,G,Bcycle,τstop⟩ H(\nu_t) = \langle J, B_{\text{priv}}, E_{\text{gate}}, C_H, G, B_{\text{cycle}}, \tau_{\text{stop}} \rangleH(νt)=⟨J,Bpriv,Egate,CH,G,Bcycle,τstop⟩
其中 J 为目标能力,B_priv 为私有代理基准,E_gate 为隔离评估器,C_H 为可容许性谓词,G 为版本化验收策略,B_cycle 为每周期资源预算,τ_stop 为停止条件。
四阶段循环的核心公式
研究阶段:Research 模块诊断当前系统并提出可容许的干预方案:
(at,u^t,rt)=Rϕ(θt,Ft,ht;H(νt)),at∈AH(θt),c(at)≤Bcycle (a_t, \hat{u}_t, r_t) = R_\phi(\theta_t, F_t, h_t; H(\nu_t)), \quad a_t \in A_H(\theta_t), \quad c(a_t) \leq B_{\text{cycle}}(at,u^t,rt)=Rϕ(θt,Ft,ht;H(νt)),at∈AH(θt),c(at)≤Bcycle
开发阶段:实施干预,生成候选系统:
θ~t=f(θt,at),CH(θ~t)=1 \tilde{\theta}_t = f(\theta_t, a_t), \quad C_H(\tilde{\theta}_t) = 1θ~t=f(θt,at),CH(θ~t)=1
评审阶段:隔离评估器生成证据包:
zt=Egate(Aθ~t;Bpriv) z_t = E_{\text{gate}}(A_{\tilde{\theta}_t}; B_{\text{priv}})zt=Egate(Aθ~t;Bpriv)
dt=G(zt,ztref,at;H(νt))∈{accept,reject,escalate} d_t = G(z_t, z^{\text{ref}}_t, a_t; H(\nu_t)) \in \{\text{accept}, \text{reject}, \text{escalate}\}dt=G(zt,ztref,at;H(νt))∈{accept,reject,escalate}
记录阶段:完整记录周期证据并更新共享记忆:
et=⟨θt,at,θ~t,zt,dt,rt,νt,vt⟩,Ft+1=Update(Ft,et) e_t = \langle \theta_t, a_t, \tilde{\theta}_t, z_t, d_t, r_t, \nu_t, v_t \rangle, \quad F_{t+1} = \text{Update}(F_t, e_t)et=⟨θt,at,θ~t,zt,dt,rt,νt,vt⟩,Ft+1=Update(Ft,et)
有界性的五重约束
论文明确了“有界”并非指搜索空间小,而是指受约束的权限、证据访问和资源使用:
- 范围边界:仅允许修改指定的设计面和干预类别
- 权限边界:仅允许使用授权的数据源、工具、模型和基础设施
- 评估边界:隐藏标签、答案键和外部基准对优化器不可见
- 资源边界:每周期受计算、时间、rollout 和评估预算限制
- 权限边界:高风险、模糊或超出契约的案例必须被拒绝或升级
研究设定
硬件与软件配置
论文中 XYZ-Aquila 系列基于以下配置构建:
| 组件 | XYZ-Aquila-mini | XYZ-Aquila-pro |
|---|---|---|
| 基座模型 | Qwen3.6-35B-A3B | Qwen3.5-397B-A17B |
| 参数量级 | < 40B | < 400B |
| 架构 | MoE(混合专家) | MoE(混合专家) |
系统设计亮点
图 grounding + 工具可达的任务构建:智能体基于图结构进行任务规划和证据获取。
状态保真的 SFT:监督微调保持状态一致性。
固定三工具执行契约:明确的上下文策略和精确回放状态。
外部评估隔离:外部基准不参与常规优化循环,仅用于最终或明确授权的评估。
低成本筛选机制:对昂贵的干预类别(如 RL),先进行低成本试点验证,通过后才投入完整训练和评估预算。
开源资源
团队已公开模型权重、评估代码、训练细节、代表性轨迹和版本化干预记录:
- ModelScope: https://www.modelscope.cn/models/XYZAILab
- Hugging Face: https://huggingface.co/XYZAILab
- GitHub: https://github.com/XYZ-AI-Lab
综合分析
理论贡献
本文的核心理论贡献在于将 AI 系统优化从“黑箱调参”转变为“可审计、可复现的治理流程”。传统 AutoML 或超参数优化往往只关注单一维度的数值优化,而 AI4AI 框架将优化对象扩展到了整个系统设计空间——从模型、数据、训练策略到工具和基础设施——并引入了人类定义的契约作为“宪法”来约束 AI 的探索行为。
这种方法论上的转变具有深远的学术意义。论文明确指出,智能体能力是完整系统的涌现属性,而非孤立模型 checkpoint 的属性。这一观点挑战了当前以模型为中心的主流评估范式,为 Agentic AI 的评估和优化提供了新的理论框架。
实践价值
从实践角度看,AI4AI 框架解决了三个核心痛点:
可解释性:每一次干预都被完整记录,包括被拒绝的尝试及其失败原因。这使得优化过程不再是“炼丹”,而是可追溯的工程过程。
防止过拟合:通过隐藏私有标签、隔离外部基准、限制每周期评估次数等措施,有效防止了对开发集的过度适应。
人机协同的平衡:框架既不过度依赖人类手动调参(低效),也不完全放任 AI 自主优化(危险),而是通过契约、门控和例外升级实现了可控的自动化。
局限性与未来方向
论文也坦诚指出了若干局限性:
- 基准对比基于异构的公开报告,不同系统的评估工具、裁判、时间点可能存在差异,并非严格受控的总序比较。
- 框架的有效性目前仅在 Deep Search 场景中得到验证,推广到其他类型的 AI 系统(如多模态、具身智能)仍需进一步研究。
- 有界探索的设计虽然增强了安全性,但也可能限制了某些“跳出框架”的创新发现。
实践应用
对研究者的建议
从小规模开始:如果希望在自己的项目中引入 AI4AI 框架,建议先从单一优化面(如仅优化 SFT 数据或仅优化工具调用策略)开始,逐步扩展到多维度联合优化。
重视“失败记录”:论文中最具启发性的设计之一是对被拒绝的尝试也进行完整记录。在实际应用中,建立“失败案例库”往往比只记录成功经验更有价值——它帮助后续优化避免重复踩坑。
谨慎设计契约:优化契约中的风险边界和验收标准是框架安全性的基石。建议在初期设置较严格的约束,随着对系统的理解加深再逐步放宽。
对工程团队的启示
构建共享经验记忆:AI4AI 的 Shared Experience Memory 本质上是团队知识的数字化沉淀。工程团队可以借鉴这一思路,将每一次实验(无论成败)的上下文、配置、结果和人工评审意见结构化存储,形成组织的“集体智能”。
分离评估与优化:论文中“隔离评估器”的设计提醒我们,在 AI 系统开发中应严格区分用于指导优化的信号和用于最终评估的信号——前者可以频繁使用,后者应谨慎保留。
低成本筛选先行:对于计算成本高昂的干预方案(如大规模 RL 训练),先进行低成本试点验证是明智的工程实践。
参考资料
- 原始论文:https://xyz-lab.ai/blogs/ai4ai-at-scale/assets/bounded-exploration-ai4ai-system-optimization.pdf
- 模型(ModelScope):https://www.modelscope.cn/models/XYZAILab
- 模型(Hugging Face):https://huggingface.co/XYZAILab
- 数据集(ModelScope):https://www.modelscope.cn/datasets/XYZAILab
- 代码仓库:https://github.com/XYZ-AI-Lab