news 2026/8/12 15:20:16

32 个软件应用、604 个工具,最强模型也只做对 38.6%——ICLR 2026 的 Toolathlon 揭了 Agent 评测的短

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
32 个软件应用、604 个工具,最强模型也只做对 38.6%——ICLR 2026 的 Toolathlon 揭了 Agent 评测的短

系列第 7 篇 · 子领域:评测 / Evaluation

【来源信息】 - 类型:顶会论文 - 标题:The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution(Toolathlon) - 作者/机构:未具名通讯作者团队(基于 MCP 服务器构建) - 出处:ICLR 2026 · arXiv:2510.25726 - 原文:https://zhaoyang97.github.io/Paper-Notes/ICLR2026/llm_agent/the_tool_decathlon_benchmarking_language_agents_for_diverse_realistic_and_long-h/ - 本文性质:论文解读(非原创研究),关键结论以原文为准

一句话结论

现有 Agent 榜单多用「玩具级」单步任务,分数虚高;ICLR 2026 的 Toolathlon 用 32 个真实软件应用、604 个工具、108 个长程任务,把最强模型 Claude 按在地上摩擦——成功率只有 38.6%。榜单测不出的差距,才是真实差距。

背景与痛点

语言 Agent 要在真实世界干跨应用、多步骤的活:管日历联动邮件、监控数据库出报告。这要求工具发现、多轮推理、状态追踪、跨系统协调一起上。

但现有 Agent 基准三大硬伤:

  • 领域窄:聚焦单一工具或 API;
  • 任务假:一两步调用就完事;
  • 环境假:用空白或极简初始状态,不是真实软件里的复杂数据。

结果:Agent 在简单榜上分数漂亮,真实场景频繁翻车,分数和实际能力严重脱节。

核心方法(讲人话)

Toolathlon 是第一个同时满足四个维度的 Agent 综合基准:

  1. 多样应用覆盖:32 个软件应用、604 个工具;
  2. 真实环境状态:不是空壳,而是带真实复杂数据的初始状态;
  3. 长程复杂任务:平均约 20 轮工具调用;
  4. 执行式验证:不靠 LLM 裁判或字符串匹配,而是基于程序执行做确定性判定。

它基于 Model Context Protocol(MCP)构建工具层,部分由团队自研或修订,保证接口质量和一致性。

实验与数字

  • 108 个任务,604 个工具,32 个应用;平均约20 轮工具调用。
  • 最强模型Claude-4.5-Sonnet 成功率仅 38.6%——这就是真实长程 Agent 能力的天花板。
  • 执行式验证确保每个任务完成与否有确定性判定,杜绝 LLM 打分的主观误差。

为什么重要

反直觉点:我们以为 Agent 已经很强,是因为榜单太温柔。当任务变成「真实软件 + 长链路 + 多应用协调」,连顶尖模型都不到四成。

这对工程的直接意义:别再拿单步工具调用榜当 KPI。你要测的是「在带真实数据的环境里,跑 20 轮还不丢状态」的能力——这才是上线后用户真正会遇到的。

复现 / 落地思路

  • 论文基于 MCP 服务器,可自行搭建类似执行式评测:用确定性校验脚本替代 LLM 裁判;
  • 给你自己的 Agent 加一类「长程多工具」回归测试,初始状态灌入真实数据;
  • 参考 Toolathlon 的维度,给你的 Agent 打分卡补上「环境真实性」和「轮次长度」两栏。

今日可做的 3 件事

  1. 把你现用的 Agent 评测从「单步准确率」升级成「执行式 + 长程 + 真实状态」三件套。
  2. 用 MCP 把你的内部工具封装成标准接口,照 Toolathlon 思路做一轮内部基准。
  3. 给你的 Agent 设定一个「20 轮工具调用」压力测试,看它在第几轮开始丢状态。

下篇预告:第 8 期我们读训练方法,看 ICML 2026 一篇合成数据的信息论判据——为什么「模型自己教自己」用错了会崩,用对了能不标注就训出推理能力。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/12 15:16:01

制造业成本核算怎么做?先理清BOM,再核算料、工、费

做制造业成本管理这么多年,我发现很多企业都有一个共同问题:成本每个月都在核算,但成本为什么变化,却很难真正解释清楚。每个部门都在关注成本,但大家看到的其实只是成本链路中的某一个环节。制造业成本不是财务人员月…

作者头像 李华
网站建设 2026/8/12 15:15:13

开源自动驾驶openpilot:架构解析与社区驱动的L2级辅助驾驶实践

1. 项目概述:当开源代码在专业评测中击败了行业巨头 如果你关注自动驾驶技术,最近几年可能听过一个名字: openpilot 。它不是某个科技巨头的秘密项目,而是一个由社区驱动的、完全开源的自动驾驶辅助系统。最让人津津乐道的是&a…

作者头像 李华
网站建设 2026/8/12 15:15:10

从伪多Agent到真全干专家:AI智能体协同架构的演进与实践

1. 从“伪多Agent”到“真全干专家”:一次认知升级最近在AI圈子里,“罗福莉说的‘伪多Agent’”这个梗挺火的。我一开始也没太在意,心想无非又是哪个新概念在炒作。直到我亲自上手试了试OmniWork这个平台,才真正理解了这句话背后的…

作者头像 李华
网站建设 2026/8/12 15:14:08

微信机器人实战指南:30分钟构建高效智能监控系统

微信机器人实战指南:30分钟构建高效智能监控系统 【免费下载链接】wechat-bot 🤖 Multi-platform IM AI Agent for Telegram, WhatsApp, Lark, and WeChat. Connects ChatGPT / Claude / Kimi / DeepSeek / Ollama / Pi for auto-replies, community ana…

作者头像 李华
网站建设 2026/8/12 15:13:50

C++并发编程中ABA问题的成因与三大解决方案详解

1. 项目概述:从一次诡异的“数据回滚”说起 如果你在C并发编程的路上走得足够远,尤其是深度使用过 std::atomic 或尝试过自己实现无锁数据结构,那么你很可能遇到过一种令人抓狂的“幽灵”问题:程序在99%的时间里运行得完美无瑕&…

作者头像 李华
网站建设 2026/8/12 15:12:56

037、HDR sensor的三种实现路径——DOL/Staggered/Split-Pixel的时序/带宽/算力代价对比——从sensor选型到ISP融合策略的决策树

037、HDR sensor的三种实现路径——DOL/Staggered/Split-Pixel的时序/带宽/算力代价对比——从sensor选型到ISP融合策略的决策树 去年秋天在给某旗舰机型调HDR预览时,遇到一个诡异现象——暗部噪点像雪花一样在屏幕上跳动,但切到普通SDR模式就一切正常。…

作者头像 李华