2026年7月24日,Anthropic 正式发布 Claude Opus 5。这是 Opus 家族的一次重大升级——性能大幅跃升,价格却一分没涨。
Anthropic 对 Opus 5 的定位非常清晰:它是一款“体贴且主动”的模型,以一半的价格提供接近旗舰 Claude Fable 5 的智能水平。Opus 5 已成为 Claude Max 的新默认模型,也是 Claude Pro 上能用到的最强模型。
如果说 Fable 5 是 Anthropic 的“性能天花板”,那 Opus 5 就是那个让普通开发者和企业真正用得起的“实力派”。
一、性能跃升:多个基准测试登顶,价格一分不涨
Opus 5 的亮点可以用一句话概括:同样价格,性能翻倍。
在 Frontier-Bench v0.1 上,Opus 5 超越了所有其他模型,性能是上一代 Opus 4.8 的两倍多,而单任务成本更低。在 CursorBench 3.2 上,Opus 5 在最大努力模式下,性能达到 Fable 5 峰值得分的 99.5%(差距仅 0.5%),但单任务成本只有 Fable 5 的一半。
知识工作和问题解决类任务同样出色:
ARC-AGI 3(解决新颖问题的推理测试):Opus 5 的得分是第二名模型的三倍;
Zapier AutomationBench(端到端完成业务任务的能力):Opus 5 的通过率约为第二名模型的 1.5 倍,即使在最低努力模式下,通过的任务数也超过任何其他模型;
OSWorld 2.0(计算机使用基准):Opus 5 在任意给定成本下都优于所有其他模型,仅用 Fable 5 三分之一左右的成本就超越了其最佳成绩。
在科学研究领域,Opus 5 在生命科学评估的每一项上都优于 Opus 4.8,涵盖结构生物学、有机化学和生物信息学等领域。最亮眼的是有机化学任务——从光谱数据推断分子结构,Opus 5 比 Opus 4.8 高出10.2 个百分点;蛋白质相关任务则高出7.7 个百分点。
更难得的是,这一切性能提升建立在与 Opus 4.8 完全相同的定价之上:输入每百万 tokens 5 美元,输出每百万 tokens 25 美元。此外,Opus 5 还提供 Fast 模式,运行速度约为默认的 2.5 倍(价格为基准的两倍)。
二、真实场景验证:不只是跑分,更是干活利器
基准测试之外,早期用户的反馈更能说明 Opus 5 的真实水平。
案例一:看不见图纸,自己写视觉管道
在一个 Frontier-Bench 任务中,Opus 5 拿到一张机器零件的图纸,要求编写代码将其重建为 3D FreeCAD 模型。但任务设计者故意没有给模型任何直接查看图纸的方式。Opus 5 的反应是:自己写了一套计算机视觉管道,从原始像素中提取几何信息,然后完整重建了机器零件。它反复成功地完成了这一任务,而同等设置下的竞品模型尝试五次均告失败。
案例二:找到社区补丁遗漏的根因
面对一个流行的开源包管理器中的真实 Bug,Opus 5 找到了根因,并修复了社区补丁遗漏的一个边缘情况。而竞品模型只修复了表面症状,就报告问题已解决。
案例三:单会话构建完整市场数据源
一家交易公司的工程师用 Opus 5 在单次会话中为一个新交易所构建了完整的市场数据源。之前的模型即使有工程师提供的详尽计划也无法完成这项任务。更令人惊叹的是,由于找不到实时数据源做验证,Opus 5 自己构建了一个测试工具来检查代码是否正确解析了交易所的数据。
其他用户的反馈同样印证了 Opus 5 的实用性:
Zapier:Opus 5 登顶其 AutomationBench 排行榜,在端到端客户流失预防任务中达到100% 通过率,而之前的模型未能通过;
Lovable:Opus 5 在其最难的自主体编码任务上**比 Opus 4.7 提升了 22%**,且运行间方差大幅降低,一致性更强;
Box:Opus 5 在数据分析工作流中比 Opus 4.8 提升 **11%**,在尽职调查工作流中提升 **17%**;
某金融模型测试:Opus 5 在所有努力水平上平均准确率比 Opus 4.8 高出 9 个百分点,同时**减少了三分之一的对话轮次和工具调用,耗时缩短 60%**。
三、对齐与安全:Anthropic 史上最“听话”的模型
强大的能力往往伴随着更大的风险。Anthropic 在安全方面的投入,是 Opus 5 另一个值得关注的亮点。
在部署前的自动化行为审计中,Opus 5 成为 Anthropic 迄今对齐程度最高的模型。它比 Opus 4.8、Sonnet 5 和 Fable 5 都更好地遵守了 Claude 的宪法原则;欺骗行为发生率最低;最不容易被诱骗滥用;在避免可能产生难以逆转副作用方面,也是 Anthropic 最安全的模型。
在风险能力方面,Opus 5并未推进生物研究和攻击性网络安全等具有双重用途的高风险能力前沿。虽然由于通用能力的提升,Opus 5 在发现软件漏洞方面已接近 Mythos 5,但在将漏洞转化为实质性网络威胁的利用开发方面,仍远远落后于 Mythos 5。
安全防护方面,Opus 5 的分类器拦截频率预计**比 Fable 5 低约 85%**——这意味着在日常使用中,用户被安全策略“误伤”的概率大幅降低。在 Claude.ai、Claude Code 和 Claude Cowork 中,被标记的请求会默认回退到 Opus 4.8。对于已加入网络安全验证计划的企业和研究人员,可立即获得限制更少的 Opus 5 版本。
在生物学方面,Opus 5 已成为Anthropic 公开发布的最强科研模型。此次发布后,Fable 5 上被拦截的生物学相关请求将路由到 Opus 5 而非 Opus 4.8。
四、两大更新:开发者体验再升级
伴随 Opus 5 的发布,Anthropic 还推出了两项 Beta 功能:
1. 对话中工具变更:开发者现在可以在对话过程中更改 Claude 可用的工具,而无需使提示缓存失效。这意味着长对话中的工具切换更加灵活高效。
2. API 自动回退:用户可以选择让被安全分类器标记的请求自动路由到另一个模型。开启后,API 请求默认始终路由到最佳可用模型,而不是被直接拦截。
五、给创业者的实战建议
1. 重新算一笔“性能/成本”账
Opus 5 的核心价值在于:以 Opus 4.8 的价格,获得接近 Fable 5 的性能。对创业公司而言,这意味着可以在不增加推理成本的前提下,将产品中的 AI 能力提升一个档次。如果你之前因为 Fable 5 的成本望而却步,现在正是重新评估技术选型的时候。
2. 充分利用“努力程度”调节
Opus 5 支持不同级别的“努力程度”设置,用户可以在智能度和 Token 消耗之间灵活调节。对创业公司来说,这意味着可以根据任务复杂度动态调配资源——简单任务用低努力模式省钱,复杂任务切高努力模式保质量。这种灵活性在控制成本方面价值巨大。
3. 安全不再是“拦路虎”
Opus 5 的安全拦截频率比 Fable 5 低约 85%。对开发者来说,这意味着在日常编码和业务自动化场景中,被安全策略打断的概率大幅降低。如果你之前因为 Fable 5 的“过度防护”而感到困扰,Opus 5 可能是更好的日常选择。
4. 科研创业者:这是目前最好的公开发布模型
Opus 5 已成为 Anthropic 公开发布的最强科研模型。对于生物医药、化学信息学等领域的创业公司,这是一个值得重点评估的选项。尤其是有机化学和蛋白质相关任务上的显著提升,可能直接转化为研发效率的质变。
5. 关注“自动回退”带来的稳定性
API 自动回退功能意味着:即使某个请求被安全分类器拦截,系统也能自动路由到备选模型继续工作。对构建生产级应用的创业者来说,这大幅提升了系统的鲁棒性——不再因为单次拦截而导致整个流程中断。
写在最后
Claude Opus 5 的发布,传递了一个清晰的信号:大模型竞争正在从“谁更强”转向“谁更值得用”。
Fable 5 代表了智能的巅峰,但 Opus 5 代表了智能的普及。它以一半的价格提供了接近顶级的性能,让更多开发者和企业能够真正将前沿 AI 能力融入日常工作流。
正如一位早期用户所言:“Opus 5 是 Opus 家族自 4.5 以来最大的飞跃。”而对普通用户来说,更重要的或许是另一句话:“更聪明的模型,不应该只属于出得起高价的人。”
关键词标签:#Claude Opus 5 #Anthropic #大模型 #AI编程 #性价比 #开发者工具 #AI安全 #API #创业 #AI模型对比