JOTO
联系我们
← AI 智库
效率工具

Anthropic发布Claude Opus 5:面向企业工作流的高性价比编码与智能体模型

2026 年 7 月 24 日

Anthropic推出Claude Opus 5,以一半成本提供接近顶级模型Fable 5的智能水平,主打编程、AI智能体与企业级工作流场景,在多项基准测试中性能翻倍且token效率显著提升,凸显AI商业化从峰值能力转向单位成本效能的竞争新范式。

Anthropic launches Claude Opus 5, a cheaper AI model for coding, agents and enterprise workflows

Anthropic 发布了Claude Opus 5 ,该公司称该模型可提供其顶级模型Claude Fable 5 近乎全部的智能水平,而成本仅为后者的一半——此次发布标志着AI竞赛正从原始能力转向日常使用的经济效益。

该模型即日起在Anthropic所有平台上均可使用,输入令牌定价为每百万5美元,输出令牌定价为每百万25美元,与其前代产品 Opus 4.8保持一致。它将成为Anthropic高端消费级产品线 Claude Max的新默认模型,同时也是 Claude Pro上可用的最强模型。

这一定位是刻意为之。Anthropic并未宣称 Opus 5 是其最智能的模型——这一头衔仍属于 Fable 5,且竞品系统在某些领域仍保有优势。相反,该公司提出了一个更为微妙、却可能对企业买家更具意义的论点:最具经济重要性的AI工作发生在难度居中的区间,此时以高效且低成本方式交付的近前沿智能,优于以高昂成本交付的前沿智能。

“Opus 5作为你的日常主力模型,是你交付复杂任务并待其完成后进行审阅的模型,”Anthropic一位发言人接受VentureBeat采访时表示,描述了该公司当前产品线的分层结构:“Fable 5用于你最具雄心的工作,即持续数天的自主项目,此前没有任何模型能够承担……Sonnet 5用于规模化运行的工作,其速度与每次调用的成本决定了哪些功能可以上线;Haiku 4.5则用于子智能体及即时响应。”

Claude Opus 5基准测试结果与Fable 5及竞品AI模型的对比

纸面上,结果令人瞩目。Anthropic表示 Opus 5 在编程与知识型工作评估中创下了新的业界最高水准,涵盖 Frontier-BenchGDPval-AA等基准。在 Frontier-Bench v0.1(一项面向智能体的终端编程基准)中,Opus 5得分为43.3%——超过Opus 4.8的18.7%逾两倍,且显著高于Fable 5的33.7%——同时单任务成本更低,据该公司称。在 ARC-AGI 3(一项针对新颖问题求解能力的评估)中,Anthropic报告称Opus 5得分是次优模型的三倍。在 OSWorld 2.0(一项计算机使用基准)中,该公司表示该模型以略高于三分之一的成本,超越了Fable 5的最佳成绩。

这些数据附带了坦率的免责声明,而此类坦率本身在惯于使用最高级形容词的行业中便已引人注目。Anthropic承认 Opus 5 在网络安全任务与生物学研究方面仍落后于竞品模型 Mythos 5,且一款OpenAI系模型仍在某项智能体编程基准上保持领先。

更富启示性的免责声明来自Anthropic自身,当被问及 Opus 5 相较于 Fable 5仍存在哪些不足时。该发言人的回答实质上坦率承认了基准测试所能衡量与不能衡量的内容。

“Opus 5胜出的评测项目均为具有明确结果的限定性任务,这正是其最强之处。而这些评测未衡量的是任务持续时间,”该发言人告诉VentureBeat。“换言之:Opus 5是评测所能覆盖任务的最佳工具,而Fable 5则是当任务超出评测范围时你所选择的模型。”

Fable 5则‘适用于最长、最自主的任务,此时模型需在数小时乃至数天内,面对密集的源材料,于众多相互关联的步骤中维持连贯性’,该发言人建议客户‘在代表性工作负载上同时运行两者:一项限定性任务与一项长期任务’。这种‘限定性任务’与‘长期自主性’的框架,或将成为2026年模型差异化的核心轴线,因为基准测试日趋饱和,而剩余最难的问题已不再是离散型谜题,而是需要持续数日的多步骤智能体工作。

为何令牌效率正成为企业AI支出的真实主战场

贯穿此次发布的是一条Anthropic显然希望买家领会的主题: Opus 5 不仅得分高,而且单位美元得分更高。该模型内置可调节的“努力程度”(effort)设置,使客户能在智能水平、推理速度和token消耗之间进行权衡;Anthropic的图表强调的是特定成本下的性能表现,而非仅关注峰值性能。

早期客户以不同寻常的具体性呼应了这一观点。法律领域AI公司Harvey表示,据其应用研究主管Niko Grupen称,Opus 5在平均生成token数量减少26%的情况下,实现了与Opus 4.8最大推理模式相当的性能。Fundamental Research Lab的Richard Pham表示,在难度较高的金融建模任务中,该模型平均准确率高出九个百分点,“同时使用的推理轮次(turns)和工具调用(tool calls)约为前代模型的三分之二,耗时减少60%。”

自动化平台Zapier首席执行官Wade Foster表示,Opus 5在不比此前Claude模型消耗更多token的前提下,登顶该公司AutomationBench排行榜,并端到端运行完整的客户流失预防工作流。“此前模型未能通过;Opus 5得分为100%。”他说。开发Devin编码代理的公司Cognition首席执行官Scott Wu表示,在FrontierCode 1.1基准测试中,“Claude Opus 5以一半成本达到接近Fable级别的性能”,尤其在调试和根本原因分析方面表现突出。

对效率的强调反映了商业现实:企业AI支出已不再属于实验性质,而推理成本——即大规模实际运行这些模型的费用——已成为董事会层面的关键财务条目。 

Anthropic的业务高度偏向API及企业级应用;根据 Contrary Research于2026年2月发布的一项分析,截至2025年底,Claude凭借使用量占据企业级大语言模型市场约40%份额,而仅Claude Code一项的年化收入已达约10亿美元。对于按token计费的客户而言,每token产出更高的模型并非锦上添花,而是核心产品。

自验证AI代理及其对自动化隐性成本的影响

除数据之外,Anthropic正在销售一种行为叙事:即 Opus 5 会验证自身工作并持续迭代直至成功。该公司提供了若干来自测试的示例,读起来宛如关于机器固执的小寓言。

在一项 Frontier-Bench 任务中,模型被要求仅凭一张故意无法查看的图纸重建某个机械部件的3D CAD模型。Anthropic称,Opus 5并未失败,而是自行编写了一套计算机视觉流水线,从原始像素中提取几何结构——且反复执行此操作,而其他竞争模型在五次尝试中均未解决该任务。在另一案例中,面对一个流行开源包管理器中的真实缺陷,该模型定位了根本原因,并修复了一个社区补丁本身遗漏的边缘情况;而某竞争模型仅修补了表象症状便宣告成功。该公司称,一家交易公司的工程师曾利用Opus 5在单次会话中为一家新交易所构建市场数据流;由于缺乏实时数据流可供验证,该工程师观察到模型自行构建了测试框架以检验其解析代码。

客户亦在实际应用中描述了类似行为。Stripe公司资深软件工程师Cristian Rivera表示,他曾在周末将该模型委任为“其开发环境的首席幕僚”:“它自行构建了监控系统,驱动每一台服务器,并仅在需做判断性决策时才将我拉入。”

这正是企业真正关心的能力,值得深入探讨其原因:能输出看似合理结果的模型与能验证自身输出的模型之间的差距,正是演示原型与可部署系统之间的差距。当前企业AI的大部分隐性成本在于人工审核——工程师检查机器的工作成果。一款能可靠自查的模型压缩了此类成本,这恰恰解释了为何客户反复强调更少的推理轮次、更少的迭代次数和更短的耗时,而非更高的原始分数。

Anthropic安全策略内幕:能力缺口、分类器与模型降级机制

此次发布也展示了Anthropic日益复杂的整体安全方法——其中甚至包括刻意不向模型教授某些技能。该公司称,其自动化行为审计发现Opus 5是迄今最符合人类意图的模型,整体非对齐行为评分为2.3,低于 Opus 4.8Sonnet 5Fable 5,其欺骗性行为发生率最低,且最不易被诱导滥用。

在能力层面,Anthropic表示其刻意避免针对网络任务训练 Opus 5 ,一如对待Opus 4.8的做法。但该模型仍在此类任务上有所提升——这是通用能力增强带来的副作用——如今在发现软件漏洞方面已几乎媲美Mythos 5。然而其在漏洞利用方面仍明显落后:在Anthropic的OSS-Fuzz评估中,Opus 5识别漏洞的准确率为79.4%,接近Mythos 5的80%,但在开发漏洞利用程序方面仅在4项挑战中成功,远低于Mythos 5的13项。这种不对称性——在防御相关漏洞发现方面强劲,而在进攻相关漏洞利用方面薄弱——似乎是刻意设计的结果,相关安全防护措施亦遵循相同逻辑。Anthropic预计Opus 5的网络安全分类器触发频率将比Fable 5低约85%。

当分类器触发时, Claude.aiClaude Code以及 Claude Cowork 中的请求默认降级至 Opus 4.8 ——由此引发一个显而易见的问题:若某请求对一个模型而言风险过高,为何对另一模型却可接受?发言人表示:“降级所至的模型能力水平较低,因此有害使用的风险也相应更低。”并补充道:“系统会在触发降级时向用户发出提示消息,该消息在聊天界面中可见。”

该逻辑虽可辩护,却揭示了2026年AI安全的实际运作方式:风险并非仅由问题本身决定,而是由问题与回答系统的具体能力共同决定。在生物学领域,计算逻辑则相反。Opus 5现已成为Anthropic面向公众提供的最具科学研发能力的通用模型——在其内部化学基准测试中得分比Opus 4.8高出10.2个百分点;不过发言人承认,“Mythos 5仍是长期、开放式任务(如自主药物设计项目)的更强模型。”

此次发布的商业背景:3800亿美元估值与巨额算力投入

此次发布恰逢Anthropic商业势头空前强劲——同时也肩负空前责任之时。路透社2月报道称,该公司在最新一轮融资中估值约为 3800亿美元 ,此前据Contrary Research分析,其年化收入从2024年底约10亿美元攀升至2025年底预计达90亿美元,内部目标 reportedly 设定为2026年达200亿至260亿美元。这些目标依托于巨额基础设施投入,其中包括一项 据报价值300亿美元的Azure算力协议 以及与谷歌云(Google Cloud)和英伟达(Nvidia)达成的合作安排——此类支出能否成立,仅取决于企业客户是否持续扩大使用规模。

正是在此背景下,Opus 5 的定价策略才显得合理:在将价格维持在 Opus 4.8 水平的同时,关键智能体(agentic)基准测试性能大致翻倍,实质上相当于单位能力成本大幅下调,旨在拓宽经济上可行的自动化工作负载范围。此前在 Opus 4.8 成本/成功比下处于边际状态的每一项任务,在 Opus 5 下均变得可行;而每一项可行的任务,都会带来持续性的 token 收入。

监管环境也日趋复杂。本周,一名美国法官最终批准了 Anthropic 公司与图书作者就版权问题达成的 15 亿美元和解协议,据路透社报道,此举为该公司早期训练数据引发的诉讼画上了句点。而今年 6 月,路透社援引 Axios 报道称,美国政府已采取行动 阻止外国用户访问 Anthropic 最先进模型——这提醒人们,前沿人工智能如今已与出口政策深度交织,进而影响哪些客户能够购买何种产品。

本周五同步发布的还有:一种“快速模式”(Fast mode),其运行速度约为默认速度的 2.5 倍,但基础价格为默认价格的两倍;API 上的自动回退路由(automatic fallback routing);以及对话中途更改工具时不再使提示缓存(prompt cache)失效——这一细微功能,智能体(agent)开发者可能比任何基准测试结果都更看重。与此前各代 Opus 模型一致,Opus 5 对通用访问不设数据留存要求;发言人主动向那些具有“严格零数据留存要求”的客户强调了这一点。开发者即日起可通过 Claude API 以 claude-opus-5 的名称访问该模型。

有两个问题将决定此次押注能否成功:其一, Opus 5 的效率主张 能否经受住大规模生产工作负载的实际检验;其二,企业客户是否会接受这样一个世界——在其中,安全分类器(safety classifiers)而非用户,有时决定由哪个模型作答。但本周五发布所传递的更深层信息是:人工智能行业的重心已然转移。三年来,各研究实验室竞相比拼其最佳模型在理想状态下的巅峰表现;而借助 Opus 5,Anthropic 转而竞逐一项不那么炫目却远为丰厚的目标:一款非常优秀的模型,如何以一半价格、日复一日地稳定交付价值。在一个前沿边界持续移动的市场中,Anthropic 押注真正的财富,恰恰蕴藏于这前沿之后。

立即咨询 JOTO

JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询

想把这些做法用到你的业务里?

留下你的场景和痛点,我们帮你判断从哪一步开始。

联系我们
联系我们

开启企业级 AI 落地

留下你的行业、部门和当前痛点,我们会在 1 个工作日内与你联系,帮你判断适合先做什么、需要准备哪些数据、适合什么平台。

微信咨询
扫码添加,一对一沟通
JOTO 微信咨询二维码
致电我们
+86 (021) 6566 1628
发送邮件
jotoai@jototech.cn

填写需求单

收到你的信息后,我们将在 1 个工作日内与你取得联系。