来源:互联网 更新时间:2026-07-25 12:49
说实话,Anthropic最近的更新节奏,确实有点让人跟不上。
就在刚刚,新模型Opus 5正式发布,性能直逼旗舰级的Fable 5,但价格却直接砍了一半。
要说这次更新有多密集:5月28日,Claude Opus 4.8上线;12天后,更强的Fable 5和Mythos 5登场;6月30日,Sonnet 5跟上;到了7月24日,Opus 5又来了。
短短57天,这家公司几乎把Claude的几条主要产品线都翻了个新。就算放在模型按月迭代的AI行业里,这个速度也快得有点夸张。
其中最让人意外的,是Fable 5和Opus 5之间只隔了45天。Fable 5刚发布时,还是Anthropic面向普通用户的能力标杆,按理说这种旗舰模型怎么也得在聚光灯下多待一阵。结果Opus 5转眼就追了上来。
这架势,简直就是在高喊:“打败”我的,只能是我自己。
当然,这轮更新也紧贴着OpenAI的节奏。7月9日,OpenAI刚发完GPT-5.6,还把Fable 5列为评测的主要参照模型。15天后,Anthropic就拿出了Opus 5,直接把GPT-5.6 Sol放进核心对比,在陌生问题求解、电脑操作和商业流程等项目中展示自己的优势。两家公司你追我赶的意味,已经再明显不过了。
那么,Opus 5究竟是何方神圣?来看看Anthropic这次都公布了什么。

先说价格。Claude Opus 5的定价和上一代Opus 4.8完全一样,但性能却有了大幅提升。
Anthropic展示了Opus 5在不同“投入档位”下的表现。用户可以自己调整:简单任务,选更省钱、更快的模式;遇到难题时,再提高档位换取更好的结果。
从测试数据来看,Opus 5尤其擅长处理具有实际价值的软件工程任务。
举个例子,在Frontier-Bench v0.1的评测里,Opus 5超过了所有其他模型。和Opus 4.8相比,它完成每项任务的成本更低,但成绩却提高了一倍以上。
在CursorBench 3.2评测中,当投入档位设为最高时,Opus 5与Fable 5的最高得分差距不到0.5%,但每项任务的成本却只有Fable 5的一半。在high、xhigh和max三个投入档位下,按相同成本比较,Opus 5的表现也超过了所有其他模型。

在知识工作和问题解决任务中,也观察到了类似的结果。比如在ARC-AGI 3这类“陌生题”测试里,模型拿不到现成套路,只能自己摸索规则、判断目标、调整策略。Opus 5的得分达到了第二名的3倍——这意味着,遇到从未见过的问题时,它更擅长靠试错找到解法。
这种优势也延续到了真实工作流程里。
AutomationBench要求模型调用商业软件,从头到尾完成一项任务。Opus 5的通过率约为第二名的1.5倍;即使使用最低投入档位,也超过了其他模型的最高成绩。换句话说,Opus 5不用付出最高的推理成本,也能完成更多任务。

在电脑操作测试OSWorld 2.0中,Opus 5同样在各个成本区间领先。它只花费略高于Fable 5三分之一的成本,成绩就超过了Fable 5的最高水平。这意味着,打开应用、查找信息、跨软件操作、持续推进任务,它的效率明显更高。
这种特点在其他评测中也很明显。
HLE考察的是跨学科难题,不调用工具时,Opus 5以56.3%略低于Fable 5的56.5%;但允许使用工具后,它直接升至64.7%,反超Fable 5的63.9%,而且成本更低。这说明,单靠模型内部知识,Opus 5不一定总是第一,但一旦可以搜索、调用工具、反复核对,它的优势就会迅速扩大。

在模拟真实知识工作的GDPval-AA v2中,Opus 5最高得分1861,高于Fable 5的1747和GPT-5.6 Sol的1736。大约花700美元,就能达到其他模型最高投入档位附近的成绩。DeepSearchQA上的领先幅度虽然小一些,但同样以更低成本取得了略高的通过率。
值得一提的是,Opus 5在Anthropic全部生命科学评测中都超过了Opus 4.8,其中光谱推断分子结构和预测蛋白质变异影响两项任务,分别提高了10.2和7.7个百分点。这些提升意味着,在辅助分子结构分析、蛋白质功能预测这类科研环节上,它更有潜力。
Anthropic还用了两个可交互的演示,展示了Opus 5的视觉生成能力。第一个是一个可以实际操作的三维风洞,用户能旋转汽车、调整风速,观察气流如何绕过车身,同时查看阻力系数等数据。第二个是一个三维动物细胞模型,用户可以转动、剖开细胞,点击细胞核、粗面内质网等结构查看说明,页面还会主动指出示意图做了哪些简化。

从这两个案例来看,Opus 5已经能把代码、三维建模、交互界面和知识讲解,整合进同一个成品里。用户给出一段要求,它就能直接搭出接近教学软件或产品原型的演示。

Anthropic用了几个案例,说明Opus 5比此前的模型更会独立推进任务。
一次测试要求模型根据机械零件图纸,用代码重建一个FreeCAD三维模型,但系统没有提供直接查看图纸的工具。Opus 5干脆自己写了一套计算机视觉程序,从原始像素中提取尺寸和几何结构,随后完成了建模。同样条件下,其他模型连续尝试5次也没有成功。
另一次任务来自一个流行的开源软件包管理器。Opus 5查出了程序错误的根本原因,还补上了社区修复方案遗漏的边缘情况。而参与对比的另一款模型,只消除了表面症状,随后就宣布问题已经解决。
一家交易公司的工程师,还让Opus 5为新交易所搭建市场数据系统。此前的模型即使拿到详细方案也无法完成,而Opus 5找不到实时数据用于验证,就自行做了一套测试工具来检查代码。
这些案例展示了Opus 5的进步,也解释了Anthropic为什么花了很大篇幅讨论安全。
当模型开始自行补工具、检查结果、修正错误后,人类就需要确认它不会为了完成目标而隐瞒问题、绕过限制,或者做出风险过高的决定。
Anthropic称,Opus 5是目前对齐表现最好的Claude模型。上线前的自动化审计显示,与Opus 4.8、Sonnet 5和Fable 5相比,它更能遵守Claude宪法,欺骗行为更少,也更难被诱导执行有害请求。
所谓“对齐”,说得直白一些,就是模型能力提高以后,做事方式仍符合开发者设定的规则。
网络安全领域最能体现这种两难。Anthropic没有专门用攻击任务训练Opus 5,但模型综合能力提高后,它寻找代码漏洞的水平已经接近Mythos 5。两者在发现漏洞时表现相近,但到了编写漏洞利用程序、把缺口转化成实际攻击手段的阶段,Opus 5仍明显落后。它已经很会检查哪里出了问题,但真正利用这些问题发动攻击的能力,仍然受到限制。
具体来说,Opus 5可以继续检查源代码和寻找漏洞,但二进制漏洞扫描、渗透测试及漏洞利用程序生成,则会被拦截。相比Fable 5,新分类器触发干预的频率预计减少约85%,正常的安全研究更少被误伤。
触发限制后,Claude.ai、Claude Code和Claude Cowork会默认改用Opus 4.8处理请求;加入网络安全验证计划的企业和研究人员,可以使用限制较少的版本。
生物学领域也采用了类似安排。Opus 5成为Anthropic面向普通用户开放的最强科研模型,但在需要长时间独立运行的研究任务中,仍有明显局限。此前在Fable 5上因安全限制被拦截的生物学请求,现在会先转交给Opus 5处理。普通科研问题因此能用上更强的模型,高风险任务仍然留在安全边界之外。

整体来看,Opus 5可以算是一次“加量不加价”。
它延续了Opus 4.8每百万输入Token 5美元、输出Token 25美元的价格。但正如前文所述,在多项编程和智能体测试中,新模型的完成率更高,单位任务成本反而下降了。
横向来看,它最直接的对手是OpenAI旗舰模型GPT-5.6 Sol,两者的输入价格相同,但Opus 5的输出价格低了约17%。
处理超长资料时,Opus 5的价格优势会更明显。Anthropic对最高100万Token的上下文维持普通单价,而GPT-5.6 Sol的输入超过27.2万Token后,整次请求的输入价格翻倍,输出价格提高50%。对于大型代码库、长篇研究资料和复杂智能体任务,这项差异会直接反映到账单上。
按照Anthropic公布的评测,Opus 5虽然没有在所有项目中胜过GPT-5.6 Sol,但在电脑操作、商业流程和陌生问题求解等需要模型连续做事的任务上,表现和价格都更有竞争力。
用Anthropic的话说,Opus 5专为日常使用而设计,它比其他型号效率更高。如今,这款新模型已经成为了Claude Max的全新默认型号,也是Claude Pro的最强型号。
问卷星官方网站入口地址 问卷星网页版在线使用
PokePay加密卡2026完整指南:申请开卡全攻略+多场景应用技巧
币安Binance官方中文网站 币安App最新版下载及新手注册指南
为何比特币BTC价格跌破7.3万美元?一文拆解影响近期比特币行情的五大原因
摩托车活塞环性能如何
豆包AI专业版使用教程【新手必看】
ThinkBook系列最新价格全解析:2026年选购避坑与实时询价指南
迷你网名古风男生霸气(精选100个)
文雅简易网名男生可爱(精选100个)
GPT5.6惨遭切脑,Fable 5回归要变弱鸡版?
芝麻开门Gate.io官方网址入口 芝麻开门交易所新手账户注册流程
王者荣耀「西行封妖记」【孙权-仙扇使者】6月25日上线!
精准天气预报APP推荐:支持分钟级降雨预测与实时分享功能
币安杀入美股市场,重头戏bStocks还没来
陈姓和杨姓网名大全男生(精选100个)
网名开头英文名字男生(精选100个)
区块链存储板块是什么?有哪些?一文详解
暗黑4S14野蛮人终局BD攻略
Ondo将于今日上线股票永续合约
免费网络收音机软件有哪些?高评分收音机APP推荐
手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc