Anthropic“狂飙”更新:Opus 5性能比肩Fable 5,价格却腰斩,AI赛道再掀波澜

   时间:2026-07-26 04:34 来源:快讯作者:柳晴雪

人工智能领域又迎来一场激烈竞争,Anthropic公司近期动作频频,其新发布的Claude Opus 5模型引发广泛关注。在短短57天内,Anthropic几乎将Claude的主要产品线全面更新,如此快速的迭代速度,即便在模型按月迭代的AI行业也显得格外突出。

此次更新,Anthropic似乎有意与OpenAI“较劲”。7月9日,OpenAI发布GPT-5.6,在官方评测中把Fable 5列为主要参照模型之一。仅仅15天后,Anthropic就发布Opus 5,并将GPT-5.6 Sol放进核心对比,在陌生问题求解、电脑操作和商业流程等项目中展示自身优势。两家公司在产品发布和宣传上的“针锋相对”意味十分明显。

那么,Opus 5究竟有何过人之处?从性能与性价比来看,它延续了Opus 4.8每百万输入Token 5美元、输出Token 25美元的价格,但性能却大幅提升。Anthropic展示了Opus 5在不同“投入档位”的表现,用户可根据任务难度调整档位,简单任务选省钱快速模式,难题则提高档位获取更好结果。

在软件工程任务处理方面,Opus 5表现尤为出色。在Frontier-Bench v0.1评测中,它超越所有其他模型,与Opus 4.8相比,完成每项任务成本更低,成绩却提高一倍以上。在CursorBench 3.2评测中,最高投入档位下,它与Fable 5最高得分差距不到0.5%,成本却仅为Fable 5的一半。在high、xhigh和max三个投入档位下,按相同成本比较,Opus 5表现也超过所有其他模型。

在知识工作和问题解决任务中,Opus 5同样展现出强大实力。在ARC-AGI 3这类“陌生题”测试中,模型需自行摸索规则、判断目标并调整策略,Opus 5得分达到第二名的3倍,说明其面对从未见过的问题时,更有能力通过试错找到解法。AutomationBench要求模型调用商业软件完成任务,Opus 5通过率约为第二名的1.5倍,即使使用最低投入档位,也超过其他模型的最高成绩。在电脑操作测试OSWorld 2.0中,Opus 5在各个成本区间领先,花费略高于Fable 5三分之一的成本,成绩就超过Fable 5最高水平。

在跨学科难题测试HLE中,不调用工具时,Opus 5以56.3%略低于Fable 5的56.5%;允许使用工具后,它升至64.7%,反超Fable 5的63.9%,且成本更低。在模拟真实知识工作的GDPval-AA v2中,Opus 5最高得分1861,高于Fable 5的1747和GPT-5.6 Sol的1736,大约花700美元就能达到其他模型最高投入档位附近的成绩。DeepSearchQA上,Opus 5也以更低成本取得略高的通过率。在生命科学评测中,Opus 5在全部项目都超过Opus 4.8,光谱推断分子结构和预测蛋白质变异影响两项任务分别提高10.2和7.7个百分点,在辅助分子结构分析、蛋白质功能预测等科研环节潜力巨大。

Anthropic还通过两个可交互演示展示Opus 5的视觉生成能力。一个是可实际操作的三维风洞,用户能旋转汽车、调整风速,观察气流绕车身情况,同时查看阻力系数等数据;另一个是三维动物细胞模型,用户可转动、剖开细胞,点击细胞核、粗面内质网等结构查看说明,页面还会指出示意图的简化之处。从这两个案例看,Opus 5能将代码、三维建模、交互界面和知识讲解整合到同一成品中,用户给出要求后,它可直接搭建接近教学软件或产品原型的演示。

随着模型能力提升,安全与对齐问题愈发重要。Anthropic通过多个案例说明Opus 5比此前模型更会独立推进任务。一次测试要求模型根据机械零件图纸用代码重建FreeCAD三维模型,系统未提供查看图纸工具,Opus 5自己写计算机视觉程序提取尺寸和几何结构后完成建模,而其他模型连续尝试5次均未成功。另一次任务中,Opus 5查出程序错误根本原因,还补上社区修复方案遗漏的边缘情况,参与对比的另一款模型只消除表面症状就宣布问题解决。一家交易公司工程师让Opus 5为新交易所搭建市场数据系统,此前模型拿到详细方案也无法完成,Opus 5找不到实时数据验证,便自行做测试工具检查代码。

Anthropic称,Opus 5是目前对齐表现最好的Claude模型。上线前的自动化审计显示,与Opus 4.8、Sonnet 5和Fable 5相比,它更能遵守Claude宪法,欺骗行为更少,更难被诱导执行有害请求。不过,模型能力提高也带来新挑战,如网络安全领域,Anthropic虽未专门用攻击任务训练Opus 5,但它寻找代码漏洞的水平已接近Mythos 5,不过在编写漏洞利用程序、发动实际攻击方面仍明显落后。Opus 5可继续检查源代码和寻找漏洞,但二进制漏洞扫描、渗透测试及漏洞利用程序生成会被拦截。相比Fable 5,新分类器触发干预的频率预计减少约85%,正常安全研究更少被误伤。生物学领域也采用类似安排,Opus 5成为面向普通用户开放的最强科研模型,但在长时间独立运行的研究任务中仍有局限,此前在Fable 5上因安全限制被拦截的生物学请求,现在会先转交给Opus 5处理,普通科研问题能用上更强模型,高风险任务仍留在安全边界之外。

在价格方面,Opus 5堪称“加量不加价”。在多项编程和智能体测试中,新模型完成率更高,单位任务成本却下降。横向对比,它最直接的对手是OpenAI旗舰模型GPT-5.6 Sol,两者输入价格相同,Opus 5输出价格低约17%。处理超长资料时,Opus 5价格优势更明显,Anthropic对最高100万Token的上下文维持普通单价,GPT-5.6 Sol输入超过27.2万Token后,整次请求输入价格翻倍,输出价格提高50%。对于大型代码库、长篇研究资料和复杂智能体任务,这项差异会直接反映到账单上。按照Anthropic公布的评测,Opus 5虽未在所有项目中胜过GPT-5.6 Sol,但在电脑操作、商业流程和陌生问题求解等需要模型连续做事的任务上,表现和价格都更具竞争力。如今,Opus 5已成为Claude Max的全新默认型号,也是Claude Pro的最强型号。

 
 
更多>同类内容
全站最新
热门内容