科技

Anthropic发布Opus 5,性能直逼Fable 5,价格却只有一半?!

来源:丹巴新文网
Anthropic发布Opus 5,性能直逼Fable 5,价格却只有一半?!

Anthropic真是出乎意料。

刚刚,新模型Opus 5出炉,性能竟能与旗舰模型Fable 5比肩,价格却只有后者的另一半。

5月28日,Claude Opus 4.8问世。仅仅12天后,Fable 5和Mythos 5紧随其后。6月30日,Sonnet 5面世。到了7月24日,Anthropic又推出了Opus 5。

短短57天里,这家公司将Claude的主线产品几乎全部更新了一遍。即便以AI行业模型每月更新的节奏来看,这个速度也相当惊人。

其中最让市场震惊的,莫过于Fable 5与Opus 5之间仅有45天的差距。

Fable 5发布时,是Anthropic给普通用户展示能力的一个标杆。通常情况下,这类模型至少要在聚光灯下停留更长时间。而Opus 5却迅速赶了上来。

Anthropic似乎在表明:“战胜我的只能是我自己!”

Anthropic这次的更新步伐紧随OpenAI。7月9日,OpenAI发布GPT-5.6,并在官方评测中将Fable 5作为参照模型之一。15天后,Anthropic发布Opus 5,又将GPT-5.6 Sol纳入核心对比,在陌生问题求解、电脑操作和商业流程等任务中突显自身优势。

两家公司产品发布和宣传上的竞争意味已经非常明显。

Opus 5究竟是何许能力?Anthropic这次透露了哪些信息?

性能与价格表现

Claude Opus 5的售价与上一代Opus 4.8持平,性能却有了显著提升。

Anthropic展示了Opus 5在不同“投入档位”下的表现。用户可以自行选择,简单任务选经济快速的档位,难题时再调高,以获得更优结果。

Anthropic的数据显示,Opus 5在处理有实际价值的软件工程任务上尤为出色。

比如,在Frontier-Bench v0.1评测中,Opus 5击败了所有其他模型;对比Opus 4.8,它在完成每项任务时不仅成本更低,成绩还翻了一倍以上。

在CursorBench 3.2评测中,若投入档位设为最高,Opus 5与Fable 5最高得分的差距不足0.5%,但成本仅为Fable 5的一半。

在high、xhigh和max三个投入档位比较中,按相同成本计算,Opus 5的表现同样优于所有其他模型。

在知识工作与问题解决领域,Anthropic观察到相似现象。例如:

在ARC-AGI 3这类“陌生题”测试中,模型需独自摸索规则和策略,Opus 5的得分是第二名三倍,显示其面对新问题时,更能通过试错找到答案。

这种优势在工作流程中也同样存在。

AutomationBench要求模型调用商业软件完成完整任务,Opus 5的通过率约是第二名的1.5倍;即便采用最低投入档位,也超过了其他模型的最高成绩。

这意味着,Opus 5无需付出最高推理成本,也能处理更多任务。

在电脑操作测试OSWorld 2.0中,Opus 5在各个成本区间都表现领先。它只花掉Fable 5三分之一略多的成本,成绩却已超越Fable 5的最高水平。

这表明,Opus 5在应用启动、信息检索、跨软件操作及任务推进时效率更高。

其他评测也反映了这一特点。

HLE考察跨学科挑战,不调用工具时,Opus 5以56.3%略逊于Fable 5的56.5%;允许使用工具后,它升至64.7%,反超Fable 5的63.9%,且成本更低——虽然Opus 5在单靠模型内部知识时未必总是顶尖,但配合搜索、工具调用和模型内部推理,它的表现就

相关推荐

网友评论

登录后发表评论
暂无评论,抢沙发吧~