出品|搜狐科技
作者|郑松毅
提及“梁圣”,并非指梁文锋本人,而是他麾下的DeepSeek与马斯克创立的SpaceXAI,这两家公司都聚焦于同一片高地——即人工智能技术的顶尖领域。
不久前,AI行业见证了一场颇具戏剧性的事件:DeepSeek悄无声息地推出了V4 Pro的正式版本,几乎就在同一时刻,SpaceXAI迅速发布了Grok 4.6的旗舰模型。两家公司并未事先沟通,分别代表中美两大阵营的这两款顶级模型,却几乎同时完成了重要的更新。
业界普遍将这场同步更新视为对Claude Fable 5的一种双线夹击,并且直接提高了AI旗舰赛道的“斩杀线”。
Claude Fable 5是否已被推入“斩杀区”?
这里的“斩杀线”在AI产业中的应用,是从游戏圈借鉴而来,指的是一个残酷的性能和成本生死边界。当一款模型在某一能力档次上表现优异,同时保持较低的调用成本时,那些能力稍逊但价格更高的竞品就可能被推向“斩杀区”。
Claude Fable 5作为Anthropic推出的顶级Mythos级旗舰模型,是当前AI行业公认的复杂智能体能力天花板。凭借其卓越的长链路任务处理能力、超大工程代码重构等能力,它长期在Agent赛道跑分中占据首位。
从基准跑分来看,如今两款新模型已经紧逼Fable 5。
首先看DeepSeek V4 Pro,可以说它在Agent能力上实现了质的飞跃。其中,CyberGym网络安全智能体得分为83.3分,AutomationBench自动化任务得分为31.8分,这两项指标实现了对Fable 5的局部反超。
业内极为重视的“Terminal Bench 2.1”(考核模型自主敲命令、操作服务器、排错运维的真实工程实操能力)和“DeepSWE”(模型理解代码项目并自己处理复杂问题)这两项指标上,DeepSeek V4 Pro正式版相比此前预览版分别大幅提升了21.9%和390%。
值得注意的是,DeepSeek V4 Pro的“Terminal Bench 2.1”测试能力与Fable 5仅相差0.1分。
相比之下,Grok 4.6的突出表现主要来自业内公认的实战向基准测试GDPVal‑AA v2(专注于考核AI处理真实职场、复杂业务、多步骤工作流的综合能力)。Grok 4.6在该榜单上获得了1753 Elo的高分,不仅超越了Claude Fable 5的1741分,同时超过了GPT‑5.6 Sol Max的1728分,跻身全球第一梯队。
除了纸面跑分,一些开发者还分享了他们的真实测试体验。
有开发者在同一代码项目上同时使用了两款模型:DeepSeek V4 Pro成本低廉,但耗时实在过长,需要运行二三十分钟命令,完全不知道是否卡住以及还需要多久。相比之下,Grok 4.6速度快,输出结果的稳定性更好,但单次任务成本更高。
关于Fable 5是否被推入“斩杀区”,搜狐科技将模型性能和成本结合起来进行了分析。
Claude Fable5的定价为输入10美元/百万token,输出高达50美元/百万token,是目前市场上最贵的闭源旗舰之一。
DeepSeek V4 Pro当前的定价为输入0.43美元/百万token,输出0.87美元/百万token,缓存命中输入只需0.0036美元。
由此可见,DeepSeek V4 Pro在普通输入方面比Fable5便宜23倍,输出便宜57倍,缓存命中差距更是高达276倍。
然后是Grok 4.6,输入2美元/百万token,比Fable 5便宜5倍;输出6美元/百万token,比Fable 5便宜8倍以上。
这就构成了最现实的商业压力,即性能与成本难以兼得。
虽然现在有两套备选方案可供选择,但大多数通用开发场景已无需为极限能力支付数十倍的溢价。然而,无论是DeepSeek V4 Pro还是Grok 4.6,










网友评论