• 设为首页
  • 收藏本站
  • 微信
    微信公众号 添加方式:
    1:搜索微信号(jmsmwcm
    2:扫描左侧二维码
  • QQ登录

    只需一步,快速开始

    登录 立即注册
  • 切换风格
    快捷导航
    觅未传媒 首页 新闻资讯 查看内容

    Opus 5 反超 Fable 5,Anthropic 的定价牌局被打乱了?

    发布者: PatrickVof 查看: 937 评论: 0 2026-7-25 12:56

    摘要7月25日凌晨1点,Anthropic发布了ClaudeOpus5。如果只看名字,你会以为它是Opus4.8的继任者,Anthropic产品线中比Sonnet强但比Fable弱的中间型号。但一看数据就会发现,这款定价$5/$25(每百万输入/输出token)的模 ...


    7月25日凌晨1点,Anthropic 发布了 Claude Opus 5。如果只看名字,你会以为它是 Opus 4.8 的继任者,Anthropic 产品线中比 Sonnet 强但比 Fable 弱的中间型号。

    但一看数据就会发现,这款定价 $5/$25(每百万输入/输出 token)的模型,在编程、自主搜索、计算机使用、企业业务流程等多个关键基准测试上,把定价 $10/$50 的 Fable 5 给超了。而它的成本,只有 Fable 5 的一半。

    Anthropic 在官方公告里表示:“Opus 5 comes close to the frontier intelligence of Claude Fable 5 at half the price”,意思是接近 Fable 5 的智能,价格减半。但他们自己发布的基准测试图表显示,Opus 5 在至少四项核心评测中明确领先 Fable 5,而且是在更低的成本下做到的。

    被“次旗舰”反超的“旗舰”

    先看编程能力。Frontier-Bench v0.1 是当前最直接映射企业开发团队实际工作的基准测试之一,让模型自己在终端里写代码、跑代码、调试多文件变更。Opus 5 拿到了 43.3%,Fable 5 是 33.7%。将近 10 个百分点的差距,在编程评测里属于碾压级别。Opus 4.8 在这个测试上是 21.1%,Opus 5 直接翻了一倍多。

    在 CursorBench 3.2 上,Opus 5 在最高推理强度下达到 Fable 5 峰值成绩的 94.5%,单次任务成本只有一半。Anthropic 还宣称,在 high、xhigh 和 max 三个推理等级上,Opus 5 在同成本下的性能都超过了所有其他模型。Cognition(Devin 背后的公司)CEO Scott Wu 在 FrontierCode 1.1 评测后确认:“Claude Opus 5 在调试和根因分析方面以一半成本达到了接近 Fable 级别的性能。”

    在自主搜索(Agentic Search)上,Opus 5 拿到 90.8%,Fable 5 是 87.4%。十次搜索有九次以上能独立搞定。计算机使用(OSWorld 2.0)上,Opus 5 在约三分之一成本下就超过了 Fable 5 的最优成绩。企业业务流程自动化(Business Workflows)方面,Opus 5 拿到 26%,Fable 5 只有 17.4%。

    科学领域同样不弱。Opus 5 在有机化学任务上比 Opus 4.8 高出 10.2 个百分点(包括从光谱数据推断分子结构),在蛋白质相关任务上高出 7.7 个百分点(包括预测序列变异对功能的影响)。在号称“人类最后考试”的 Humanity's Last Exam 上,开启工具后 Opus 5 拿到 64.7%,Fable 5 是 63.9%(不开工具时分别为 56.3% 和 56.5%),差距不到一个百分点。

    但真正让整个 AI 研究圈停下滚动的,是 ARC-AGI 3 的成绩。

    ARC-AGI 3 是 François Chollet 设计来衡量“流体智能”的基准。它不是让模型回忆训练数据里见过的东西,而是把它扔进完全陌生的交互式环境里,没有指令、没有规则说明、没有目标提示,靠试错自己摸索。人类能完成 100% 的任务。今年 3 月 ARC Prize Foundation 发布这个基准时,最强 AI 模型的得分是 0.37%(Gemini 3.1 Pro)。到 Opus 5 发布前,公开最强成绩是 GPT-5.6 Sol 在最大推理强度下的 7.8%。Opus 4.8 只有 1.5%。

    Opus 5 拿到了 30.2%。是 GPT-5.6 Sol 的近四倍,Opus 4.8 的二十倍。


    这个数字的意义远超任何编程或搜索基准。ARC-AGI 3 奖励的不是“做过类似的事所以能做”,而是“从没训练过也能做”。30.2% 意味着 Opus 5 确实在通过交互来推导陌生的规则体系,而不只是模式匹配。Vellum AI 的基准分析文章直言:“这个数字让所有人都停下了滚动。”

    它不只是分数高

    基准数字告诉我们 Opus 5 考了多少分。但 Anthropic 公布的案例告诉了我们是它怎么考到这些分的。

    Anthropic 公布了一个 3D 建模任务,只给模型一张机械零件的设计图纸,要求它自主编写代码重建完整的 FreeCAD 3D 模型。在 Opus 5 之前,没有任何模型能完成这个任务,即使人工提前搭好开发框架、给出详细方案,模型依然会出错。Opus 5 不仅完成了全过程自主闭环,还自己搭建了配套的测试工具,逐一校验代码的数据解析逻辑,反复核查修正问题,直到通过验证。

    在没有任何人工干预的情况下,自主完成了一个完整的工程验证循环,设定目标、规划步骤、编写代码、测试输出、发现错误、回溯修正、再次测试、通过。

    Zapier CEO Wade Foster 透露,团队用 Opus 5 处理客户健康度原始表格,要求 AI 独立完成全套客户流失预防流程,包括标记高风险账户、通知对应负责人、整理运营报告。“以前的模型没有能完整跑通这条流程的,”Foster 说,“Opus 5 做到了 100% 完整交付。”

    Box CTO Ben Kus 给出了量化对比:Opus 5 在专业企业内容处理上整体比 Opus 4.8 提升 8%,数据分析工作流提升 11%,尽职调查提升 17%。一家金融建模团队的评估负责人 Richard Pham 测出了准确率高 9 个百分点,同时周转次数少三分之一、耗时少 60%。法律 AI 团队 Applied Research 负责人 Niko Grupen 发现 Opus 5 在保持质量的同时,平均比 Opus 4.8 在最高推理强度下少生成了 26% 的 token。

    更少的 token、更少的交互轮次、更少的人盯着屏幕。这就是 Opus 5 对“性价比”的真正定义。

    没人预料到的 30.2%

    回到 ARC-AGI 3。这个数字的冲击力需要放在时间线上理解。

    今年 3 月,Gemini 3.1 Pro 以 0.37% 领先。到 Opus 5 发布前,公开最强成绩是 GPT-5.6 Sol 在最大推理强度下的 7.8%。Opus 4.8 挂在 1.5%。Opus 5 发布当天直接拉到 30.2%。Anthropic 在公告中说 Opus 5 的成绩是“次优模型的三倍”,这个表述甚至可能是保守的,因为 GPT-5.6 Sol 的 7.8% 是在最大推理强度设置的极端资源消耗下拿到的,而 Opus 5 在标准推理设置下就做到了 30.2%。

    ARC-AGI 3 它测的是遇到完全没见过的问题时的应变能力,Chollet 设计的逻辑是,把模型扔进一个没有任何参考框架的新世界,看它能不能靠自己理解规则、制定策略、达成目标。这才是“通用智能”的真正含义。不是知识面有多广,而是面对未知时的适应速度有多快。

    30.2% 意味着 Opus 5 在三分之一的情况下能独立完成人类能完成的任务,而这些任务是它绝对没有在训练数据里遇到过同类题型的。AI 从“超强模式匹配器”向“自主推理系统”的转变,正在被量化验证,而不是停留在口号层面。

    但更值得追问的是,为什么 Anthropic 要发布一款在核心指标上碾压自家“旗舰”的模型,还只卖一半的价格?

    这需要看一圈 Opus 5 周围的定价坐标。


    再回头看看 Fable 5 的 $10/$50。这个定价在 2026 年 7 月的市场上像一座孤岛,周围的海平面每天都在上涨。Fable 5 在 6 月 9 日发布时,它的“神话级”(Mythos-class)性能确实值这个溢价。但仅仅 45 天后,Opus 5 就用不到一半的价格,在用户最关心的场景里拿出了更好的成绩。

    Anthropic 面临的困境是,Fable 5 的定价正在被市场抛弃,而竞争对手,尤其是 Kimi K3 的开源攻势,正在从下方蚕食。继续守着 Fable 5 的高价策略,等于把高频使用场景(编程、搜索、办公自动化)的客户拱手让人。Anthropic 的选择是,与其等竞争对手来拆,不如自己先拆。用 Opus 5 把旗舰级能力注入中端产品线,在性价比战场正面迎战,同时让 Fable 5 继续守住“极致推理”的利基市场。

    Opus 5 的商业使命可以概括为一句话,证明 Anthropic 还能收前沿溢价。而 Anthropic 给出的回答是,不收了。或者说,前沿溢价的门槛被自己抬高了。你得先在 $5/$25 这个价格点上拿出比 Fable 5 更强的编程和推理能力,才有资格谈“溢价”。

    大模型定价的逻辑,已经不太一样了

    Opus 5 的发布,本质上宣告了大模型行业“越贵越强”定价范式的终结。

    过去两年,行业默认的逻辑是,更强的模型需要更大的参数、更多的训练算力、更高的推理成本,所以必然更贵。Fable 5 的 $10/$50 定价就是这条逻辑链的终极产物。我比任何人都强,所以我可以收最贵的钱。但 Opus 5 用数据证明了一件事,更强的推理架构和更高效的训练方法,可以让模型在价格不变甚至更低的情况下,性能跳升一个量级。

    Opus 5 的定价和 Opus 4.8 完全相同($5/$25),但 Frontier-Bench 得分从 21.1% 跳到了 43.3%,ARC-AGI 3 从 1.5% 跳到了 30.2%。同样的价格,推理能力提升了一个量级。这不是边际改善,是范式跃迁。

    “旗舰”这个词本身的含义正在被重新定义。当一款 $5/$25 的模型能在你每天实际使用的场景里跑赢 $10/$50 的模型,“旗舰”就从一个能力标签变成了一个价格标签,而价格标签是最容易被竞争对手撕掉的。

    这给整个行业传递了一个清晰的信号:如果你今天的旗舰模型不能在效率上持续拉开代差,明天就会有一个价格只有你一半的模型在功能上超越你。Anthropic 今天自己动手拆掉了自己的价格金字塔,意味着它已经预判到了这个趋势不可逆转,选择主动引领而不是被动防守。

    对于企业用户来说,Opus 5 是 2026 年迄今为止最值得认真评估的 AI 投入。在编程辅助(尤其是 Claude Code 和 Cursor 等 IDE 场景)、自动化办公(Zapier 等平台)、数据分析、科学研究等高频使用场景中,$5/$25 的定价结合超越 Fable 5 的性能,构成了当前市场上最清晰的性价比锚点。

    但真正的变量在 7 月 27 日,Kimi K3 开源全部权重。当一个 2.8T 参数的模型可以免费部署、自由修改,且性能已经逼近前沿,整个行业的定价地板将再次被击穿。Opus 5 证明了“可以更便宜地做得更好”,而 Kimi K3 即将证明“可以几乎免费地做得差不多”。两条线同时推进,留给任何一家 AI 公司维持高溢价的窗口期,正在以天为单位收窄。

    当一家公司开始用中端型号的价格卖旗舰级别的性能,这表明与其等对手来拆你的定价,不如自己先把牌桌掀了。

    (本文首发钛媒体APP,作者 | AGI-Signal,编辑 | 秦聪慧)


    鲜花

    握手

    雷人

    路过

    鸡蛋

    相关分类

    QQ Archiver 小黑屋 佳木斯觅未传媒有限公司 ( 黑ICP备2021005432号|黑ICP备2021005432号-1 ) 劰载中...

    Powered by Discuz! X3.5 © 2017-2026

    返回顶部