导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

Claude Opus 5 在多数基准测试中超越 Fable 5,价格仅为其一半

Anthropic 今日正式发布 Claude Opus 5,这款模型在多数关键基准测试中击败了公司此前定位为“日常前沿产品”的 Claude Fable 5,而 API 价格仅为后者的一半。这一举措有效缓解了 Fable 5 因出口限制退出公众订阅后留下的市场焦虑。

据官方数据,Opus 5 在软件工程基准 Frontier-Bench v0.1 中得分 43.3%,远超 Fable 5 的 33.7% 以及 OpenAI GPT-5.6 Sol 的 34.4%。在衡量真实问题解决能力的 ARC-AGI-3 测试中,Opus 5 达到 30.2%,而 GPT-5.6 Sol 仅 7.8%,Fable 5 未参与测试。在知识工作基准 GDPval-AA v2 上,Opus 5 的 Elo 评分为 1,861,同样高于 Fable 5 的 1,747 和 GPT-5.6 Sol 的 1,736。

Claude Opus 5 在多数基准测试中超越 Fable 5,价格仅为其一半

Fable 5 此前的经历颇为波折:它于 6 月 9 日上线,三天后因美国政府依据“越狱漏洞”发布紧急出口管制令而被全球下架,6 月 30 日恢复后立即转为仅限积分使用,不再包含在标准订阅计划中。Opus 5 如今填补了这一空缺,并成为 Anthropic 产品线中面向普通用户与企业的“重工作马”。

开发者平台 Lovable 拥有数百万用户,其内部评估显示 Opus 5 的进步不仅体现在原始分数上。Lovable 联合创始人 Fabian Hedin 在 Anthropic 分享的声明中表示:“它不仅在我们最难的智能体编码任务上比 Opus 4.7 提升了 22%,而且运行更稳定,每次运行的方差明显更小。”

自动化测试平台 Zapier 对 Opus 5 进行了 AutomationBench 评估,该基准测试模型能否在无人协助下完整执行端到端商业工作流。Zapier 评价称:“该模型直接获取一个原始的健康账户工作簿,完整执行了流失预防流程:标记风险账户、提醒对应负责人、并生成保留团队总结。之前的模型均未通过,而 Opus 5 达到了 100% 成功率。”

在科研领域,DNA 测序公司 Ultima Genomics 表示:“Opus 5 的表现更像一位严谨的科学家,而非单纯的语言模型。它会主动选择正确的统计检验排除混杂因素,通过独立方法交叉验证自身结果,并在长时间多步骤分析中保持专注。”不过,在法律和健康两个领域,Fable 5 仍以微弱优势领先。

此次发布恰逢北京初创公司 Moonshot AI(由阿里巴巴支持)一周前推出 Kimi K3——一个参数规模达 2.8 万亿的开放权重模型,号称全球最大开源 AI 系统。独立基准测试显示,Kimi K3 整体排名第三,次于 Fable 5 和 GPT-5.6 Sol,但在特定领域优于两者。

Opus 5 现已通过 API 提供,定价为每百万输入 token 5 美元、每百万输出 token 25 美元。此外还有约 2.5 倍默认速度的快速模式,价格为每百万输入 token 10 美元、每百万输出 token 50 美元。Opus 5 也向所有订阅用户开放。