当大模型厂商还在为“谁更聪明”争得面红耳赤时,Anthropic悄悄换了一张牌桌。上周五,这家公司正式推出Claude Opus 5,一款号称“拥有顶级模型绝大部分智能,但价格仅为其一半”的新模型。这一定位清晰的信号表明:AI赛道的竞争正在从“绝对能力”转向“日用经济学”。在AI工具日益普及的今天,企业买家不再只盯着分数,而是开始精打细算——每单位智能的成本是多少?
定价策略:让顶级智能走进日常流水线
Opus 5的定价与上一代Opus 4.8完全一致:每百万输入Token 5美元,每百万输出Token 25美元。但这个价格换来的智能水平却接近Anthropic的旗舰模型Fable 5。在Anthropic的产品梯队中,Opus 5成为Claude Max(高端订阅层)的新默认模型,同时也是Claude Pro(标准订阅层)上可用的最强模型。
“Opus 5是你的日常主力——你交给它复杂工作,然后等它完成后审查结果。”Anthropic发言人在接受采访时这样描述公司产品线的分层逻辑:“Fable 5用于最野心勃勃的工作,那些需要数天自主完成、之前没有任何模型能处理的项目……Sonnet 5用于大规模运行的任务,速度和单次调用成本决定能否上线……Haiku 4.5则适合子代理和即时回答。”
这种分层策略的核心洞察在于:大多数企业AI工作并非追求极限智能,而是落在“中等难度”区间。在这个区间里,接近前沿的智能如果能以足够低的成本高效交付,反而比昂贵的顶级智能更有商业价值。AI投资的回报率正在从“越贵越好”转向“够用且便宜”。
值得注意的是,Opus 5还引入了可调节的“努力程度”设置,让客户可以在智能、速度和Token消耗之间进行权衡。这意味着同一个模型可以根据任务需求动态调整成本,进一步优化了AI工具的经济性。
基准测试:在特定任务上超越旗舰,但坦诚仍有短板
从纸面数据看,Opus 5的表现令人印象深刻。Anthropic公布的数据显示,这款模型在多项编程和知识工作评估中创下新的最佳成绩,包括Frontier-Bench和GDPval-AA。在Frontier-Bench v0.1(一个智能体终端编码测试)上,Opus 5得分43.3%,是Opus 4.8(18.7%)的两倍多,也领先于Fable 5的33.7%,且每任务成本更低。在ARC-AGI 3(新颖问题解决能力测试)上,Anthropic称Opus 5得分是次优模型的三倍。在OSWorld 2.0(计算机使用测试)上,该模型以Fable 5三分之一左右的成本超越了其最佳成绩。
然而,Anthropic在发布中罕见地坦诚列出了短板。发言人承认,Opus 5在网络安全任务和生物学研究上仍落后于Mythos 5,而OpenAI系列模型在一个智能体编码测试上仍保持领先。更值得玩味的是,当被问及Opus 5在哪些方面不如Fable 5时,发言人给出了一个关于基准测试本质的诚实回答:“Opus 5赢的那些评估是‘有边界的任务’——有明确预期结果,这正是它的强项。但这些评估没有测量任务的持续时间。一种理解方式是:Opus 5是基准测试能看见的最佳工具,而Fable 5是你需要处理超出基准测试范围的任务时才会使用的。”
Fable 5被描述为“最长的、最自主的任务”而设计,在这些任务中,模型需要在数小时或数天内保持连贯性,处理密集的源材料。发言人建议客户“在代表性工作负载上同时运行两者——一个有边界的任务和一个长周期任务”。这种“有边界任务 vs 长周期自主”的二分法,可能会成为2026年模型差异化竞争的关键轴线。当基准测试逐渐饱和,最难的问题已经不再是离散的谜题,而是持续多日的自主工作。
Token效率:企业AI投资的新战场
贯穿整个发布的主线是Anthropic希望买家吸收的一个观点:Opus 5不仅得分高,而且每美元得分高。早期客户的反馈异常具体。法律AI公司Harvey表示,Opus 5在达到Opus 4.8最大推理模式相似性能的同时,“平均生成Token减少了26%”。Fundamental Research Lab的Richard Pham称,在困难的金融建模任务上,该模型平均准确率高出9个百分点,“同时使用的调用次数和工具调用减少约三分之一,时间缩短60%”。
Zapier首席执行官Wade Foster表示,Opus 5在其AutomationBench排行榜上登顶,“比之前的Claude模型没有花费更多Token”,成功从头到尾完成了一个完整的客户流失预防工作流。Cognition公司(Devin编程智能体背后的公司)首席执行官Scott Wu说,在FrontierCode 1.1上,“Claude Opus 5以一半成本达到了接近Fable级别的性能”,尤其在调试和根因分析方面表现出色。
效率强调反映了商业现实。企业AI支出不再是实验性的,推理成本——实际大规模运行这些模型的价格——已经成为董事会层面的成本项。Anthropic的业务严重偏向API和企业使用;根据Contrary Research 2026年2月的分析,截至2025年底,Claude占据了约40%的企业大语言模型使用量,仅Claude Code一项的年化收入就达到约10亿美元。对于一家按Token收费的公司来说,能用更少Token做更多事的模型不是锦上添花,而是产品本身。
这正是AI投资逻辑正在转变的缩影:从追逐“最强大模型”到追求“最高性价比模型”。在AI赛道中,那些愿意在效率上做文章的公司,正在获得更大的企业市场份额。
自我验证智能体:自动化背后隐藏的成本真相
除了基准测试数据,Anthropic还在兜售一个行为故事:Opus 5会验证自己的工作,并迭代直到成功。公司提供了几个示例——从金融建模到代码调试——模型在首次尝试失败后会调整策略,而不是简单重复。这种“自我验证”能力对于智能体工作流至关重要,因为自主代理经常需要处理多个步骤,一旦某个步骤出错,后续结果可能完全偏离。
然而,这也引出了一个更深层的问题:自验证智能体看似减少了人工监督,但可能增加了推理成本。Anthropic通过“努力程度”设置让客户自行决定何时需要更深入的验证。这种设计思路与AI Agent技术的发展方向一致——让模型在成本与准确性之间找到最优平衡。
企业数字化转型中,许多企业已经在尝试用AI工具自动化重复性任务。但自动化真正的隐藏成本往往在于“失败后的修复”——如果模型在某个环节出错,人工介入的成本可能远超预期。Opus 5的自验证能力,本质上是在降低这种“失败成本”。AI工具导航上越来越多的企业用户开始关注这类特性,而不是单纯看模型评分。
对行业格局的影响:从“模型军备竞赛”到“分层服务经济”
Opus 5的发布标志着Anthropic在产品策略上的一次重要升级。不再试图用一个模型打天下,而是通过明确的分层满足不同场景:从最快的Haiku到最智能的Fable,再到最均衡的Opus。这种“分层服务”模式正在成为AI赛道的新趋势。
对于竞争对手而言,这意味着压力点从“谁的模型更聪明”转向“谁的模型在特定成本区间内更聪明”。OpenAI和Google势必会推出类似的分层产品。而对于创业公司来说,这可能是一个机会——专注于垂直领域的AI工具,可以在特定任务上实现比通用模型更高的性价比。
从企业买家的角度看,他们需要重新思考采购策略:是不是真的需要花高价购买顶级模型处理所有任务?还是应该根据任务复杂度选择不同层级的模型?企业数字化转型中,这种精细化的成本管理将成为标配。
Anthropic发言人最后总结道:“Opus 5是一个日常驱动者,一个你可以交给复杂任务并在完成后审查的模型。Fable 5则是你进行最雄心勃勃工作时才需要的。”这种表述暗示着,AI工具的未来属于那些能够帮助用户高效完成“日常复杂工作”的产品,而非仅仅比拼智力的玩具。
结语:AI经济学的新纪元
当推理成本成为企业IT预算中的显性支出,当“每美元智能”替代“绝对智能”成为评价标准,AI行业正在经历一场深刻的范式转变。Claude Opus 5的发布不仅是一个产品更新,更是一个产业信号:在AI投资中,效率已经比能力更重要。
对于希望利用AI工具实现降本增效的企业来说,现在是时候重新审视自己的AI投资策略了。与其追逐最新最强模型,不如花时间评估哪些任务适合用高性价比模型完成,哪些任务确实需要顶级智能。这种分层思维,将决定企业在AI赛道上的长期竞争力。