Alibaba上周发布了Qwen 3.8-Max预览版,并高调宣称其性能仅次于Claude Fable 5,但发布当天的对比表格却显得模棱两可——在12项编程代理相关指标中,该模型仅在一项上领先。更令人困惑的是,一项独立测试却得出了几乎相反的结论:VulcanBench基准测试显示,Qwen 3.8-Max在最佳努力设置下仅处于中游水平,而默认设置下则排名垫底。
这两组结果都是真实且合理的,它们之间的巨大鸿沟源自一个经常被忽视的因素——时间与Token预算。这个差异之所以重要,是因为这些数字通常不会出现在头条新闻中。Alibaba的脚注为其编程测试设置了5小时的超时时间,在PaperBench上每次运行可达12小时;而独立测试工具VulcanBench仅允许45到60分钟的运行时间。Alibaba侧5到16倍的时间预算差距,完美解释了为何评测结论如此迥异。
这对于正处在AI写作工具选型期的企业和个人而言,是一个不容忽视的警示信号。本文将深入剖析这一现象背后的逻辑,并探讨如何建立更科学的AI模型评测体系。
基准分数为何不再可信?
当所有人都在关注Qwen 3.8-Max发布首周的价格对比时,一个更深层次的问题被忽略了:价格对比是当时唯一可获取的数据,但它远不能反映真实使用成本。价格上看,Qwen 3.8-Max并不便宜——DeepSeek-V4-Flash-0731每百万输入Token仅需14美分,输出28美分;而Qwen 3.8-Max则标价2美元和6美元;Kimi K3更是高达3美元和15美元。
然而,这些价格对比的参考价值正在急剧下降,原因在于推理模型(如Qwen)的特殊性:获取结果需要消耗大量“思考Token”。一个模型如果将其大部分Token额度用于内部推理,可能在写出答案之前就已达到Token上限,最终返回一个空结果——这在成本上与一次完整运行无异,但在产出上却与彻底失败无法区分。
Artificial Analysis有一项最清晰的公开测量数据:在最高努力设置下运行DeepSeek-V4-Flash,智能指数测试消耗了2.1亿个输出Token,而同类模型的中位数仅为1亿个。虽然由于Token单价极低,绝对成本仍然可控,但冗长输出消耗的不只是金钱,还有时间——在某些场景下,时间成本可能成为致命伤。
成本计算新范式:每成功任务成本
面对上述困境,业界正在呼唤一种更全面的度量方式:“每成功任务成本”——即总支出(包括所有失败尝试的花费)除以实际通过验收标准的任务数量。这个指标能够真正反映模型在真实工作负载中的经济性。
这一趋势与AI投资领域的风向转变不谋而合。过去,投资者关注模型参数规模和基准分数,现在则更务实,开始审视模型在既定时间与Token预算内的实际产出效率。企业数字化转型的推进,也让CIO们在选型时更看重可量化的业务成果,而非华而不实的榜单排名。
值得注意的是,一个失败的结果和一次预算耗尽是完全不同的事件,需要不同的解决方案。然而,几乎没有评测框架能区分这两者,也没有排行榜会公布这种分类数据。当笔者构建自己的代理基准测试时,发现测试框架仅仅记录“失败”而不记录失败原因,不得不自行添加区分逻辑。一旦你将它们分开,预算耗尽就会成为主导因素。
超时问题:被忽视的成本黑洞
7月发布的Long-Horizon-Terminal-Bench用一个共享框架对17个前沿模型进行了46项任务的测试,每个任务限时90分钟。结果显示,超时占未解决运行的79%,而Agent自行停止的占19%,框架错误仅占3%。作者谨慎地指出,超时的运行并非接近完成(平均奖励仅在0.10到0.35之间),因此不能假设更多时间就能成功。但核心教训是明确的:基准测试实际上在隐性地衡量时间效率,无论它们是否明确声明这一点。
最清晰的公开案例来自VulcanBench——就是那份将Qwen置于中游的报告。7月26日的报告显示,Claude Opus 5的最低努力设置反而是其最佳表现:解决了23个任务中的20个,而高努力设置仅解决18个。额外的推理并非无用——高努力设置返回的错误答案最少(1个对3个),但它却耗尽了时间,而超时得分为零。其三次性能回退中,有两次是在低努力设置能解决的任务上超时。即便给予无限时间,高努力设置也只能与最廉价的设置打平,成本却是后者的3.1倍。
这对任何构建路由阶梯(routing ladder)的团队都有直接启示。标准设计是当低成本尝试失败时,升级到更多推理能力的模型,假设更高层级一定更好、只是更贵。但在相当比例的模型与任务组合中,这一假设是错误的——你付出了更高层级的费用,却等来一个超时或Token耗尽的结局。
行业先行者与定价模式变革
过去几个月中,已有多家机构独立设计了“每成功任务成本”的度量方式,这强烈预示着它正成为行业标准。VulcanBench自早期报告起就将“每解决任务美元数”作为头条指标;Long-Horizon-Terminal-Bench将每任务成本与准确率并列展示,其中最具启发性的数据点是GPT-5.4——每任务成本约26美元,但通过率远低于Grok 4.5(约11美元)。TestEvo-Bench则让Agent在成本上限下运行,发现Claude Code的测试生成得分在更紧的成本上限下从71%降至44%。
商业公司已率先拥抱这一理念。HubSpot在4月将其Breeze Customer Agent的定价从每次处理对话1美元调整为每次解决对话50美分;Zendesk按自动解决次数收费;Fin则每次成果收费99美分,且仅在端到端成功解决后计费。
这些变化对AI独角兽企业的战略方向产生了深远影响。在AI投资热度不减的当下,那些能够将模型效率与经济性完美平衡的初创公司,正获得资本市场的更多青睐。未来的竞争焦点,已经从“谁更聪明”转向“谁更省心、更省钱”。
本周即可落地的调整策略
面对这一评测范式转变,企业和开发者可以从以下两个维度着手调整:
第一,将失败原因作为必填字段输出。 在每次Agent运行中,将预算耗尽、验证器失败和框架错误区分为不同的值,而不是简单的一个失败标志。在你能区分超时和错误答案之前,你的通过率实际上同时衡量了两件事,你无法确定该修复哪一个。
第二,按努力等级计算每成功任务成本。 不要只按模型维度计算,要将总支出(包括所有失败尝试的花费)除以在指定时间和Token预算内实际完成的任务数。这种“成本效率矩阵”能够清晰展示不同配置下的真实性价比,帮助团队做出更明智的决策。
对于内容创作者而言,选择AI写作工具时也应秉持同样的理念——不仅要关注生成质量,还要考虑生成速度、失败率和整体成本。高效的工具组合可能是AI工具箱中的多个专长工具协同工作,而非依赖单一全能模型。
未来趋势:从盲目追求高分到务实追求成功
模型评测的演进路径清晰地指向一个方向:从“分数驱动”转向“结果驱动”。正如我们看到的,Qwen 3.8-Max在宽松预算下表现优异,但在严格预算下却排名垫底——这并不意味着模型本身变差了,而是我们的评测视角变得更加全面和务实。
对于企业决策者而言,建立一套融合时间预算、Token成本和成功率的综合评估体系,已成为AI转型中的必修课。未来的模型竞争,将是在大模型训练成本不断攀升的背景下,谁能在单位成本内产出更多成功任务。
与此同时,AI Agent技术的成熟将进一步强化这一趋势——当Agent能够自主规划任务、控制预算并优化策略时,模型选择的重要性将让位于Agent编排质量。对于普通用户,AI画图等垂直工具也践行着同样的理念:用最少的时间成本生成最满意的结果。
也许,我们即将迎来一个“不唯分数论”的AI时代——一个更看重实际产出、更关注成本效益的时代。而这个时代,从理解“每成功任务成本”这个概念开始。