企业级人工智能正面临一个投资回报率悖论:在实验阶段,向最强的基础模型投入更多算力效果显著,但一旦产品上线,成本便迅速失控。Writer的研究团队发布了一项新成果,为工程团队提供了一套可落地的解决方案。该研究系统性地审视了基础模型外围的编排层——即AI Harness的优化,通过精准调整这一层,实现了每任务token消耗的大幅下降,单次成功任务成本降低最高达61%,且质量保持稳定,整个过程无需更换底层模型。由于编排层完全在开发者控制之下,且无需模型微调,工程团队可以立即应用这些发现,构建高性价比的AI应用。
人工智能的回报率悖论:tokenmaxxing的陷阱
当前AI工程领域正被“tokenmaxxing”现象困扰。所谓tokenmaxxing,是指开发者依赖巨大的上下文窗口和暴力token消耗来替代良好的系统设计,而不是构建优雅的工作流。他们沿用传统软件开发的惯性:生成、运行、失败、将错误信息和更多上下文塞回窗口、重试。这种模式在编码任务中常常奏效,因此成为所有智能体工作负载的默认反应。
Writer的联合创始人兼CTO Waseem AlShikh指出:“团队选择tokenmaxxing是因为这是当下最省事的修复方式,而且这几乎是大多数工程师现在的工作方式。”但危险在于,每token价格的下降掩盖了底层的效率问题。他解释道:“你的账单是每个任务的token数乘以每token价格,而大多数团队只关注第二个数字。在智能体工作负载中,每个任务的token数会复合增长——每次循环迭代都会重新传输不断增长的上下文,而且复合增长的速度快于价格下降的速度。”价格削减变成了麻醉剂,掩盖了循环本身在“流血”的事实。
Tokenmaxxing导致多种企业级失败模式:团队默认将简单任务路由到顶级模型;将大语言模型当作懒惰的搜索索引,把原始文档塞进上下文窗口而不是精确检索答案;最致命的是,构建无约束的智能体循环,当模型遇到错误时成本失控。由于所有主流模型供应商的输出token成本远高于输入token,低效的任务执行成为沉默的预算杀手。
行业引入了多种效率技术来遏制这些成本,但大多效果有限,因为它们孤立地看待模型:提示压缩节省输入空间,但忽略了系统在工作流中的序列化方式;预算推理限制模型计算步骤,但若工作流路由不当则降低输出质量;简洁编码强制模型输出最小化代码,但无助于解决低效的工具调用;推测解码用小型草稿模型加速大型模型生成,优化推理速度但无法解决臃肿的智能体架构。这些努力之所以失败,是因为它们优化了引擎却忽略了传动系统——没有关注编排层,导致底层架构效率问题依然存在。
优化编排层:比更换模型更聪明的选择
事实上,对于大多数企业AI应用而言,基础模型的选择已经趋于同质化,真正的差异化在于如何将模型编排成一个高效的工作系统。这就是编排层(Harness)的价值所在。Harness是位于基础模型之上的编排层,负责路由、格式化,并将底层LLM转化为可工作的系统。
Writer的研究明确表明:优化Harness带来的效率提升远超更换模型。在实验中,他们固定了6个不同厂商和规模的基础模型(包括Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1以及Writer自家的Palmyra X6),对比了常规生产智能体循环与优化后的Writer Agent Harness。在22个固定的企业级任务上,优化后的Harness将混合成本每任务降低41%(从21美分降至12美分),token消耗每任务下降38%(从14.2k降至8.8k)。
这一结果对于AI独角兽和AI投资具有重要意义。许多AI独角兽在早期靠大量调用模型获得增长,但当用户规模扩大后,成本迅速侵蚀利润。投资者也越来越关注单位经济模型是否可持续。优化编排层相当于在不牺牲性能的前提下,直接降低了运营成本,这是AI投资中非常关键的价值杠杆。
更值得关注的是,这种优化完全在开发者控制范围内,无需修改基础模型,也无需昂贵的微调。这意味着任何有能力的工程团队都可以立即应用这些发现。正如研究团队所言:“如果Harness是将模型调用组合成工作的层,那么它也是设定工作价格的层。”
实验数据:token消耗降低38%,成本下降41%
让我们深入Writer的实验细节。他们设计了一个“冻结”的常规生产智能体循环作为基线,与优化后的Writer Agent Harness进行对比。所有实验在完全相同的22个企业级任务上运行,涵盖检索与依据、多步骤工作流、工具使用和内容生成等能力。通过保持模型和任务不变,他们能够隔离编排层本身的影响。
实验结果令人印象深刻: - 混合成本每任务从21美分降至12美分,降幅41% - 每任务token消耗从14.2k降至8.8k,降幅38% - 任务成功率保持稳定,甚至在某些任务上略有提升
优化背后的关键设计之一是任务委派机制。Harness被设计为将搜索等任务委派给专门的子智能体。子智能体只接收它需要的工具和特定查询,检索精确数据,然后返回一个受限的、干净的摘要给主智能体。这样,主智能体的上下文窗口就不会被原始搜索结果填满。这种机制避免了大模型训练中常见的“上下文膨胀”问题,同时保持了检索的准确性。
另一个重要优化是系统提示缓存和交互历史压缩。传统做法中,每次对话都会将整个历史记录重新发送给模型,导致token消耗随时间线性增长。Writer的Harness智能地压缩历史记录,仅保留关键信息,同时利用缓存机制避免重复计算。在工具管理方面,Harness只在必要时才加载工具定义,而不是将所有工具描述塞进每次调用。
这些优化组合起来的效果远超单一技术。例如,单纯使用提示压缩只能节省约10-15%的输入token,但结合交互历史压缩和任务委派,整体token消耗可降低近40%。这证明了系统级优化的价值远大于模型级优化。
拆解“AI harness”:开发者的关键杠杆
对于工程团队来说,Harness优化提供了几个可立即操作的杠杆点。这些杠杆包括系统提示缓存、交互历史压缩、工具管理、检索策略和错误管理。它们是工程团队最容易介入的干预点。
历史上,开发者将Harness视为一次性胶水代码,仅仅用于连接API和用户界面。但这项研究标志着Harness必须被提升为一等公民:一个需要独立测试、版本管理和严格设计的主要软件工件。对于企业而言,这重新定义了“自建vs租赁”的决策。
AlShikh直言:“企业花费数月进行模型评估,然后租用现成的编排层——这意味着他们在优化较小的杠杆,而把更大的杠杆外包了。谁拥有Harness,谁就拥有了你的单位经济模型。一个为演示优化的开放框架,并不会为你的账单优化。”
在企业数字化转型的浪潮中,越来越多的企业开始意识到,单纯依赖外部模型供应商并不能解决自身成本结构问题。AI工具导航上涌现出大量编排工具,但很多仍停留在“demo”阶段,离生产级效率还有距离。有经验的团队已经开始自建轻量级编排层,或者基于开源框架深度定制。
从“租用编排”到“自建编排”:企业AI成本控制的新思路
企业AI应用的规模化部署面临一个关键抉择:是继续租用现成的编排解决方案,还是投入资源自建编排层?这项研究给出了明确的信号:谁控制编排层,谁就控制成本。
对于AI投资者而言,这提示了一个新的评估维度。在评估AI独角兽时,不仅要看模型能力,还要看其系统架构的效率。一个能够将token消耗降低40%的团队,其单位经济模型远比依赖暴力调用的团队健康。
具体来说,企业可以从以下几个方面着手: 1. 审计当前的token消耗结构:区分输入token、输出token、缓存命中率,找到浪费最大的环节。 2. 引入任务委派机制:将搜索、计算、格式转换等子任务拆分给专用子智能体,避免主模型上下文膨胀。 3. 优化交互历史管理:实施历史压缩、摘要化或阶段性存储,而不是每次重新发送全部历史。 4. 动态工具选择:根据任务需要动态加载工具定义,而不是加载所有工具。 5. 错误处理策略:设计收敛性更强的错误重试机制,避免无限循环。
这些优化并不需要更换模型或重新训练,因此成本低、见效快。Writer的实践表明,即使对于已经运行的生产系统,也可以通过调整编排层实现显著降本。
未来展望:AI投资从模型竞赛转向系统优化
随着基础模型的能力逐渐趋同,下一阶段的AI投资热点将从“哪个模型更强”转向“如何用更低的成本实现同样的效果”。这不仅是技术问题,更是商业问题。
Writer的研究为整个行业指明了一个方向:与其在模型选择上内卷,不如在系统架构上深耕。AI Agent技术的成熟使得编排层的重要性日益凸显。未来,我们可能会看到更多企业自研或定制编排层,就像当年互联网公司自研中间件一样。
对于AI工具开发者来说,这是一个巨大的机会。AI画图、文生图等创意工具也需要高效的编排来降低用户的使用成本。甚至抠图、背景去除这类工具,其背后也涉及多模型协作的编排优化。
总之,AI编排层的优化是当前企业AI应用中最具性价比的投入。它不需要昂贵的算力资源,不需要顶尖的AI科学家,只需要工程团队以系统思维重新审视现有的技术栈。这或许正是破解AI投资回报率悖论的关键钥匙。