随着AI应用在各行各业快速渗透,企业内部的“Token狂欢”正从技术狂热演变为财务噩梦。微软工程师每月消耗数百甚至数千美元的AI Token,部分人的使用方式已走向极端——不计成本地大量调用模型,使实际消耗远超工作所需。这种被称为“tokenmaxxing”的行为,最终迫使微软执行副总裁杰伊·帕里克向全体员工发出“降温令”:不再一味追求调用次数,而是让每个Token发挥更大价值。

从“Token狂飙”到“价值回归”:微软为何叫停内部AI滥用

微软内部邮件揭露了一个令人震惊的现实:工程师们正在疯狂消耗AI Token,部分人的使用金额已高达每月数千美元。帕里克在信中明确表示:“我们并不鼓励tokenmaxxing。我希望大家把重点放在真正能为客户和业务带来改变的成果上。”为此,微软将价格较低的OpenAI GPT-5.6设为内部默认模型,并自2026年7月起为各部门设定AI Token预算目标,员工可随时查看个人AI支出。

这场“降火”行动并非临时起意。早在今年5月,微软就宣布取消大部分内部Claude Code许可证,要求工程师转用GitHub Copilot CLI,并限期在2026年6月30日前将Claude Code移出工作流程。微软的举措表明,即使是全球最大的AI技术推动者,也无法容忍无节制的资源消耗。帕里克强调:“我们的目标不是少用Token,而是让每个Token发挥更大作用。”这一理念与当前企业数字化转型浪潮中强调的“精准投入、高效产出”高度契合。

值得注意的是,微软并非要拖慢向“AI优先”企业转型的进程,而是希望通过精细化管理,让AI应用真正落地为业务价值。随着模型和产品不断变化,内部AI政策也会持续调整。这种动态平衡的思路,或许值得所有拥抱AI技术的大中型企业借鉴。

成本失控的警钟:Uber、亚马逊的AI预算惨案

微软的内部整顿并非孤例。Uber可能是最典型的“反面教材”。员工大规模采用Claude Code和Cursor等智能体编程工具后,Uber仅用四个月便烧光了原本规划到2026年全年的AI编程Token预算。这相当于提前两年半耗尽资源,背后的代价不仅是财务损失,更导致后续项目被迫中断或降级。

亚马逊的案例同样触目惊心。一套用于匹配作者资料和商品页面的内部Claude Sonnet系统,最终耗资180万美元(约合1217万元人民币),项目成本远超原定预算。更讽刺的是,投入巨资部署的系统最后只被用来处理一些简单琐事——用亚马逊内部工程师的话说,“就像用大炮打蚊子”。

这些案例揭示了一个残酷真相:当企业缺乏有效的AI Token管控机制时,AI技术很容易从生产力工具变成财务黑洞。Uber和亚马逊的遭遇并非孤例,据行业调查,超过60%的企业在部署AI应用后,成本超出预期30%以上。问题的根源在于:许多团队把AI视为“免费午餐”,忽视了每一次API调用背后的真实成本。

与此同时,科技产品经理们开始意识到,AI的边际成本并非零。一个简单的代码补全请求可能消耗数百个Token,而一个复杂的多轮对话可能轻松突破数千Token。当数千名员工同时高频使用时,月度账单就像滚雪球一样膨胀。微软的“tokenmaxxing”现象,本质上是对这种成本感知缺失的集体反应。

企业AI应用的正确姿势:从计费焦虑到ROI衡量

面对成本失控,企业需要建立一套科学的AI应用管理体系。微软的做法提供了三个关键杠杆:

第一,设定预算上限与分部门管控。 微软要求各部门自2026年7月起拥有独立的AI Token预算目标,员工可实时查看个人支出。这种“透明化+责任制”的方式,让工程师从“随意调用”转向“精打细算”。

第二,选择性价比最优的模型。 微软将GPT-5.6设为默认模型,而非最先进但成本更高的版本。在大多数日常任务中,轻量级模型完全能够胜任,且Token成本可降低50%以上。企业应根据任务复杂度动态选择模型,避免“杀鸡用牛刀”。

第三,建立AI使用审计机制。 帕里克在邮件中强调“留意Token是怎么花掉的”。这意味着企业需要像管理其他关键资源一样,定期审查AI调用记录,识别异常消耗模式。例如,某团队是否在重复调用同一接口?是否存在开发人员用AI生成与工作无关的内容?

对于中小企业而言,除了内部管控,还可以借助外部工具优化成本。例如,通过AI工具导航寻找性价比高的替代方案,或使用AI图片生成等专门工具处理特定任务,避免对通用大模型的过度依赖。此外,将AI应用到真正产生价值的场景——如抠图艺术签名等创意工具,往往比通用对话更能带来直接生产力提升。

科技产品的成本博弈:模型选择与预算管控

AI技术的成本构成正在重塑科技产品的定价逻辑。过去,企业购买软件通常是一次性支付或按用户数付费;如今,Token消耗量成为新的计费维度。这意味着,AI应用的使用频率和复杂度直接决定了企业的IT支出曲线。

微软的案例表明,即使是自家产品,也需要严格控制成本。这一趋势对科技产品开发者提出了更高要求:如何在功能和成本之间找到平衡点? 对用户而言,选择AI驱动型科技产品时,不仅要看功能,更要评估其Token消耗效率。有些产品虽然功能强大,但每次操作都会消耗大量Token,导致长期使用成本高昂。

一个值得关注的趋势是,越来越多的企业开始采用“混合模型”策略——对关键任务使用高性能模型,对常规任务使用轻量模型。例如,在创意设计领域,文生图工具可以快速生成灵感草图,而AI画图则适合精细调整;两者结合能大幅降低综合成本。同样,在编程辅助场景中,GitHub Copilot与Claude Code的切换,本质上也是成本与效率的权衡。

随着模型迭代加速,OpenAI、Anthropic等厂商不断推出不同价位等级的模型。企业需要建立自己的模型评估体系,像选择云服务一样选择AI模型。从长远看,大模型训练的成本下降会缓解部分压力,但短期内,精细化管理仍是唯一的出路。

AI技术未来:效率优先还是规模优先?

微软内部的“Token降温”行动,折射出AI技术发展路线上的根本分歧:是继续追求模型规模的无限增大,还是转向更高效的资源利用?

从技术演进角度看,GPT-4到GPT-5的参数规模增长并未带来同等比例的能力提升,而Token成本却指数级上升。这种“收益递减”现象迫使行业反思:AI技术是否也需要“绿色计算”理念? 微软选择将GPT-5.6作为默认模型,本质上是对“够用就好”原则的认可。

与此同时,AI Agent技术的兴起正在改变Token消耗模式。智能体编程工具(如Claude Code、Cursor)通过多轮自主推理完成任务,其Token消耗量远超传统问答式AI。Uber四个月烧光全年预算的案例,正是AI Agent高消耗特性的典型体现。这要求企业在部署Agent类应用时,必须设置更严格的调用上限和任务价值评估机制。

展望未来,AI技术将向两个方向并行发展:一是追求极致性能的“大模型”路线,对应高价值、高复杂度场景;二是追求极致效率的“小模型”路线,对应大规模、高频次应用。企业需要根据自身业务场景,在两者之间做出选择。微软的“预算管控+模型切换”策略,为行业提供了一种可行的参考范式。

结语:让AI应用回归商业本质

从微软的“Token降温”到Uber的预算崩盘,再到亚马逊的180万美元“教训”,这些案例共同指向一个核心命题:AI应用必须回归商业本质——创造实际价值,而非消耗资源自娱。

对于企业决策者而言,当下最紧迫的任务不是购买最先进的AI模型,而是建立一套完整的AI成本管控体系。这包括:制定Token使用指引、实施预算上限、定期审计调用记录、选择性价比最优的模型,以及培养员工的“成本意识”。

同时,AI服务商也应当反思:过度复杂的模型和激进的营销策略,是否在诱导用户进行不必要的消耗?微软内部的“tokenmaxxing”现象,某种程度上也是供应商导向的结果。只有当供需双方共同推动“有价值的使用”,AI应用才能真正成为推动商业增长的引擎,而非吞噬利润的财务陷阱。

最后,对于普通用户和开发者而言,合理使用AI工具、关注成本效益,不仅是企业责任,也是个人职业素养的体现。毕竟,在AI时代,会“省钱”的人,往往比会“烧钱”的人走得更远。