2026年6月,美国国防部曾高调宣布近半数员工(约175万人)正在使用AI工具辅助工作。然而不到一个月,陆军作战能力发展司令部(DEVCOM)的员工就收到一封紧急邮件:由于token消耗过快,原定的“无限token”计划被迫中止,使用量被重新限制。这一戏剧性转折,不仅让军事机构的AI部署蒙上阴影,更向所有正在拥抱AI工具的企业敲响了警钟——所谓的“无限Token”,很可能只是一场美丽的误会。
无限Token神话破灭:美国陆军AI工具使用量触顶
6月初,美国陆军首席信息官(CIO)宣布为全军提供“无限token”的AI服务,承诺员工可以无限制地使用Ask Sage平台进行文本生成、图像分析、代码辅助等任务。然而仅仅两周后,CIO的token池就宣告耗尽,不得不紧急恢复限额。
根据DEVCOM内部邮件,虽然陆军决定在现有水平上续订token,但10月1日之后是否还能继续获得充足配额仍是未知数。一位匿名陆军员工向媒体透露:“整个陆军在一个月内烧光了全年的token配额,这就像把一年的汽油在一周内全部用完。”
这种“短暂狂欢”式的消耗,本质上源于AI工具背后的大语言模型(LLM)运行成本。Ask Sage是一个多模态生成式AI平台,整合了Google Gemini、Meta Llama、OpenAI ChatGPT等主流模型。每次用户提问、生成图片或分析文档,都会消耗一定数量的token——而token就是调用模型能力的“货币”。
更值得关注的是,陆军并非唯一遭遇token瓶颈的机构。据《华尔街日报》此前报道,多家大型企业在引入AI工具后,季度AI支出普遍超出预算30%至50%。AI工具导航上收录的数百个企业级AI应用,几乎都面临类似困境:用户越多,成本越难以控制。
从“无限”到“限额”:Ask Sage平台与Token消耗的真相
Ask Sage平台的设计初衷是让军队员工能够一键调用多种LLM,无需切换账号或学习不同接口。但正是这种便利性,加速了token消耗。邮件显示,员工们大量使用AI生成报告、起草邮件、分析情报摘要,甚至用于简单的日常查询——比如“今天天气如何”或“下一场会议几点开始”。这些低价值请求占据了大量token,导致真正关键任务(如作战模拟、实时翻译)的资源被挤占。
陆军CIO团队并非没有预警。他们设定了一个“公平使用”上限,但直到6月token池耗尽,才发现实际消耗速度远超预期。大模型训练的成本结构决定了token的单价难以降低:每个请求都需要调用数亿参数的模型进行推理,GPU服务器电费、冷却费用、模型维护成本全都摊在token单价里。
从AI技术解析的角度看,Token是LLM处理文本的基本单位。一个中文汉字大约对应1-2个token,一段300字的报告可能消耗500-800个token。如果全陆军3.5万用户每人每天发送50个请求,每个请求平均消耗1000 token,那么单日消耗就高达17.5亿token。以一个中等规模企业级AI套餐(每百万token约0.5美元)计算,年费用可能飙升至数亿美元。
陆军显然低估了这种“人人可用”的诱惑力。当员工发现AI工具比手动打字快10倍时,使用频率立刻暴涨。这正是所有部署AI工具的组织必须面对的第一道坎:如何平衡易用性与成本控制。
AI技术解析:Token机制如何影响企业级AI部署成本?
要理解陆军token耗尽的本质,就需要深入AI原理中最基础的概念——Token。在LLM中,Token是模型输入和输出的最小单元。一切文本、代码甚至图像(通过多模态编码)都被拆解为Token序列。模型每生成一个Token,都要进行一次精密的概率计算。
这意味着,Token消耗直接对应计算资源消耗。企业购买AI工具时,通常有两种计费模式:按Token用量付费(如OpenAI API)或订阅固定Token池(如Army的Ask Sage)。订阅模式看似“无限”,实则设定了隐性上限——当所有用户同时满负荷使用,Token池就会迅速见底。
AI技术解析还揭示了一个关键问题:不同任务的Token消耗差异巨大。简单问答可能只需几十个Token,但生成一篇完整的分析报告、或者让AI“思考”复杂逻辑链(Chain-of-Thought),消费可能高达数千Token。陆军员工若大量使用AI进行深度推理,token消耗速度会成倍增加。
更棘手的是,企业难以实时监控每个用户的Token使用情况。陆军CIO直到6月才发现池子干了,说明缺乏有效的预警机制。企业数字化转型中,AI工具的导入往往伴随着“黑盒”风险:管理者知道总支出,却不知道每个请求的价值。
AI原理浅析:大语言模型为何无法真正做到“无限使用”?
从AI原理角度,LLM的“无限使用”本身就是一种悖论。模型推理需要消耗物理资源(GPU算力、电力、带宽),而这些资源是有限的。即使云服务商采购了海量GPU,全球数据中心依然面临芯片短缺和电力限制。
更关键的是,LLM的推理成本远高于传统软件。传统软件写1000行代码,边际成本几乎为零;但LLM每生成1000个Token,背后就是一次完整的神经网络前向传播。这导致AI工具天生具有“按量付费”的特性。
一些AI厂商试图通过模型蒸馏、量化、缓存等技术降低成本,但效果有限。例如,将大模型压缩为小模型后,推理速度提升但准确率下降,用户可能因此反复请求,反而增加Token消耗。AI原理的另一个重要约束是“上下文窗口”:长对话会消耗大量Token,且无法通过简单缓存解决。
陆军案例恰好说明,AI工具在组织内的普及会形成“需求弹性”:当用户发现工具免费且无限时,他们会创造大量低价值请求,直到系统崩溃。这种行为经济学中的“公地悲剧”,在AI工具领域得到了完美复刻。
军事场景下的AI工具:效率与安全的双重考验
陆军并非唯一在AI工具上栽跟头的军事机构。2025年,美国空军曾因AI工具误生成包含敏感信息的报告而紧急叫停;2027年,海军则因token超支导致预算重组。这些案例表明,军事AI部署面临比企业更复杂的挑战:
首先是数据安全。Ask Sage平台虽然运行在军事专用云上,但员工使用公开大模型(如ChatGPT)时,可能无意中泄露机密信息。AI工具在军事中的另一个风险是“幻觉”——模型可能生成看似合理但完全错误的战术建议。
其次是成本效率。陆军每年AI预算约12亿美元,但其中40%被用于非核心任务(如撰写公函、生成PPT)。一位退役军官在博客中写道:“我们花了10亿美元让AI帮士兵写请假条,而不是分析卫星图像。”这种资源配置的扭曲,正在促使国防部重新评估AI工具的使用规范。
有趣的是,一些军事部门已经开始尝试用AI画图和文生图工具辅助战场态势感知。例如,将侦察数据转化为可视化地图,或生成模拟训练场景。但这些工具同样消耗大量token,且需要专用模型微调。
未来展望:AI工具在企业中的可持续发展路径
陆军token耗尽事件并非孤例,而是AI工具规模化部署的必然阵痛。要避免“无限Token”变成“一秒Token”,企业需要从三个方面重构AI策略:
第一,建立分层定价机制。将AI工具的使用权与任务优先级挂钩。例如,核心业务(如研发、客户服务)分配高优先级token池,日常办公(如文档润色)使用低优先级共享池,超额后自动延迟或降级。
第二,引入智能监控与配额管理。利用AI自身来监控AI使用行为,识别异常消耗(如单个用户连续发送1000次相同提问),并自动触发限流。AI工具箱中已有多种SaaS服务提供此类功能。
第三,探索混合部署模式。将轻量级任务(如翻译、摘要)交给本地小模型,将复杂推理任务(如合同审查、代码生成)保留给云端大模型。这样既能保证响应速度,又不会因所有请求都挤占大模型token而超支。
最后,企业需要培养“AI节俭文化”。正如陆军员工后来被要求“每次使用前先问自己,这个请求真的需要AI吗?”——这种思维转变,可能比任何技术方案都重要。
AI工具的普及是一场马拉松,而非百米冲刺。陆军在6月的这次“踩刹车”,恰恰为所有组织提供了一个宝贵的压力测试样本:当人们可以无限制使用AI时,我们是否真的准备好了?