省钱 | 企业AI费控专题
大模型账单正在反噬每一个集团。过去半年,Token成本暴涨、AI账单失控、企业Token节流成了 CFO 与技术负责人群里的高频词。大模型账单不再是边缘部门的内部账,而是直接烧穿年度预算的显性支出。当腾讯、字节、阿里集体收紧额度,当 Uber 四个月烧光全年 AI 预算,集团企业的 AI 费控,已经从"要不要用"变成"怎么管得住"。
过去半年,国内头部科技公司不约而同地做了一件事:给内部 AI 调用"上紧箍咒"。这不是个别部门的降本实验,而是平台级、集团级的统一动作。
腾讯自 2026 年 6 月起调整内部 AI Token 额度,从过去的固定配额,改为按部门、按岗位、按任务场景做差异化动态分配。一个值得注意的细节是,腾讯明确表态不搞 Token 消耗量排名——也就是说,把"谁用得多"从考核指标里拿掉了,避免内部为冲排名而空耗。
字节跳动则给了 AI 研发岗更大的灵活性:允许审批外采 API,基础额度免费,超额部分按需申请报销,非工作用途一律自费。这一"分级供给 + 私人自费"的组合,把私人消费和研发预算做了硬隔离。
百度依业务优先级做差异化配置,对非核心场景直接限流。逻辑很朴素:好钢用在刀刃上,非核心调用就该让位给高价值任务。
阿里云的动作更市场化。2026 年 6 月推出 Agent 产品"峰谷 Token",把夜间 22:00 到次日 8:00 的算力价格压到两折。用"错峰用算"的思路,从供给侧帮企业把单价打下来。
四家公司的动作方向高度一致:不再无条件供给,而是按价值分配算力。额度,从"福利"变成了"治理工具"。
为什么大厂要集体收紧?因为不收紧,账单就真的会失控。集团企业 AI 账单失控,从来不是单点故障,而是四个机制叠加发酵的结果。
第一,用量黑盒。员工和 Agent 用个人账号、自购 Key 直连大模型,IT 部门看不到、财务部门算不清。一笔笔调用像地下水一样悄悄流失,月底对账单时才发现窟窿已经很大。
第二,预算配额缺失。很多集团根本没有建立"谁能调、调多少、超了怎么办"的规则。没有配额,就等于敞口供水,没有人对总量负责。
第三,模型选择错配。用旗舰大模型去做"分类、抽取、摘要"这类轻任务,是典型的杀鸡用牛刀。模型能力与任务难度不匹配,成本天然虚高。
第四,杰文斯悖论。这是最容易被忽视、也最反直觉的一条。模型单价降了,单位 Token 更便宜了,按常理总账单应该下降。但现实是,单价越便宜,调用量就越百倍地涨,最终总账单不降反升。便宜,反而让人更敢浪费。
【分析】杰文斯悖论为什么让 AI 账单越省越贵
十九世纪,蒸汽机效率提升让煤炭单价下降,结果总煤炭消耗反而暴涨——因为用得起的人更多了,能烧的地方也更广了。今天的大模型一模一样:当一次 API 调用的成本从几分钱降到不到一分钱,业务线就不再珍惜每一次请求,Agent 开始 7×24 小时无脑轮询,Copilot 把整本文档塞进上下文反复重算。单价下降释放出的"浪费空间",最终被百倍增长的调用量填满。这不是技术故障,而是经济规律。治理的关键,不是阻止降价,而是把"省下来的单价"用配额和审计重新收归可控。
奇安信 X 实验室也持类似观点:员工与 Agent 以个人账号、自购 Key 直连大模型,带来的是用量黑盒、预算配额缺失与模型选择不匹配三重治理缺口。这恰好解释了,为什么"企业Token节流"会突然从技术话题升级为管理议题。
光讲机制太抽象,看两组公开的真实数据,账单的体感会更直接。
Uber 的教训足够典型。2026 年,Uber 全年 AI 预算仅用四个月就彻底耗尽。更刺眼的是结构:单个工程师的月均 AI 开销在 500 到 2000 美元之间波动,差距高达四倍,说明内部调用极不均衡、毫无章法。紧急之下,Uber 只能划定"单人单工具月上限 1500 美元"的硬红线。但这只是事后补救,前面烧掉的预算已经回不来。
Meta 的数字更夸张。2026 年 3 月,Meta 内部上线了一个叫"Claudeonomics"的榜单,规则简单粗暴:消耗 Token 越多,排名越高。结果员工疯狂刷 Token,内部 Token 消耗从约 6 万亿一路飙到 73.7 万亿——暴涨约 12 倍。榜单很快被撤下,但代价已经产生。到 2026 年 6 月,Meta 向约 6000 名员工发备忘录设上限,内部测算仅当年内部 AI 支出就将达数十亿美元。
Uber 和 Meta 的故事说明同一件事:没有治理的额度自由,最终都会变成账单灾难。一个靠事后封顶,一个靠榜单翻车,都不是治本之道。
把国内外放在一起看,治理思路出现明显分野,这对集团选型很有参考意义。
国外的典型做法是硬封顶。Uber 划 1500 美元红线,Meta 发备忘录设上限,本质都是"先放开、超了再砍"。这种方式的优点是简单直接、见效快;缺点是滞后、粗暴,往往在账单已经失控后才反应,且容易误伤正常研发。
国内的典型做法是动态调配。腾讯按部门岗位场景差异化分配,百度按业务优先级限流,阿里用峰谷价格引导错峰——本质都是"事前分层、按需供给"。这种方式更精细,但前提是集团要有清晰的场景画像和分配能力。
更深一层,是计费模式的差异。国外很多团队习惯了按量计费、用多少付多少,预算意识弱;国内集团更习惯预算制,先定盘子再花钱。按量计费让人对单价敏感却对总量麻木;预算制让人对总量负责,却可能牺牲灵活性。
【分析】硬封顶是止血,动态调配才是造血
硬封顶像给漏水的水管直接关总阀——能止住损失,但也停了正常用水。它解决不了"为什么漏"的问题,只会让团队在额度边缘反复试探、找漏洞绕过。动态调配则像装了分户水表和阶梯计价:谁用得多、用在哪、值不值,一目了然,再按价值重新分配。前者治标,后者治本。对多业务板块的集团来说,业务差异极大,统一硬封顶必然误伤高价值场景,因此动态调配加分级预算,是更贴近集团现实的那条路。
AI 账单的压力,不会停在集团内部,它会沿着产业链一层层传导,最终改变整个生态的定价与协作方式。
最上游是云厂商。当大客户开始收紧额度、精打细算,云厂商的算力销售增速会放缓,于是阿里云们才急着推"峰谷 Token"这类错峰产品,用价格手段保住用量。
中游是SaaS 与 Agent 服务商。它们的成本结构里,大模型调用占大头。当下游集团要求"降本",SaaS 厂商只能把压力转嫁到自己的模型选型与调用优化上,否则利润就被 Token 吃掉。
最下游是企业管理本身。CFO 开始把 AI 支出纳入正式预算科目,IT 部门被要求出具用量报表,合规部门介入数据出境与审计。AI 从一个技术议题,彻底变成一道管理议题。
【分析】账单传导的本质,是管理权从技术向财务迁移
过去,AI 花多少钱由工程师说了算,因为别人看不懂。现在,账单大到不可忽略,决策权必然上移到 CFO 与 CIO。这场传导不是成本简单挪位,而是企业内部权力结构的重新洗牌:谁能把 AI 用量讲清楚,谁就掌握预算话语权。这也解释了为什么"用量审计"成了当下最被渴求的能力——它不是炫技,而是财务接管 AI 的刚需工具。
说了这么多困境,集团企业到底该怎么管?51AIPro(旗下 51Tokens 管控平台)的思路,是先把"看不见的账"变成"看得见的账",再谈省钱。治理顺序不能反。
核心抓手之一是请求侧自研保真压缩。注意,这里压缩的是输入侧——也就是 Prompt、上下文、长文档这类请求内容。51AIPro 自研保真压缩算法,压缩比约 30%—70%,语义不丢、效果不打折,仅作用于请求侧,绝不涉及压缩输出与响应 Token。这意味着在不改变模型回答质量的前提下,把"喂给模型的原料"先瘦一遍身,账单自然下来。
其二是分级预算。按部门、岗位、任务场景设定额度与优先级,把腾讯、百度已经在做的差异化分配,沉淀成可配置、可执行的平台能力,让规则从"人盯人"变成"系统管"。
其三是用量审计。把分散在个人账号、自购 Key 里的调用,统一归集、统一视图,让 CFO 第一次能看清每一笔 Token 花在哪、花得值不值,终结"用量黑盒"。
需要特别说明三点。第一,51AIPro 是治理管控平台,不替代企业既有 DLP/SIEM 体系,也不承诺 100% 合规——它是既有安全体系的补充,而不是替代品。第二,实时拦截与审批这类策略引擎能力,是 51AIPro 当前治理理念的下一站缺口,我们只在理念层面探讨,不夸大、不承诺现成能力。第三,面向治理领域的专用 AI 治理大模型,51AIPro 后续将推出(治理领域专用、非通用),目前尚未上线。
把上面的分析落成动作,建议多业务板块集团按五步走,先治理、再优化:
第一步,摸清家底。先用用量审计把分散的调用归集起来,搞清楚钱到底花在哪、被谁花、花得值不值。没有数据,一切免谈。
第二步,场景分级。把 AI 调用按业务价值分成核心、常规、边缘三档,核心场景保供给,边缘场景限流或错峰。
第三步,装上压缩。对长上下文、长文档类请求,启用请求侧保真压缩,在不损效果的前提下直接削减输入 Token。
第四步,设分级预算。按部门岗位场景分配额度,建立"超了怎么办"的明确规则,杜绝敞口供水。
第五步,常态化审计。把 AI 支出纳入月度经营会,让用量报表成为固定议题,形成持续治理闭环。
最后留一个问题给大家:你的集团,现在能在一张表里看清全部 AI 账单吗?欢迎在评论区聊聊你们是怎么管 Token 的,又踩过哪些坑。我们会把有价值的实践整理成后续专题。
51AIPro · 企业AI治理专家
安全·合规·可控·增效,AI 全流程治理一次布防
长按识别二维码,合作洽谈请扫码联系
官网 https://51aipro.com/
AI 省钱 · AI 合规 · AI 考核——51AIPro 让企业把 AI 用得安心、过得了审(安全·合规·可控·增效)。