|
行业复盘 | AI服务商AI治理专题 一晚烧掉200万!智能体Token黑洞全复盘 |
2026 年 5 月底一场行业峰会上,米哈游《崩坏》系列技术负责人郑银河透露了一个数字:内部一位工程师为了「试一试 Agent 协作的极限」,搭了几套 Agent 协同跑任务——一个晚上烧出 200 万元 Token 账单。Token 黑洞从此不再是个比喻,是当天晚上 IT 同事看着计费告警集体失眠的真实事故。
这不是孤例。OpenAI 内部实验中,3 人团队指挥 100 个 Agent 协作,30 天烧掉 6030 亿词元、130 万美元;硅谷某企业无限制开放 AI 权限,月消耗词元折合 5 亿美元——AI 服务商与使用方同时站在同一个十字路口:智能体已经能让单任务 Token 消耗放大 10 倍以上,但绝大多数企业还没建起配套的成本护栏。
米哈游那位工程师的动机并不复杂:Agent 协作是 2026 年最热的工程范式之一,他想测一把「多 Agent 分工能不能把复杂任务拆得更快」。他在内部沙盒里搭了几个 Agent,分别负责任务规划、信息检索、代码生成、结果校验,让它们循环对话、互相调用。
问题出在两件事:第一,每一次 Agent 调用都把前序对话历史、工具日志、文件内容当作上下文重新塞给模型——同一份信息被反复计费;第二,Agent 之间的「沟通」需要不断复述任务背景与格式化结论,相当于多付了一笔「沟通税」。一晚上跑下来,Token 计数器的指针跑到了 IT 同事眼皮底下——账单 200 万元。
把这次事件背后的机制摊开,智能体 Token 失控不是偶发,而是结构性问题。腾讯研究院在分析智能体典型低效消耗时,归纳出四类乘积效应:
• 上下文陷阱:智能体每一步操作都会重复带入历史对话、工具日志和文件内容,同一批信息被反复计费。米哈游案例里,单个 Agent 调用一次的上下文窗口就可能超过普通聊天的 50 倍。
• 技能 Skill 冗余:对 49 个软件工程技能的基准测试显示,79.6% 的技能对任务通过率没有任何提升,却最高带来 451% 的 Token 开销增长。智能体加载的技能越多,「无意义调用」越多。
• 多 Agent 沟通税:多个智能体分工协作时,会不断重复任务背景、结论和格式化套话,每一次对话都是一次重复计费。一晚 200 万账单的相当一部分,来自这种「Agent 之间互相抄作业」。
• 长任务的「熵增」:任务链条越长越容易跑偏,为了纠偏又要增加摘要、检查、回滚机制,进一步推高消耗。智能体不是一次性工具,是会「自己追加工作量」的系统。
这四类损耗不是简单加和,而是互相叠加的乘积效应。一晚 200 万只是被点着的引线;如果没有成本护栏,整月跑下来就是千万级。
复盘这种事件,最容易陷入「谁的锅」之争。理性看,三方都有责任:
• 工程师:Agent 协作是新工具,需要配套成本护栏再上生产。把 Agent 直接上生产而不设上限,是工程纪律问题。
• 模型厂商:GPT-5.5、Claude Opus 4.8、GLM-5.2 等模型输出定价远高于输入(输出 30 美元 / 百万 vs 输入 5 美元 / 百万),智能体场景下输出占比高,模型计费结构放大了 Token 黑洞。
• 企业管理:缺乏请求侧成本告警、缺乏 Agent 调用配额、缺乏 AI 绩效考核——AI 治理缺位才是事故土壤。
把米哈游这次事件当镜子,AI 服务商与使用方应在三天内补齐四件事:
平台系统层面,51Tokens 请求侧自研保真压缩 + 分级预算 + 八维 AI 考核引擎三件套可直接落地;培训课程层面,51Tokens 培训针对 AI 服务商的研发、测试、运维团队开设「Agent 协作成本课」;咨询落地层面,51Tokens 咨询陪跑 Agent 项目的预算设计与上线前成本护栏评审。
回到米哈游那一晚——它本来可以只是一个凌晨的工程师实验,不应该变成 IT 团队的惊魂夜。问个最直接的问题:你们公司 Agent 任务目前有没有独立 Token 预算?如果没有,今天下班前值得花十分钟设一个。欢迎在评论区告诉我们。
—— 51Tokens,让 AI 治理从「靠人」走向「靠系统」。
51AIPro · 企业AI治理专家
安全·合规·可控·增效,AI 全流程治理一次布防
长按识别 · 关注公众号 |
长按识别 · 合作洽谈 |
官网 https://51aipro.com/