|
费控省钱 | 传媒集团AI治理专题 大模型集体涨价!传媒AI账单暴涨怎么省 |
AI 省钱、Token 成本、大模型统一管控,正在变成传媒集团 2026 年下半年绕不开的三个词。8 月 6 日,DeepSeek 在开发者后台挂出公告:计划近期整体上调 DeepSeek API 服务的定价,预计涨幅较大,并建议企业与个人开发者合理规划调用量、控制充值金额。距离它 7 月首次引入峰谷差异定价,只过去了大约三周。
对报社、广电、出版社、MCN 和内容工厂来说,这条公告的杀伤力不在于"贵了多少",而在于它宣告了一件事:靠低价红利硬撑的 AI 用法,走到头了。过去两年大家习惯的逻辑是"反正便宜,先用起来再说";从这个 8 月开始,账单会替你重新排一遍优先级。
更要命的是,很多传媒集团到今天都答不出一个最基本的问题:上个月我们烧掉的 Token,到底有多少是真正产出了能上版、能过审、能播出的内容?
先看这轮涨价到底涨在哪。DeepSeek 7 月引入的峰谷差异定价机制很直白:工作日高峰时段调用价格直接翻倍,夜间、周末、节假日维持平峰原价。以 V4-Pro 为例,若每日消耗 1 亿输出 Token,高峰成本直接翻倍。而传媒集团的 AI 使用曲线,恰恰死死压在工作日白天——上午选题会、下午出稿、傍晚赶播——几乎每一次调用都踩在最贵的那个时段。
供给侧同样紧张。OpenCode 于 8 月 3 日披露,8 月 1 日单日 DeepSeek V4 Flash 在其平台处理了 8 万亿 Token(5 万亿免费额度 + 3 万亿付费调用);8 月 4 日,V4 Flash API 因"前所未有的访问量"直接出现容量不足。OpenRouter 7 月 27 日至 8 月 2 日的周榜上,DeepSeek V4 Flash 以 7.22 万亿 Token 的周调用量位居全球第一。需求把产能顶到了墙上,价格自然要往上走。
这不是一家的动作。月之暗面 7 月 16 日发布的 Kimi K3,以未命中缓存输入及输出价计,输入价较前代涨超 3 倍、输出价涨近 4 倍;7 月 19 日更因"过去 48 小时请求量大幅超出预估"暂停 C 端新用户订阅,把算力全部保给已订阅用户。腾讯云 2026 年不到一个月内连续两次涨价,阿里云、百度智能云、智谱 AI 等国内头部厂商年内已集体调价。
底层的量级变化更说明问题:国内日均 Token 调用量已达 140 万亿,较 2024 年初增长超千倍;全球最大 API 聚合平台 OpenRouter 的 Token 用量一年翻了 10 倍。DeepSeek 官方给出的涨价原因也有三条:需求爆炸式增长(AI 智能体单任务 Token 消耗是传统对话 AI 的百倍以上)、高端 AI 芯片产能受限供应紧张、行业竞争回归理性——从补贴抢份额转向成本控制。
翻译成传媒集团听得懂的话:你的 AI 供应商正在从"拉新期"切换到"收成期"。等着谁家再来一轮补贴,不是策略;把自己这一侧的用量结构治理好,才是。
8 月 5 日有一则报道在技术圈刷屏:一位工程师用 AI 编程助手写了两小时代码,拿到 1200 美元账单。他做的事情并不夸张——调试、粘贴代码块、追问几个问题。就这些。
这不是孤例。同一批数据显示:2025 到 2026 年间,企业 AI 支出从年均 120 万美元飙升至 700 万美元,增幅 483%;有些 POC 项目在测试阶段 API 调用费不过 50 美元,一推到生产环境,月账单直接膨胀到 250 万美元。
为什么估不准?两个技术性原因值得所有传媒集团的财务和技术负责人记下来:第一,代码的 Token 消耗量是纯文本的 1.5 到 2.5 倍,很多团队直接用单词数推算 Token 量,结果预算偏差达三倍;第二,长会话中模型需要反复处理整个上下文,Token 消耗呈指数级攀升——你以为在追问一句话,实际上是把前面整段对话又重新买了一遍。
别以为这是程序员的问题。把"代码"换成"三万字采访速记""往期专题合集""品牌方给的 60 页 brief",传媒集团的账单机制一模一样。
| 失控形态 | 公开数据 | 传媒集团对应场景 |
| 短时高频追问 | 两小时调试追问 = 1200 美元 | 编辑与 AI 来回磨一个导语磨半天 |
| 试点到生产的断层 | POC 50 美元 → 生产月账单 250 万美元 | 一个栏目试跑很省,全集团铺开就爆 |
| 估算口径错误 | 按单词数推算,预算偏差三倍 | 用"稿子多少字"折算算力,年中就穿底 |
| 上下文滚雪球 | 长会话 Token 消耗指数级攀升 | 一篇深度稿改到第 9 版,前 8 版全在重复计费 |
这是本文最想讲清楚的一个悖论,也是绝大多数传媒集团费控方案失效的根源。
Spearhead 在 8 月 4 日发布的报告里给了两组看似互相打架的数字:一边是前沿模型的 Token 价格指数已经比 2023 年 3 月基准低了 88%,OpenAI 7 月 30 日还再度下调 GPT-5.6 分层价格;另一边是73% 的企业超出了 2026 年 AI 预算。
报告的核心结论只有一句:单价下降不会降低你的账单,只会抬高你的用量。
拆开看,有三重机制在同时推高传媒集团的 AI Token 成本:
机制一:智能体工作负载彻底击穿了预算表的假设。几乎所有企业的 AI 预算表,都是按"一问一答"的对话模式算出来的。但现在跑的是智能体——自动检索素材、自动比对事实、自动生成多版本、自动改写标题。DeepSeek 官方自己都说了,AI 智能体单任务 Token 消耗是传统对话 AI 的百倍以上。你的预算表用的是旧世界的单位,账单发生在新世界。
机制二:推理模型会为你"看不见的思考"计费。这是最容易被忽略的一块。模型在给出那 800 字成稿之前,可能已经在内部推演了几千个 Token 的思路。你看到的输出很短,你付的钱很长。传媒场景里凡是涉及"帮我判断这个选题有没有价值""这段表述有没有风险"的任务,都会大量触发这类隐性消耗。
机制三:长会话上下文的指数级攀升。一次深度报道的打磨往往横跨几十轮对话,每一轮模型都要把之前的全部上下文重新读一遍。第 20 轮的那句"再润色一下第三段",其真实成本可能是第 1 轮的十几倍。
这三重机制叠加起来,得出一个反直觉但极其重要的结论:传媒集团的 AI 省钱,不能指望在"单价"上做文章,只能在"用量结构"上做治理。跟供应商谈折扣、等下一轮降价,边际收益越来越薄;而把无效 Token 挤出去,是自己完全可控、且立刻见效的部分。
泛泛地说"要节流"没有意义。把传媒集团的 AI 用量拆到具体业务动作上,浪费的形态其实非常清晰。
1. 选题策划反复追问。一场线上选题会,编辑把行业背景、竞品报道、往期数据、领导偏好一股脑塞进对话,然后连问二三十个"还有没有别的角度"。每一次追问,前面那一大坨背景都被重新计费。真正沉淀下来的可能只有三个选题,但你为几十轮上下文反复付了钱。
2. 长篇稿件多轮改写。深度稿从初稿到定稿改八九版是常态。多数编辑的操作习惯是把全文粘进去再说"改一下第四部分"。全文进、全文出,改一处付全篇的钱,这是传媒集团最大的一笔隐性支出。
3. 视频脚本批量生成。MCN 和短视频团队一次要出几十条脚本,系统提示词里塞满了账号定位、口播风格、禁用词表、竞品参考。这段几千字的"前缀",会随每一条脚本被完整复制、完整计费几十遍。
4. 素材库检索问答。问一句"我们去年报过这家公司吗",系统把召回的十几篇全文一起喂给模型。绝大部分召回内容与问题无关,但都按 Token 收钱。检索精度不够,钱就替精度买单。
5. 评论区舆情摘要。逐条把原始评论(含大量表情、乱码、重复刷屏、无意义短句)灌进模型做摘要。这类格式噪声是最纯粹的浪费——它既不承载语义,也不影响结论,但每一个字符都在计费。
把这五类归纳一下,传媒集团的"无效 Token"其实就是五种形态:重复上下文、冗余系统提示、废弃分支、格式噪声、模型错配。前四种靠请求侧压缩解决,第五种靠模型路由解决。
| 传媒业务场景 | 无效 Token 主要形态 | 请求侧治理优先级 |
| 选题策划追问 | 重复上下文 + 废弃分支 | 高(上下文压缩) |
| 长稿多轮改写 | 全文重复入参,改一处付全篇 | 极高(片段化入参) |
| 视频脚本批量生成 | 超长系统提示被复制 N 遍 | 高(提示词瘦身) |
| 素材库检索问答 | 低相关召回全文入参 | 中高(召回收敛 + 压缩) |
| 评论舆情摘要 | 格式噪声、刷屏重复 | 中(清洗 + 低价模型) |
找到了浪费在哪,剩下的就是工程问题。51Tokens 在传媒客户侧跑通的路径,可以概括为三板斧。
第一板斧:请求侧自研保真压缩算法,压缩比 30%-70%。注意这里的关键词是请求侧——压缩的对象是进入模型之前的输入 Prompt 与上下文,把重复背景、冗余系统提示、格式噪声、已失效的历史轮次在网关层做结构化重组。这是自研保真压缩算法,语义不丢、效果不打折:编辑看到的成稿质量不变,变的只是账单上那串数字。对上面第 2 类"长稿多轮改写"和第 1 类"选题反复追问",这一层的收益最直接。
第二板斧:分级预算,把 Token 配额下沉到部门、栏目、记者。传媒集团现在的普遍状态是"全集团一个大池子,谁用了多少没人知道,用超了一起超"。分级预算做的事很朴素:按部门、按栏目、按个人分配 Token 配额,设置阈值超额预警,让每一个频道主编都能在月中看到自己这条线的消耗曲线。成本一旦可见,行为自然会变——这比发十封节约通知管用得多。
第三板斧:模型路由分级,别用顶配模型干杂活。Artificial Analysis 最新测评给出的价差已经到了必须正视的程度:
| 模型 | 相对成本档位 | 建议承接的传媒任务 |
| DeepSeek-V4-Flash | 入门档(基准 1×) | 评论清洗、标题批量试写、格式转换、素材打标 |
| Kimi K3 | 低档(约 6× 基准) | 长文摘要、口播稿初稿、检索问答 |
| OpenAI GPT-5.6 Sol | 中高档(约 13× 基准) | 复杂选题推演、多源事实交叉核对 |
| Anthropic Claude Fable 5 | 高档(约 22× 基准) | 头部深度稿终稿打磨、重大选题把关 |
同一份基准测试任务,入门档模型跑完的单位成本,只有头部模型的几十分之一;换算成同口径的相对档位,头部模型是入门档的十几倍到二十几倍。行业里那句流传很广的话说得很直白:永远不要用顶配模型的 Token,去干入门档模型就能干完的活。
传媒集团的现实是,绝大多数 AI 调用其实是"杂活"——改错别字、统一格式、生成十个备选标题、把速记整理成条目。这些任务派给低价模型,质量完全够用;真正需要顶配模型的,是那几篇要上头条、要过三审的深度稿。模型路由分级要做的,就是让这条分配规则从"靠自觉"变成"靠系统",通过统一网关自动派单,而不是让每个记者自己挑模型。
三板斧听起来清楚,但传媒集团真正卡住的地方往往在第一步:账都算不清,谈什么省。所以 51Tokens 的咨询落地服务,通常是从一次彻底的 Token 消耗盘点开始的,顾问陪跑四步走。
第一步,统一口径盘家底。把全集团散落在各个部门、各个供应商、各个账号下的调用全部归拢到统一网关,按真实 Token 计量而不是按字数估算——记住那个教训,按单词数推算会带来三倍的预算偏差。同时打开模型调用审计日志,让"谁在什么时间用哪个模型跑了什么任务"变成可查记录。
第二步,按场景切分消耗结构。把消耗归到上一节那五类业务场景上,算出每一类的占比和单位产出成本——一篇深度稿多少 Token、一条短视频脚本多少 Token、一次舆情摘要多少 Token。这一步做完,浪费在哪里通常一目了然。
第三步,重建预算模型并下发配额。基于真实单位成本重做预算表,把智能体工作负载、推理模型的隐性思考消耗、长会话衰减这三项显式写进假设里,再按部门和栏目下发分级配额与预警阈值。
第四步,把峰谷调度和复盘节奏固定下来。既然工作日高峰调用价格翻倍,那些不需要实时产出的任务——素材批量打标、往期内容重构、月度舆情汇总——完全可以排到平峰时段跑。再配上月度成本复盘会,让每一次预算变化都有归因。
这套动作跑完,传媒集团得到的不只是一份更便宜的账单,而是一套可以持续运行的 AI 费控机制:新工具接进来知道该走哪条路由,新栏目上线知道该给多少配额,季度涨价来了知道该动哪个旋钮。
DeepSeek 的这则涨价公告,本质上是给所有传媒集团发的一张提醒单:补贴期结束了,接下来拼的是治理能力。73% 的企业已经超出 2026 年 AI 预算,而模型单价还在往下走——这组数据足以说明,把希望寄托在"再等一轮降价"上的组织,明年只会超得更多。
更值得注意的是,AI 省钱、AI 合规、AI 考核这三件事,用的其实是同一套底座。统一网关让你算得清账,也让你留得下审计日志;请求侧的内容识别既能挤掉无效 Token,也能在敏感内容进模型前给出提示;分级配额既是成本工具,也是评估各部门 AI 应用深度的第一手数据。没有统一管控,AI 省钱只能靠自觉,AI 合规只能靠运气,AI 考核只能靠印象。
所以真正的问题从来不是"要不要少用 AI",而是"怎么让每一个 Token 都花在能上版、能过审、能播出的内容上"。少用 AI 会输掉效率,乱用 AI 会输掉成本和合规——这两条路传媒集团哪一条都走不起。
最后想听听你的:你们单位这个月的 AI 账单,能精确到部门吗?能精确到栏目吗?如果现在让你说出哪一类任务最烧钱,你答得上来吗?欢迎在评论区聊聊你们的 Token 治理现状——你踩过的坑,可能正是同行明天要交的学费。觉得有用,也请转发给你们分管技术和财务的同事。
—— 51Tokens,让每一个 Token 都花在能上版的内容上
51AIPro · 企业AI治理专家
安全·合规·可控·增效,AI 全流程治理一次布防
长按识别 · 关注公众号 |
长按识别 · 合作洽谈 |
官网 https://51aipro.com/