|
AI考核管理 | 科技企业AI治理专题 AI使用率成KPI,员工被逼疯了 |
员工滥用AI、AI绩效考核跑偏、AI使用率KPI逼疯打工人——2026年8月初,「公司为了AI已经疯魔了」「财务被AI逼跑」两个话题接连挂上热搜,企业AI治理的第一道坎,不在技术,在考核。
评论区里那些话,扎心得不需要任何加工:「考核标准里增添了一项AI使用率的指标,年终奖要看一只龙虾的脸色。」——那只"龙虾",指的是智能体 OpenClaw。还有人说,「强制员工应用尽用、严禁手搓,甚至要把AI使用率和使用时长纳入考核。」
先看几段真实吐槽,它们比任何调研报告都更能说明问题。
第一类,是岗位与工具的错配。老板非要让财务用AI做账,"财务被AI逼跑"因此登上热搜。财务是典型的高确定性、强对账、零容错岗位,AI生成的每一个数字都要人工回头核一遍,用AI不但没减负,反而多出一道校验工序。
第二类,是为了向上汇报而制造的动作。有人写道:"领导以为AI是万能的,一大堆人为了向上汇报每天研究怎么做skill。" 本职工作没变少,只是多了一项"证明自己在用AI"的任务。研究怎么做skill本身不创造业务价值,它创造的是汇报素材。
第三类,是效率悖论。一位打工人的原话是:"以前你花2小时写的东西,现在AI 10分钟出初稿,但不代表你可以早下班——组织会觉得既然这么快,那给我出三个版本的对比吧。公司的效率是高了,但自己一点活都没少干。"
这句话值得拆开看。AI确实把单次产出的时间成本压下来了,但组织没有把省下的时间还给个人,而是立刻把它转化成了更高的产出预期。效率红利被组织单方面吸收,个体感受到的只有节奏加快。
第四类,也是最容易被管理层忽视的一类,是角色的悄然降级。大模型至今仍难以深度适配细分业务场景,产出普遍需要员工二次核对与修正。结果是:员工只是从"生产者"变成了"审核者",企业并没有真正解放人力。更麻烦的是,审核往往比生产更耗心神——生产是从零到一,审核是从一堆看似正确的内容里,找出那处不对劲。
把这四类叠加起来,就能看懂"疯魔"二字从何而来:多数企业对AI的使用还停留在浅层文案、代码辅助层面,没有搭起完整的AI业务闭环,却已经先把AI使用率写进了考核表。
这件事有个专门的词,叫 Tokenmaxxing。它由 token 和 maxxing(刷到极致)拼成,和 gymmaxxing(猛练健身)、looksmaxxing(极致改造外貌)是同一套造词逻辑。它描述的是一种被扭曲的激励机制——把AI用量当成企业内部的KPI,说白了,就是员工为了用AI而用AI,疯狂刷Token。
这个词不是中文互联网的自嘲,它有清晰的海外样本。
2026年3月,Meta、OpenAI 等公司的员工,已经开始在内部排行榜上比拼Token消耗量;一些公司还把更高的Token预算当作工程师福利,鼓励员工同时启动多个 Agent,把更多工作交给AI。
2026年5月,亚马逊内部上线了一个叫 KiroRank 的排行榜,按员工在自家AI开发平台 Kiro 上的使用量打分。初衷是善意的——鼓励工程师多用AI工具,用得越多,排名越高。
国内的版本更直接:AI使用率、AI使用时长,直接写进KPI,年终奖挂钩。
形式不同,内核完全一致:它们都在考核"投入",而不是"产出"。 排行榜比的是谁烧得多,KPI比的是谁用得勤,没有一项在问"你用AI解决了什么问题、创造了多少价值、少犯了几个错"。
值得注意的是,最先踩下刹车的,恰恰是把AI用得最狠的那批公司。微软已在8月初的内部信中明确表态:"Tokenmaxxing 不是我们优化的目标。" 一句话,把方向掰了回来。
很多管理者的第一反应是:"员工怎么这么不自觉?"这个判断从一开始就搞错了对象。
管理学里有条老规矩:当一项指标变成目标,它就不再是一个好指标。 员工刷Token,不是态度问题,是理性人在错误规则下的最优解。指标怎么设,行为就怎么长——这是制度的确定性后果,不是人品的偶然波动。
把AI使用率写进KPI,至少同时犯了三个错配:
第一,把投入量当成了产出量。 Token消耗、调用次数、使用时长,全都是成本侧、投入侧的量。用它们衡量绩效,等价于用"耗电量"考核车间效率、用"打字字数"考核程序员水平。投入越多绩效越好,这条规则本身就在鼓励浪费。
第二,把工具使用当成了创新能力。 科技公司组织文化推崇"拥抱新技术",很容易把工具使用量误当创新度。但会开车不等于跑得快,AI用得多也不等于业务想得清。工具是手段,指标却把它抬成了目的。
第三,把岗位差异一刀切了。 研发、测试、文档、客服、设计的AI适配度天然不同,财务、法务、风控这类高确定性岗位更是如此。用统一的"使用率"横向排名,等于强迫最不适合用AI的岗位,去和最适合的岗位比谁用得多。
规则一旦这样定下,刷量的路径就写好了:一次能问清的问题拆成十次问;把整份文档反复粘进上下文;同时开一堆Agent空跑;已经写完的东西再让AI改一遍,只为留下调用记录。 每一步都合规,每一步都无效。
更具破坏性的是逆向淘汰:一位真正资深的工程师,可能一个精准的提示词就把问题解决了,Token消耗全组最低——在使用率排行榜上,他排最后。而那个把简单需求反复喂给最贵模型的人,排第一。当考核开始惩罚高效者、奖励低效者,组织的能力结构就会被慢慢拧反。
刷量不是无害的形式主义,它会实实在在地从三个方向掏空企业。
代价一:算力成本被无效调用吃掉。 科技公司本身就是AI的重度使用方——研发、测试、文档、客服、设计全链路调用大模型,Token消耗基数远高于传统行业。更棘手的是,科技公司同时又是AI的售卖方:对外按席位或按量卖AI功能,对内又按量付推理成本,收入是固定的,成本是变量的,用得越多毛利越薄。 在这样的结构里,为考核而刷出来的用量,100%计入成本,0%计入产出,是财务模型上最干净的净损失。
代价二:员工被"为用而用"持续消耗。 强制"应用尽用、严禁手搓"之后,简单任务也必须绕道AI,多出一次生成、一次核对、一次修正。前面那句"AI 10分钟出初稿,领导要三个版本对比"就是典型场景——效率提升被立刻兑换成更高的产出要求,返工与二次核对不降反升。当员工长期处在"生产者变审核者"的状态里,AI带来的不是解放感,而是被工具追着跑的疲惫感。这种疲惫最终会体现在离职率上,而离职率是比Token账单贵得多的成本。
代价三,也是最隐蔽的一重:组织拿不到真实的AI效能数据。 这一点几乎所有企业都低估了。使用率KPI一旦落地,仪表盘上的曲线一定漂亮:覆盖率90%以上,人均调用稳步上升,Token消耗节节攀高。管理层看着这些数字,很容易得出"AI转型进展顺利"的结论,进而追加预算、扩大授权、把更多流程交给AI。
可这些数字里混着大量为考核而生的空转调用。被污染的数据不会报错,它只会安静地把决策带偏。 真实的AI效能是多少?哪些场景真的跑通了、哪些只是看起来跑通了?哪个团队值得加投、哪个团队该先停下来?这些问题在污染数据面前全部失去答案。算力浪费可以一次性止损,数据失真却会让整个纠错周期变慢一整年。
否定容易,重建才难。一套真正能落地的AI考核体系,必须同时回答三个问题:考什么、数据从哪来、怎么防作弊。 缺任何一个,指标都会在三个月内被员工找到漏洞。
我们把它拆成八个维度——这也是 51Tokens 八维AI考核引擎的设计骨架:
| 维度 | 考什么 | 取数口径 | 防什么作弊 |
| 1 使用广度 | AI是否覆盖了本岗位应覆盖的关键场景,而非调用了多少次 | 按岗位预先定义场景清单,统计"已跑通场景数/应覆盖场景数" | 防止在单一简单场景里反复调用凑数;场景需有交付物才计入 |
| 2 使用深度 | 是停在问答式浅层使用,还是进入流程嵌入、Agent编排、知识库调用 | 按调用类型分层打标,统计中高阶调用占本人总调用的比例 | 防止空跑高阶Agent刷层级;无有效输出的编排不计分 |
| 3 任务完成质量 | AI参与的交付物,最终质量是否达标、是否优于纯人工基线 | 沿用业务侧既有质量标准(缺陷率、通过率、客户评分),不另设一套 | 质量由业务方或下游环节评定,不由使用者自评自报 |
| 4 返工率 | AI初稿到最终定稿之间,被推翻和重做的比例(越低越好) | 统计同一任务的重复生成轮次、内容改动幅度、终稿采纳率 | 防止把一次任务拆成多任务规避返工统计;按任务ID聚合而非按调用 |
| 5 单位产出成本 | 完成一个标准交付物平均消耗多少Token与工时(越低越好) | 交付物数量为分母、Token与工时为分子,按岗位分组横比 | 该维度天然反向抑制刷量:刷得越多,本项分数越差 |
| 6 合规行为 | 是否走统一网关、是否触发敏感内容提醒后仍执意提交、是否绕道未授权工具 | 取自模型调用审计日志与敏感内容识别提醒记录,按事件计次 | 设为一票否决类扣分项,不能用其他维度的高分对冲 |
| 7 能力成长 | 提示词与工作流的复用沉淀、对同事的赋能、培训与认证完成度 | 统计被他人复用的模板数、内部分享次数、分角色课程与考核通过情况 | 以"被别人用过"为计分前提,杜绝批量上传无人使用的模板 |
| 8 业务价值转化 | AI最终为业务带来的增量:周期缩短、人均产能、成本下降、收入贡献 | 与业务系统数据打通,按项目/团队归因,个人层面只取可清晰归属部分 | 归因需业务负责人确认,避免把行业大盘波动算成个人AI成果 |
这八个维度不是并列关系,用的时候有三条硬规矩。
第一,权重必须偏向结果侧。 质量、返工率、单位产出成本、业务价值转化这四项结果类维度,权重合计建议不低于60%;使用广度、使用深度这类过程类维度,合计不宜超过20%。过程指标只用来诊断,不用来排名。
第二,维度之间必须交叉校验。 单看任何一维都能被刷,组合起来就很难。用量高但返工率也高,说明是无效调用;用量高但单位产出成本高,说明是模型选型或提示词能力有问题;用量低但质量与价值双高,那是高手,不该被扣分。八维的价值不在于分得细,而在于互相咬合、彼此证伪。
第三,所有维度都要有可信的取数底座。 靠员工填表自报的AI考核,第二个月就会失真。真正可用的数据只能来自系统侧——模型调用审计日志需要记录清楚:谁、在什么时间、用了哪个模型、在什么业务场景、消耗多少Token、结果是否被下游采纳。51Tokens 的统一网关与调用审计日志正是为此而生:先把每一次调用的来龙去脉记全,八维引擎才有数可算;配合请求侧的自研保真压缩(压缩比30%-70%,语义不丢、效果不打折)与分级预算,"降本"和"考核"才能用同一份数据说话。
还有一个常见误区:把AI考核做成一套独立系统,和现有的KPI/OKR各跑各的。结果就是员工同时被两套指标拉扯,业务目标和AI目标打架,谁都完不成。
AI考核不该自成孤岛,它是现有绩效体系的一个观测层与增强层,不是第二套KPI。 落地节奏比指标本身更关键,建议分三步走,每步至少留足一个完整考核周期:
| 阶段 | 做什么 | 绝对不要做什么 |
| 第一步 只观测,不考核 |
打通调用审计日志,摸清各岗位真实使用基线;对全员公开取数口径,说明数据用途 | 不排名、不通报、不与奖金挂钩;数据一旦提前用于奖惩,基线立刻失真 |
| 第二步 设基线,做诊断 |
按岗位设合理区间,识别畸高与畸低两端异常,结论进部门复盘,用于优化场景与培训 | 不进个人绩效档案;不把区间上限当努力方向,超出区间同样需要复盘 |
| 第三步 进绩效,只挂结果 |
仅将质量、返工率、单位产出成本、业务价值转化并入现有KPI/OKR,合规行为作扣分项 | 绝不把使用率、使用时长、Token消耗量本身写成考核项或排行榜 |
三步走完,还要补上最容易被跳过的一环:能力供给。当考核从"用得多"改成"用得对",员工必须先知道什么叫"对"。财务该怎么用AI才不越界,研发该怎么写提示词才省Token,法务该在什么环节停手改由人工判断——这些不是靠一句"应用尽用"的通知能解决的。分角色的AI应用能力课与AI合规课,本质上是在给新考核标准配套弹药;而考核指标怎么和现有绩效表对齐、口径怎么写进制度文件、争议怎么申诉,通常还需要顾问陪跑一到两个周期才能真正跑顺。先给方法,再谈考核,员工才不会觉得这是又一次运动式加码。
回头看「公司为了AI已经疯魔了」这条热搜,它真正暴露的不是员工抵触AI,而是企业在还没想清楚怎么衡量AI价值的时候,就急着用KPI去推动AI。 用量排行榜、使用率指标、使用时长考核,都是同一个错误的不同外衣——拿投入当产出,拿动作当结果。
而AI省钱、AI合规、AI考核这三件事,从来不是三个部门的三张表。AI省钱要知道钱花在哪些调用上,AI合规要知道敏感内容在哪个环节进了模型,AI考核要知道哪次调用真正换来了业务成果——三者共用同一份调用审计数据,也只有把这份数据打通,仪表盘上的数字才配被当作决策依据。
别再让员工为了年终奖去讨好一只"龙虾"。好的AI考核,应该让最会用AI的人被看见,而不是让最能刷量的人排第一。
最后想听听你们公司的情况:你所在的企业,把AI使用率写进考核了吗?如果写了,你身边有人在"为用而用"地刷量吗? 如果让你只保留一个AI考核指标,你会选质量、返工率,还是业务价值转化?欢迎在评论区说说你的经历,也欢迎把这篇转给正在制定AI考核方案的HR和技术负责人——指标定错了,再努力的团队也只会跑偏方向。
—— 51Tokens,让AI效能被看见,而不是被刷出来
51AIPro · 企业AI治理专家
安全·合规·可控·增效,AI 全流程治理一次布防
长按识别 · 关注公众号 |
长按识别 · 合作洽谈 |
官网 https://51aipro.com/