AI考核管理 | 电力能源专题

员工建2.2万个智能体!电力考核怎么管

员工创建了两万多个智能体,电力企业的 AI 考核该怎么管?这不是假设题。公开报道显示,某能源集团的人工智能平台已助力一万一千名员工完成两万两千个智能体的创建与发布,全面覆盖二十二个业务域;另有电网企业提出到 2027 年智能体应用普及率超过八成的目标。AI 治理的重心,正在从"能不能用"转向"用得好不好、谁用得值"。

数量上去了,问题跟着来。第一类是"建了不用"——为了响应号召批量建智能体,建完就躺在平台上,既没有调用量也没有产出,纯占资源。第二类是"用了不产出"——调用量很高,但生成的东西没人看、没进流程、没形成成果,Token 烧得欢,业务没变化。第三类是"刷量冲榜"——一旦把"AI 使用率"写进考核,就必然有人为了指标反复调用、无意义生成,把考核指标做成了成本黑洞。第四类最麻烦,是"拿 AI 摸鱼"——把本该自己判断的活整段丢给模型,出来的结论不复核直接交,看着效率高了,实际上把风险留在了后面。

电力行业对这四类问题格外敏感,原因很简单:电网业务的容错率低。公开受访的电网一线负责人说得很清楚,AI 泛应用的核心瓶颈并非模型准确率,而是业务流程重构与责任归属界定——AI 输出结果存在不确定性,一旦出问题,谁使用、谁担责,是业务部门敢不敢用 AI 的关键。这句话反过来看就是考核逻辑:如果考核只看"用没用 AI",员工就会为了指标乱用;如果考核能看到"用得对不对、复核没复核、产出值不值",AI 才会被用在正地方。

用量不等于效能:考核错位的三个典型症状

症状一:把调用次数当业绩。指标一旦锚在次数上,行为就会跟着变形。有的班组把一个问题拆成十次问,有的把已有答案反复重生成,还有的直接写脚本刷。次数涨了,账单涨了,业务一点没动。这类问题不是员工的错,是指标设计的错。

症状二:只看产出不看过程。有人用 AI 写了一份漂亮的分析报告,但输入里塞了不该塞的敏感台账,输出也没做人工复核。报告过关了,风险埋下了。考核如果只看交付物,就会奖励这种"看不见的赌博"。

症状三:好用的人被平均掉。真正会用 AI 的员工,往往调用次数不高但产出扎实——他们提示词写得干净、上下文精简、复核到位。如果考核用的是平均值和总量,这批人反而排在刷量的人后面,示范效应就彻底反了。

还有一个被忽略的问题是统计口径不统一。同一家单位里,有的部门把"用 AI 写了一版稿子"就算成果,有的部门要求"AI 产出必须进入正式流程"才算;有的班组统计的是账号级用量,有的统计的是场景级用量;有的把智能体创建数当业绩,有的只看实际调用。口径不一致,横向比较就毫无意义,考核也就失去了公信力。所以考核真正的第一步不是设指标,而是把统计口径和数据来源统一到一个地方——这件事不解决,后面所有指标都是空的。

八维 AI 考核引擎:把使用量变成效能账

51Tokens 的八维 AI 考核引擎,做的就是把"用了多少"换成"用得怎么样"。八个维度大致覆盖:调用频次与活跃度、Token 消耗与单位成本、任务完成度与产出转化、提示词质量与上下文效率、合规命中与处置记录、人工复核率、缓存复用率、跨部门协作贡献。八个维度合起来,才构成一个人或一个班组的 AI 效能画像。

为什么必须是多维?因为单一维度必然被博弈。只看次数就会刷次数,只看成本就会不敢用,只看产出就会掩盖过程风险。八维的价值在于相互制约——调用多但单位成本高、复核率低的,一眼看得出是浪费;调用不多但产出转化高、提示词干净的,自然排在前面。电力企业最需要的正是这种"能分辨会用和乱用"的尺子。

八个维度里,电力企业尤其要盯住两个:人工复核率和合规命中。前者衡量的是"有没有人对 AI 的结论负责"——在容错率极低的电网业务里,复核率低本身就是风险信号;后者衡量的是"有没有人在拿敏感数据试探边界",这个数字既不该长期为零,也不该居高不下:为零往往说明规则没配好或者根本没人用,居高不下则说明培训没跟上。这两个维度挂钩绩效时要格外注意方向——复核率越高越好,合规命中越低越好,但都不能用一刀切的绝对值去卡。

落地节奏建议软着陆,别一上来就挂钩奖金。第一阶段只做可见:把全公司的 AI 调用收口到 51API 网关,按部门按班组出效能报表,先让大家看到自己在哪一档,不排名不通报。第二阶段做校准:结合业务侧反馈调整权重,比如巡检侧更看重复核率,文档侧更看重产出转化,调度侧更看重合规命中为零。第三阶段才进绩效:把校准稳定的两三个维度写进考核细则,同时配上申诉通道。

配套的管控也要跟上。考核数据来自统一网关的全量留痕,所以先有入口收口,才有考核数据;敏感识别与分层授权同步生效,员工在提交前就能收到提示,命中红线的直接拦截,避免"考核通过但合规出事"。这里要说清边界:考核引擎衡量的是 AI 使用效能,不替代企业既有的绩效体系,也不承诺覆盖所有业务价值判断——它提供的是过去完全缺失的那份客观数据。

配套动作里,最容易被跳过但最有效的一步是"先做示范再做考核"。挑三到五个用得最好的班组,把他们的提示词模板、精简索引、缓存复用方式整理成可复制的做法,在内部推广一轮,再启动考核。这样考核启动时,大家已经知道"好"长什么样,指标就不会被理解成"多调用几次"。反过来,如果考核先于示范,最先被激励的一定是最会应付指标的人,而不是最会用 AI 的人——这个顺序错了,后面很难纠回来。

考核结果怎么用,同样决定这套尺子能不能立住。比较务实的用法有三种:一是用于资源再分配,把 Token 预算向产出转化高的班组倾斜,向长期建了不用的账号回收,这比单纯罚人有效;二是用于培训靶向,提示词质量长期偏低的部门优先安排一轮实操培训,别搞全员大课;三是用于场景清理,连续两三个月无调用、无产出的智能体做下线归档,平台上留一堆僵尸应用本身就是管理成本。三种用法的共同点是"对事不对人"——考核先服务于把资源用对,再谈绩效奖惩,员工的抵触感会小很多。

还得配一条申诉通道。AI 效能数据不可能百分之百贴合业务实际:有的岗位天生调用少但每次都是硬骨头,有的场景产出没法进系统流程但确实省了人力。这些情况必须允许当事人举证说明,由业务主管确认后调整口径。没有申诉通道的考核,最终会逼出两种行为——要么应付指标,要么干脆不用 AI,两种都不是企业想要的结果。

回到最初的问题:两万多个智能体到底该怎么管?答案不是砍掉,而是让每一个都能被算清楚——谁建的、谁在用、用了多少 Token、产出进了哪个流程、有没有人复核、有没有踩合规线。把这六件事记全了,AI 考核就不再是拍脑袋。AI 省钱、AI 合规、AI 考核本是一体:账单算得清,考核才有依据;考核落得实,合规才守得住。

图:51AIPro 全流程 AI 治理一体化解决方案 · 服务架构

51AIPro 全流程AI治理一体化解决方案 服务架构

—— 51Tokens,让每一次模型调用都看得见、说得清、查得到

51AIPro · 企业AI治理专家

安全·合规·可控·增效,AI 全流程治理一次布防

关注公众号

长按识别 · 关注公众号

微信扫码联系51AIPro

长按识别 · 合作洽谈

官网 https://51aipro.com/