员工考核 | 医疗机构AI治理专题

员工滥用AI绩效难量化?医院八维考核破局

员工滥用AI,在医院比在任何行业都更敏感。医生用大模型写病历,护士用AI写交班记录,行政用AI写材料——人人都在用,可院方连谁在AI摸鱼都分不清,员工AI绩效无法量化AI合规更无从谈起。

但有一件事,医疗行业其实走在了所有行业前面。

《医疗机构人工智能应用与治理专家共识(2026版)》由北京卫生法学会大数据与互联网人工智能医疗专委会、中国生物医学工程学会医学人工智能分会牵头,40余家医疗卫生与科研机构共同制定,发表于《中国医学伦理学》。这份共识白纸黑字写下了一句在其他行业还没人敢写的话:将"AI工具使用能力"纳入医务人员培训考核,同时保留不依赖AI的传统技能考核,防止年轻医师沦为"算法的附庸"。

这意味着,医疗是全国第一个把"会不会用AI"正式写进人员考核体系的行业。

尴尬也在这里。共识写完快半年,绝大多数医院仍停留在"鼓励科室多用AI"的阶段。院长办公会上问一句"我们院谁用得好、谁在滥用",全场沉默——不是没人关心,是真的没有一个人拿得出数据

一、医院AI使用考核为何全国率先破题:六大维度里的"素养提升"

要理解医院的AI考核为什么必须做、又为什么难做,先要看清楚监管给出的框架有多细。

2026版专家共识给出六大治理维度:准入评估、临床应用、患者权益保障、数据治理、风险管理、素养提升。前五个维度管的是"AI能不能进、怎么用、出事怎么办",第六个维度"素养提升",管的才是"人"——也就是员工的AI使用能力本身。

共识对"人怎么用AI"的约束非常具体:AI应用按低、中、高三级风险分类;准入由联合评估组实行"一票否决制",且每半年动态复评;临床端坚持"人机协同、以人为主",医师不得将AI输出直接作为诊断结论,AI生成内容需经医师确认后方可进入病历系统;高风险环节可设双人复核,对AI判断的修改或否决需全程日志记录

数据侧更硬:坚持"数据不出院"原则,严禁将未脱敏患者数据上传第三方公有云大模型;AI相关不良事件纳入医疗安全报告系统;设置熔断机制,出现连续严重错误、算法漂移或数据泄露时立即停用并切回人工;采购合同需明确追偿权

往上一层,国家卫健委、国家发展改革委、工信部、国家中医药局、国家疾控局2025年11月印发的《关于促进和规范"人工智能+医疗卫生"应用发展的实施意见》,覆盖8个方向24项重点应用,强调临床数据授权运营管理制度,以及数据安全与个人信息保护负面清单。北京市卫健委《北京市支持医疗健康领域人工智能应用发展行动计划(2026—2027年)》则要求数据分类分级、访问控制、加密传输、脱敏处理,并明确禁止AI完全替代医务人员专业判断

把这三份文件叠在一起看,逻辑是闭合的:AI在医院不是禁不禁的问题,而是每一次使用都必须可归因、可复核、可追责。而要做到这三点,就必须先有一套能落到个人头上的考核。

二、医院AI考核不能照搬互联网Token用量排行榜:用得多不等于用得好

【分析一】互联网公司已经踩过的坑,医院不能再踩一遍

很多医院信息科拿到的第一版AI考核方案,几乎都是互联网公司那套:统计每个人调用了多少次、消耗了多少Token,排个榜,前几名表扬,后几名督促。

这套玩法在互联网行业已经被证伪了。亚马逊叫停了Token用量排名,高级副总裁Dave Treadwell公开喊话"别为了用AI而用AI",转而推行严格的Token限额管理。腾讯2026年3月推出全员AI激励计划、一度也搞过Token消耗排行榜,数月后就下发额度调整通知,全员Token配额大幅缩水,核心研发收紧,外包岗位砍幅更大。

Uber的教训更直接。2025年12月起向工程团队推广Claude Code并设内部使用排行榜,5000多名工程师中约95%每月使用AI,约11%的后端更新或代码提交由AI智能体生成。到2026年4月,CTO Praveen Naga表示公司4个月花光了2026全年AI预算;COO Andrew Macdonald直言更高的Token支出与客户价值提升尚未建立清晰的逻辑关联,行业普遍存在"Tokenmaxxing"(Token极大化)的浪费现象。随后公司出台了每人每月AI工具费用限额令。

排行榜的根本缺陷是:它奖励"用量",而组织真正想要的是"用得对"。在互联网公司,这个偏差的代价是账单;在医院,代价可能是病人。

第一重错位:排行榜奖励高频,临床要的是恰当。一位医生的AI调用次数全院第一,在互联网逻辑里叫"数字化标兵",在临床逻辑里可能恰恰意味着他把AI当成了诊断依据——而共识明确要求"人机协同、以人为主",医师不得将AI输出直接作为诊断结论。在医院,用得多不仅不等于用得好,还可能本身就是风险信号。

第二重错位:排行榜奖励长上下文,临床红线是数据不出院。要让大模型输出更"像样",最省事的办法就是把整份病历、完整检查报告一股脑贴进去。Token数上去了,排名上去了,可未脱敏患者数据一旦流向第三方公有云大模型,就直接撞上共识的"数据不出院"原则和北京行动计划的脱敏处理要求。Token榜上的第一名,很可能是合规台账上的第一风险人。

第三重错位:排行榜奖励快速产出,临床要的是可复核可追溯。共识要求AI生成内容需经医师确认后方可进入病历系统,高风险环节可设双人复核。一个把AI初稿一键确认、从不修改的医生,产出速度必然领先;但从治理角度看,这恰恰是最该被预警的行为模式。医院的AI考核,第一件事不是排名次,而是换算法。

三、年轻医师沦为算法附庸的风险怎么量化:AI采纳率过高要预警

【分析二】"算法的附庸"不是修辞,它是一个可以被指标提前发现的过程

共识那句"防止年轻医师沦为'算法的附庸'",是整份文件里最容易被当成口号读过去的一句,也是最该被翻译成指标的一句。

它描述的是一个渐进过程,不是一个突发事件。第一阶段,医师用AI做参考,看完自己判断;第二阶段,AI说得八九不离十,医师开始只做形式性核对;第三阶段,医师失去了"不用AI也能独立判断"的肌肉记忆。前两个阶段完全没有不良事件,考核体系如果只盯着差错率,等到看见问题时,能力已经退化了好几年。

可预警指标一:AI建议采纳率的区间管理,而非越高越好。把"首次采纳、修改后采纳、直接否决"三种处置结果分开统计。采纳率过低说明工具没用起来或模型不适配;采纳率异常高、且修改率趋近于零,才是真正的红灯。考核口径要从"采纳率越高越好"改成"落在合理区间才得分"。

可预警指标二:分年资设基线,而不是全院一条线。高年资医师采纳率高,通常是因为他有能力快速判断AI说得对不对;低年资医师采纳率高,则可能是因为他判断不了。同一个数字,在不同年资身上含义完全相反。基线必须按专业+年资双维度分组取中位数,偏离超过阈值的个体进入观察名单——不扣分,先谈话,再安排培训。

可预警指标三:修改与否决AI判断的行为,本身就是正向指标。共识要求对AI判断的修改或否决需全程日志记录。多数医院把这条理解成一项合规负担,但换个角度看:这份日志恰恰是全院最宝贵的能力数据。一个医师能指出AI哪里错了,证明他的独立判断能力仍然在线。把"有效否决次数"计入正分,就等于用绩效告诉全院:我们奖励的不是听话地用AI,而是清醒地用AI。

可预警指标四:AI使用数据与传统技能考核成绩的交叉分析。共识特别强调"保留不依赖AI的传统技能考核"。真正有价值的信号,藏在两组数据的交叉里:某位医师的AI采纳率逐季走高,而传统技能考核成绩同步走低——这就是"算法附庸"的量化画像,任何单一指标都看不出来。

这四个指标合起来说明一件事:医院的AI考核,一半是在考核"用AI的能力",另一半是在监测"不用AI的能力有没有退化"。只做前一半,考核就变成了推着年轻医师加速依赖算法的助推器。

四、医院AI绩效考核为何必须分层分类:四类岗位画像完全不同

【分析三】一把尺子量全院,是医院AI考核最常见的失败方式

共识把AI应用分为低、中、高三级风险,这个分级思路必须原样传导到人身上。一家三甲医院里,至少有四类岗位的AI使用画像截然不同。

医师岗,高风险。典型场景是辅助诊断建议、病历文书生成、医嘱与用药参考。考核重心应放在采纳率区间、修改与否决留痕、AI生成内容进入病历系统前的医师确认执行率。这一类岗位的合规项应设为门槛项:未按流程确认即入病历,其余维度得分再高也不加分。

护理岗,中风险。典型场景是交班记录、护理文书、患者宣教材料、随访话术。风险不在诊断,而在患者信息脱敏与内容准确性。考核重心是返工率(宣教材料被退回重做的比例)、敏感内容触碰次数、以及模板复用带来的效率提升。护理岗最容易出成绩,也最容易在无意间把患者标识信息带进提示词。

医技岗,高风险但形态不同。影像、检验、病理的AI辅助判读,是最接近"算法直接给结论"的场景。考核重心应是双人复核执行率、算法漂移与异常结果的主动上报次数、以及AI相关不良事件是否按要求进入医疗安全报告系统。这一类岗位的正向指标里,"主动报告异常"的权重应当高于"处理量"。

行政后勤岗,低风险但高消耗。公文写作、采购材料、统计报表、宣传稿件、会议纪要。临床风险最低,Token消耗却往往最高——因为没有临床红线约束,长上下文和反复重试最容易在这里发生。考核重心是Token效率与任务覆盖度,即单位有效产出消耗了多少算力、AI真正渗透进了多少种日常任务。同时仍要守住底线:涉及患者数据、采购合同、职工个人信息的内容,一样受"数据不出院"约束。

四类岗位的合理区间、权重配比、门槛项设置全都不一样。用一张全院统一的AI绩效表打分,结果一定是行政岗霸榜、临床岗垫底——而这恰恰与医院希望传递的价值取向完全相反。分层分类不是精细化的加分项,它是医院AI考核能不能成立的前提。

五、医院AI考核数据从哪来:没有统一网关与审计日志就是拍脑袋

前面讲的所有指标,都建立在同一个前提上:这些行为必须被记录下来

现实是,多数医院的AI使用处在"各科室自己申请账号、医生自己拿手机用"的状态。这种状态下,院方连"上个月全院一共发起了多少次AI调用"这个分母都拿不到,考核自然只能靠科主任印象打分——那不叫考核,那叫拍脑袋。

解法是把入口收口。通过51API(AI网关)把医院需要的多家大模型统一接入、统一路由,按任务分级调度:文书类轻任务走轻量模型,复杂分析走强模型,避免"一律用最贵的模型"。所有调用从一个口子进出,才谈得上计量与管理。

在网关之上,51Tokens的全链路审计日志记录每一次调用的使用人、科室、时间、模型、内容类型与消耗量。这份日志同时服务四件事:合规自证、成本归因、绩效考核、以及不良事件溯源。共识要求AI相关不良事件纳入医疗安全报告系统、要求熔断机制在连续严重错误或算法漂移时立即停用切人工——这两条如果没有日志支撑,触发条件本身就无法判定。

还有一个常被忽略的价值:留痕会让"修改和否决AI"这件事第一次变得可计分。在没有日志的医院里,医生纠正了AI一百次,绩效表上一个字都不会体现;有了留痕,这一百次就成了他专业能力最硬的证据。考核数据的意义,不只是抓住谁在滥用AI,更是让认真用AI的人被看见。

六、八维AI考核引擎:医院员工AI使用能力的可落地标尺

51Tokens的八维AI考核引擎,从使用频次、任务覆盖度、Token效率、返工率、采纳率、合规违规次数、敏感内容触碰、能力成长曲线八个维度,把"用了没有"变成"用得好不好"。下表逐维给出医院场景的具体对应与HR对接方式。

维度 在医院里具体考核什么 对接HR绩效与培训考核
使用频次 按科室、岗位统计月度调用次数与活跃天数。过低=未赋能,过高=可能过度依赖,两端都进观察名单 仅作诊断项,不直接挂钩奖金;用于筛选需要开课的科室
任务覆盖度 AI渗透进了多少类日常任务:病历文书、检索循证、科研统计、随访宣教、公文报表 计入"AI应用普及度",作为科室数字化建设评价参考
Token效率 单位有效产出消耗多少算力。冗余上下文、无效重试、整份病历直接粘贴,都会拉低得分 计入"AI成本意识",把院内算力账单传导到科室与个人
返工率 AI初稿被质控退回、宣教材料重做、报表重出的比例;反映提示词水平与场景匹配度 计入科室质控考核,与文书书写质量同表统计
采纳率 首次采纳、修改后采纳、直接否决三分统计。按专业+年资设区间,不是越高越好;有效否决计正分 与不依赖AI的传统技能考核成绩交叉分析,识别能力退化苗头
合规违规次数 AI生成内容未经确认即入病历、高风险环节跳过双人复核、修改否决未留痕 设为门槛项:不达标则其余维度不加分,联动医疗安全管理
敏感内容触碰 提示词中出现未脱敏患者标识、完整病历原文外发倾向等高敏场景,给出提示并留痕 对应"数据不出院"红线,触碰记录进入合规台账与培训名单
能力成长曲线 同一员工Token效率、返工率、有效否决次数的逐月趋势,看是不是"越用越精" 作为继续教育与AI素养培训的成效证据,正向加分

这八个维度里,医院与互联网公司差异最大的是三处:采纳率不追求越高越好合规项设为一票否决门槛有效否决AI计入正分。这三处改动,正是把通用考核引擎"临床化"的关键。

七、八维指标怎么接进HR绩效与院内培训考核体系

第一,口径必须唯一。所有考核数据以51Tokens网关采集的审计日志为唯一权威来源,禁止科室自报或凭印象评估。口径一旦双轨,考核立刻失去公信力。

第二,权重按岗位分配。医师岗建议合规门槛权重最高,其次是采纳率区间与有效否决;护理岗侧重返工率与敏感内容触碰;医技岗侧重双人复核执行率与异常上报;行政后勤岗才是Token效率与任务覆盖度唱主角。同一套引擎,四张不同的权重表。

第三,先观察,后考核。建议前一到两个季度只出报表不计分,让数据分布稳定后再定阈值。这与共识"每半年动态复评"的节奏天然吻合——阈值本身也应当每半年重新校准一次,因为模型在变、场景在变、人的水平也在变。

第四,接进医院既有的考核载体。不要另起炉灶做一张"AI绩效表"。正确做法是把指标嵌进已有体系:合规项并入医疗质量安全考核,能力成长曲线并入继续教育与住院医师规范化培训评价,Token效率并入科室成本管理,采纳率与传统技能考核成绩并表分析。AI考核只有寄生在原有考核里,才活得下来。

第五,警惕"唯Token论"的反向激励。如果考核变成比谁Token烧得多,员工会主动灌长上下文、堆无效重试来刷分,成本上去了、质量下来了,还顺带把未脱敏数据往外送。正确做法只考核"有效产出÷单位算力"。在这一维度上,51Tokens的自研保真压缩算法对请求侧提示词做压缩,可节约30%-70%的请求侧Token消耗,语义不丢、效果不打折——需要说明的是,压缩只作用于请求侧输入,不触碰模型生成内容。配合分级预算与配额,按科室、项目、个人分级设定额度并超限预警,院方不必等到季度账单出来才知道钱花在哪。

第六,考核结果必须闭环到培训,而不是只用于排名。采纳率异常、返工率偏高、敏感内容频繁触碰的科室,需要的不是通报批评,而是一堂讲清楚红线与提示词方法的课。51AIPro的培训课程面向临床、护理、医技、行政与信息科分层设计,把"AI能做什么、不能做什么、哪些内容绝不能贴进去"讲到具体场景;咨询落地服务则按"治理现状盘点→制度与流程设计→平台落地→度量与迭代"的路径陪跑,帮医院把共识里的六大维度真正翻译成院内可执行的制度文本与考核表。

八、51AIPro能力边界声明:AI合规不承诺100%,实时拦截为NEXT缺口

关于实时拦截与在线审批。在调用发生的瞬间自动判定并切断违规请求、或触发在线审批流,属于策略引擎能力,是行业共同的NEXT阶段缺口。51AIPro当前不提供、也不暗示具备此类实时自动拦截能力,本文所述均为治理理念与考核方法。

关于敏感内容识别。当前能力停留在提示与留痕层面——识别高敏场景、给出提醒、完整记录,供事后审计与考核使用,不等同于实时阻断。医院在设计流程时应把这一点写进制度,人工复核环节不可省略。

关于AI治理大模型。51AIPro后续将推出治理专用的AI治理大模型(非通用大模型,尚未上线),正式上线前不作任何提前宣称。

特别声明:51AIPro的治理方案不替代医院既有的DLP与SIEM体系,也不是通用GRC系统,三者应协同部署;任何治理工具都不承诺100%合规。医疗场景下的最终专业判断权,始终属于医务人员本人。
今日互动

① 你所在的医院,能说清上个月全院一共发起了多少次AI调用、分布在哪些科室吗?
② 如果明天要交一份"医务人员AI使用能力考核表",你们的数据拉得出来吗?
③ 对年轻医师AI采纳率越来越高这件事,你觉得该鼓励,还是该预警?

文/51aipro.com

AI省钱,是让医院每一份算力预算都能归因到科室与人,不再重演"四个月烧光全年预算"的失控;AI合规,是让"数据不出院"、医师确认入病历、双人复核与修改留痕这些共识条款,从纸面变成系统里可查的记录;而AI考核,是把前两件事真正压到每位医师、每位护士、每位医技和每位行政人员头上的那把新标尺。三词一体,医院才答得上"谁用得好、谁在滥用"这道题。最后留一个问题给你:如果院长明天就问这句话,你们准备用什么回答?

51AIPro · 企业AI治理专家

安全·合规·可控·增效,AI 全流程治理一次布防

关注公众号

长按识别 · 关注公众号

微信扫码联系51AIPro

长按识别 · 合作洽谈

官网 https://51aipro.com/