AI员工考核 | 医疗机构专题 医生拿AI摸鱼!医疗考核怎么管 |
医疗机构的 AI 考核难题,正在被两个极端同时拉扯。一边是"不敢用"——怕泄密、怕误诊、怕担责;另一边是"滥用"——把 AI 当枪手,病历复制粘贴、诊断建议直接抄、质控报告一键生成,看似效率拉满,实则把专业能力喂给了模型。医师网、法治周末等媒体梳理的司法实践已经把责任说得很清楚:医务人员未履行审核义务、盲目依赖 AI 结论导致损害的,按诊疗过错程度承担相应责任,情节严重的面临暂停执业甚至吊销证书;医疗机构违规使用 AI 替代医师接诊的,由卫生健康主管部门责令整改、给予行政处罚。AI 用得好是助手,用歪了就是风险,而"用得怎么样"必须有人说得清。
为什么医疗场景的 AI 考核特别难?第一,使用分散:临床、影像、病理、药学、行政各科室都在用,账号散、入口杂,没人知道全院到底调了多少次模型。第二,质量难量化:同样是用 AI 写病历,有人拿它做初稿再精修,有人直接复制提交,过程看不出差别,结果天差地别。第三,风险不对称:AI 辅助带来的效率提升是隐性的,但一次"未审核就放行"的误诊风险是显性的、不可逆的。传统 KPI 只管"用了没有",管不了"用得对不对"。
行业里已经有清醒的判断。9 月 1 日起实施的我国首个 AI 客服国标《顾客联络服务 人工与智能客户服务协同要求》明确:部署在官方渠道的 AI 回复视作经营者的意思表示,涉及生命健康财产安全的问题必须跳转人工。人民日报健康客户端 9 月 1 日的解读更直接——医疗健康 AI"已读乱回"不再免责,AI 给出的就医指引、报告解读,在法律上可视为医疗机构的承诺。这意味着,医院对"AI 怎么被使用"的管控责任,已经从倡导变成了底线。考核,正是把这条底线落到人的抓手。
第一,用了没有、用了多少次?这是最基础的台账。全院各科室、各账号的模型调用量、Token 消耗,必须能按科室、按人统计。没有这个数,所有的"鼓励使用"都是空话,所有的"防范滥用"也无从谈起。
第二,用在哪儿、用在什么数据上?同样是调用,用在文献检索和用在患者病历脱敏分析,风险等级完全不同。考核不能只看总量,还要看调用的场景分布——有没有把敏感患者数据送出去,有没有走脱敏流程,都应该留下记录。
第三,质量过没过审?AI 生成诊断建议、病历、报告后,有没有执业医师复核确认?复核意见留没留痕?这是医疗 AI 考核区别于其他行业的核心维度——"人工审核率"应该成为硬指标,而不是软要求。
第四,效率提升兑现了没有?用 AI 是为了降本增效,不是为用而用。同样一份病历书写,引入 AI 后科室的平均耗时、返工率有没有下降?把"省下的时间"量化出来,考核才有正向激励,而不是变成新的填表负担。
51Tokens 的八维 AI 考核引擎,就是冲着上面四个问题来的。它把每一次模型调用拆成八个可量化维度:使用频次、场景分布、敏感数据命中、人工审核率、Token 效率、返工率、风险处置闭环、合规留痕完整度。这些维度不是孤立的数字,而是自动汇总到科室和个人台账,直接对接企业的 HR 绩效体系——哪个人用得规范、哪个人"挂机刷量"、哪个科室审核率偏低,一眼可查。
落到医疗场景,最关键的几个维度要重点盯。一是"人工审核率":AI 生成任何诊断相关结论后,必须有人审、有记录,没审的不计入有效产出。二是"敏感数据外发命中":一旦调用里出现未脱敏的患者信息,不仅拦截,还要记一笔到责任人台账,作为合规扣分项。三是"场景健康度":把"文献检索、病历初稿、质控归纳"这类合规场景的占比做高,把"直接抄诊断结论、替代接诊"这类高风险行为压到零。四是"返工率":用 AI 反而反复返工的,说明提示词或流程有问题,考核时该提醒优化而非奖励数量。
推行上要给"软着陆"。不建议一上来就扣钱扣分,而是先做三件事:第一,把 AI 使用量、审核率、敏感命中这些数先在科室公示,让大家看到差距;第二,设"规范使用标兵"的正向激励,把人工审核率高、敏感零命中的科室树为样板;第三,给申诉通道——系统判定有争议的,允许本人提交说明,避免误伤。很多医院不是不想考核,而是怕考核变成"一刀切"引发抵触。把规则写清楚、数据摆出来、申诉留出口,考核才落得下去。
分科室设权重,考核才不会"一刀切"。不同科室的 AI 使用风险天差地别,权重要跟着风险走。影像科、病理科重"人工审核率"与"敏感数据命中"——这俩是红线指标,权重最高;药学、行政文书重"Token 效率"与"返工率"——效率指标,权重居中;科研与对外合作重"合规留痕完整度"——过程指标,一票否决项。51Tokens 的八维引擎支持按科室配置权重模板,集团给框架、科室填细则,既统一口径又尊重专业差异。很多医院考核推不动,根子就在"用一把尺子量所有科室",影像医师和行政文员被同一套指标逼疯,自然抵触。
考核怎么接进 HR 绩效。八维台账不是给信息科看的"技术报表",而要变成 HR 能用的"绩效依据"。落地时把四个维度映射到既有考核项:人工审核率、敏感零命中映射到"医疗质量与安全";Token 效率、返工率映射到"运行效率";合规留痕完整度映射到"依法执业"。医师晋升、评优时,调一份 AI 使用质效台账即可,既不另起炉灶,也避免"用了 AI 却没人认"。很多医院卡在"IT 出了数、HR 不认"——解决办法是上线前就让医务、HR、信息三方一起定字段口径,数一出来就能直接用。
考核结果怎么用、怎么申诉。八维台账的价值不在"扣分",而在"对齐"。建议每月出一份科室 AI 使用质效榜:规范使用率、人工审核率、敏感零命中排前面的科室,给予正向激励;审核率偏低、敏感命中的,先提醒后约谈。同时留申诉通道——系统判定有争议的(比如紧急会诊的高频调用被误判为"刷量"),允许本人提交说明,由信息科与医务部复核后修正,避免误伤积极性。考核做成了"看得到、说得清、改得了",医生才愿意把 AI 真正用出水平,而不是偷偷绕开。
对医疗机构而言,AI 合规、AI 费控、AI 考核本是一体三面:管住了入口,账单才算得清;算得清账,考核才落得实;考核落得实,合规才不是纸面文章。51Tokens 把八维考核做成可对接 HR 的台账,让"谁在用 AI、用得对不对、省没省时间"第一次变成可管理的指标。你们医院现在有没有统计过:各科室的 AI 使用量,差距有多大?欢迎在评论区聊聊你们的考核困惑。
图:51AIPro 全流程 AI 治理一体化解决方案 · 服务架构

—— 51Tokens,让每一次模型调用都看得见、说得清、查得到
51AIPro · 企业AI治理专家
安全·合规·可控·增效,AI 全流程治理一次布防
![]() 长按识别 · 关注公众号 | ![]() 长按识别 · 合作洽谈 |
官网 https://51aipro.com/