案例 / 主题 01

医疗文书智能生成与质控

让 AI 进入医生真实工作台,在“生成—质控—签发”的闭环中减少重复书写、前移质量控制,并沉淀可复用的医院知识资产。

迭代中 医疗 AI 文书生成 质量控制
生成—质控—签发
同一条真实工作流
30→5 分钟*
单份病历书写
阶段性材料披露,口径待复核
40 科室 · 25.8 万份*
全院覆盖与累计生成量
阶段性材料披露,口径待复核
医生终审
正式医疗文书的责任边界

医疗文书智能化的价值,不只是“替医生写一段文字”。真正可落地的产品,需要进入医生每天使用的工作台,把语音、病历与检查数据组织成候选文书,在签发前实时发现缺项和逻辑矛盾,并把医生的修改持续沉淀为模板、规则与反馈。

核心判断:AI 负责重复书写、结构整理和风险提示;医生保留临床判断与最终签发权。

原材料给出的证据并不只是一张概念图,而是同时出现了医生端、移动端、配置平台、病历生成与影像报告工作台等产品形态。它说明项目已经跨过“能不能生成”的阶段,进入“能否嵌入工作流、能否被医生采纳、能否稳定治理”的阶段。

证据层材料中看到什么应该如何理解
产品证据医生工作台、移动端语音、配置与调试界面已形成可操作的产品链路
流程证据入院记录、病程记录、出院记录及签发前质控AI 被放进真实文书流程,而非独立演示
使用证据采纳率、书写时间与科室覆盖等阶段性数字可用于判断进入真实应用,但不能替代正式评估

十五个月的推进节奏比任何单点指标都重要

比”上线了没有”更值得看的,是这条时间线本身:它说明这不是一次性交付,而是持续调优的产品化过程。

时间关键动作说明了什么
第 1 个月与信息科成立专项组,明确 12 个试点科室,启动 SFT 调优一开始就绑定信息部门与真实科室,不做悬空试点
第 5 个月SFT 版模型上线,使用量提升约 98.7%;启动 12 个科室培训模型调优带来的是使用量而非演示效果
第 8 个月新增上级医师首次/日常查房,结合病历模板辅助生成从单一文书扩展到查房场景
第 10 个月基座模型由 10b 升级至 32b针对识别不准、幻觉、逻辑与重复四类问题定向改善
第 13 个月上线语音生成入院记录输入方式从”打字”变成”说话”
第 15 个月搭建配置化平台,泛化调优、快速扩单据从做功能转向做能力平台
医疗文书 AI 项目从试点、模型调优、场景扩展到配置化平台的十五个月里程碑
项目里程碑。值得注意的是节奏:先小范围试点与调优,再扩场景,再换基座模型,最后才做平台化——顺序反过来通常会失败。

这条线里最容易被忽略的是第 10 个月那一步。换基座模型不是为了跑分,而是因为一线反馈把问题收敛成了明确的四类:识别不准、幻觉、逻辑不一致、内容重复。没有前九个月的真实使用,就不会有这么具体的问题清单,换模型也就无从判断是否值得。

不是独立聊天窗口,而是临床工作流的一部分

产品必须嵌进入院记录、病程记录和出院记录等真实环节,而不是让医生离开原系统,去另一个窗口“问 AI”。

一条完整链路包含五步:

  1. 输入:医生通过语音、结构化数据或既有病历发起任务。
  2. 生成:模型结合专科模板,产出候选文书或结构化报告。
  3. 质控:系统在书写过程中提示缺项、前后矛盾、制度规则与高风险信息。
  4. 签发:医生确认、修改或拒绝建议,所有正式文书仍由医务人员签发。
  5. 反馈:接受、修改与拒绝结果回流,用于优化模板、规则和交互。

三类能力共同构成产品矩阵

能力工作对象主要价值
专科病历智能生成入院、病程、出院等文书减少重复书写,把注意力还给诊疗
病例内涵质控完整性、逻辑与制度规则把事后抽查前移到书写过程
影像报告生成与质控口述发现、结构化报告统一表达,并在签发前完成风险提示

三类能力共享数据接入、模型服务、规则、审计和反馈机制,但在不同科室仍需沉淀专科模板与术语体系。

医疗文书生成、病例内涵质控与影像报告生成质控的三类能力矩阵
产品矩阵。三类能力共同覆盖“生成—质控—签发”;点击可查看大图。图中仅保留可公开的产品机制。

语音生成只是入口,关键是闭环

语音输入适合医生的自然工作方式:边看患者、边描述关键发现。系统实时转写并生成补充问诊建议,再结合院内检验、检查和既往病历生成候选文书。

真实产品里,这条链路被拆成四步:医生在电脑端控制收音 → 对话记录实时转写展示 → 对话结束后生成补充问诊建议 → 生成入院记录并一键回填。

已脱敏的语音生成入院记录四步链路:收音、实时转写、补充问诊建议、一键回填
四步链路。最有价值的其实是第三步——系统给出"还需要补问什么",并附上临床依据与鉴别提示,而不是直接吐出一份病历。医患对话逐字记录与生成的病历正文已整体遮挡。

第三步值得单独说。界面里的补充问诊建议不是一句”请补充病史”,而是结构化的三段:临床依据(主症特征补充、病程演变分析、生活模式影响)、鉴别提示(为什么这个信息会改变判断)、推荐理由,最后才给出建议医生问出口的那句话。这个设计把 AI 放在了”提醒医生别漏问”的位置,而不是”替医生下结论”的位置——责任边界从交互层面就划清了。

真正决定可用性的不是转写速度,而是:

  • 能否自由选择数据来源,并保留来源追溯;
  • 能否让医生快速调整提示词、模板与专科示例;
  • 能否在生成时同步发现缺项,而不是事后返工;
  • 能否支持会诊记录、MDT 交接和交接班等扩展场景;
  • 能否让科室反馈直接进入下一轮迭代。
已脱敏的医疗文书配置与调试工作台截图
真实工作台与配置能力。公司、机构、患者、医务人员及病例文本均已做不可逆遮挡;保留数据源选择、提示词、模型配置、结果预览和发布流程。

不同文书不能只换一个标题

入院记录、病程记录和出院记录看起来都属于“写病历”,但生成逻辑不同:

文书主要输入AI 的任务医生重点确认
入院记录医患对话、既往史、检验检查组织主诉、现病史、查体与初步判断关键病史是否遗漏、事实是否准确
病程记录新增检查、医嘱变化、查房意见解释病情变化,形成连续时间线推理是否符合临床过程、处置是否一致
出院记录住院全过程、诊疗结果、出院计划汇总诊疗经过与后续安排诊断、用药、复诊和风险提示是否完整

因此,真正可复用的不是一套通用提示词,而是“公共平台能力 + 科室模板 + 文书规则 + 医生反馈”的组合。每个科室都需要有明确的模板负责人、版本记录和回滚机制。

科室反馈要进入产品,而不是停留在群聊里

材料中的移动端与医生助手界面反映出一个重要方向:医生可以选择患者、调取医患对话或外院报告,再把结果带回病历生成与质控模块。科室提出的字段顺序、措辞习惯、模板差异和缺项提醒,应直接进入配置平台,形成可追踪的迭代任务。

一次很具体的改动是”解绑”:原来收音和写病历是捆在一起的一个动作,科室反馈后改成医生可以自主选择患者、自主选择哪一段医患对话,再决定生成什么。同时数据来源从单一录音扩展到外院报告拍照识别、语音速记、院内检验结果,并且支持回溯原始音频与原始报告图片。

已脱敏的移动端多源数据采集与病历生成界面:临床对话转录、拍检验单、语音速记与数据预览
解绑之后的移动端。拍检验单、语音速记、调阅原始音频与外院报告成为并列的数据来源,医生按需组合。患者姓名、病历号、床号、外院名称及主诉原文均已不可逆遮挡。

“支持调阅原始音频与原始报告图片”这一条看起来是小功能,实际上是可追溯性的地基。生成内容出现争议时,能不能回到最初那段录音、那张检验单,决定了这套系统能不能进入正式医疗文书流程。

一轮有效迭代至少要记录:

  • 哪一段内容被医生直接接受;
  • 哪一段被修改,修改发生在事实、结构还是措辞;
  • 哪一条质控提醒被确认、忽略或判定为误报;
  • 哪个数据源被调用,以及生成结果能否追溯到原始证据;
  • 不同科室、文书类型和医生资历下的差异。

临床价值要同时看三类使用者

对医生

减少重复录入和格式整理,让有限注意力回到患者、诊断与治疗决策。

对医务与质控

在签发前提示必填项、逻辑矛盾和高风险信息,减少返工,也减少单纯依靠事后抽查的压力。

对医院管理

把经过验证的模板、规则、专科术语与反馈沉淀为组织知识,而不是散落在个人经验里。

阶段性材料披露的一组数字:住院病历书写时长缩短约 85%(单份约 30 分钟降至约 5 分钟),病历质量提升约 60%,平均 AI 采纳度约 61%;覆盖全院约 40 个科室,累计生成约 25.8 万份,临床科室平均活跃率 71%以上。这些数字更适合被理解为”产品已进入真实工作流”的线索,而不是未经复核的最终成效结论。

已脱敏的项目成效面板:增效、提质、准确三类指标与生成量、活跃率、采纳率趋势曲线
比三个大数字更有信息量的是右下角那条曲线。科室培训现场照片已整体遮挡。

采纳率先跌后升,才是真实上线的样子

右下角那条采纳率曲线值得单独看:75.52% → 54.55% → 58.25% → 61.77% → 76.13%

第一个月 75% 是试点科室的数字——人少、场景窄、参与者有动力。第二个月全院推广,采纳率立刻跌到 54%,因为用户从”愿意试的人”变成了”被要求用的人”,科室差异、模板不匹配、术语不对的问题全部暴露。接下来两个月做专科调优,缓慢爬回 61%。稳定使用后回到 76%,比试点期还高。

这条 U 型曲线几乎是所有院内 AI 推广的共同形状。真正的风险是在第二个月——如果那时把 54% 当作”项目失败”,专科调优就永远不会发生。判断一个 AI 产品能不能活下来,看的不是首月峰值,而是团队有没有准备好熬过第二个月的下跌。

同期”活跃率”曲线也走了同样的形状:78% → 66% → 72%。生成数量则是另一个故事——第三个月冲到 1726 份的峰值后逐月回落到 1039 份。这未必是坏事:早期有大量尝鲜式生成,后期沉淀为稳定的真实需求。但它同时提醒一件事,生成量不适合作为核心考核指标,否则科室会为了数字去生成不需要的文书。

医生、医务质控与医院管理三个层面的临床价值
价值不只在节省时间。更重要的是把缺项与矛盾提示前移到签发之前,并把模板、规则和反馈沉淀为组织能力。

阶段性数字还需要一张“口径表”

指标材料披露正式评估前需要补齐
单份病历书写时间约 30 分钟降至约 5 分钟文书类型、医生样本、是否包含复核时间
住院病历时长缩短约 85%与上一行是否同源;基线如何测得
病历质量提升约 60%用哪套评分表、由谁评、盲评与否
平均 AI 采纳度约 61%“采纳”的字段或文书级定义、修改幅度、统计周期
覆盖科室约 40 个上线、试用或活跃使用的区分
累计生成量约 25.8 万份统计区间;是否含废弃与重复生成
临床科室平均活跃率71% 以上活跃的定义(登录/生成/采纳)与分母

建议同时观察文书缺陷率、严重缺陷拦截率、误报率、平均修改字数、签发前后返工时间和医生净推荐值。效率上升但质量下降,或者采纳率很高却依赖大量重写,都不能算成功。

从单点生成走向全院质控平台

单个科室可以从一类高频文书起步,但规模化需要统一平台:

  • 统一对接院内数据,并落实最小必要访问;
  • 统一管理模型、规则、提示词、专科模板与版本;
  • 统一记录输入、生成、修改、拒绝和签发全过程;
  • 统一评估采纳率、修改率、缺陷发现率与医生负担;
  • 在平台能力之上,由各科室沉淀自己的模板和知识。

这样,文书生成不再是一个孤立功能,而会逐步升级为全院病历质量能力。

从应用场景、智能体管理、智能体操作系统到模型与数据底座的医疗 AI 平台架构
平台化路径。应用场景共享智能体管理、审计、模型与数据底座,再由各科室沉淀专科知识。

上线前必须写清楚四条边界

  1. 数据不出院:优先院内部署,最小必要访问,全过程留痕。
  2. AI 仅辅助:输出候选文书或风险提示,不形成正式诊断。
  3. 医生终审签发:所有正式医疗文书由医务人员确认、修改并签发。
  4. 异常实时提醒:危急征象、逻辑矛盾和必填项在签发前提示,并保留审计证据。

除了原则,还需要把责任写进系统:

  • 每一段生成内容标记来源、模型版本、模板版本与生成时间;
  • 医生的接受、编辑、拒绝和最终签发形成完整审计链;
  • 高风险提示不得静默消失,忽略时需要记录原因;
  • 模板、规则和模型更新先灰度验证,再进入正式环境;
  • 发生异常时可以定位到输入、输出、操作者和版本,并可快速回滚。
医疗文书 AI 上线需要满足的数据、责任、审计与推广边界
上线门槛。数据不出院、AI 仅辅助、医生终审签发和异常实时提醒,需要同时成为产品机制与管理制度。

建议从六周真实验证开始

选择一个科室、一类高频文书,以真实工作流完成首轮验证:

  1. 明确数据范围、责任边界与评价指标;
  2. 记录每一次接受、修改、拒绝和质控结果;
  3. 同时观察医生负担、文书质量与流程时长;
  4. 每周复盘误报、漏报、重写和异常案例;
  5. 达标后再复制到更多科室、文书与机构。

六周验证不应只做一场演示。第一周完成基线与权限梳理,第二至三周进入小范围真实使用,第四周根据医生反馈调整模板与交互,第五周扩大样本,第六周完成与基线的对照复盘。只有质量、效率、体验和安全四类指标同时达标,才进入下一科室。

让医生少写,让文书更准,让知识持续沉淀。