
高质量出院小结是保障患者由住院转入门诊或后急性照护的重要载体,但住院经过撰写耗时较长,也是医生职业倦怠的重要来源。既往研究提示,大语言模型可生成接近医生水平的临床摘要,但多数证据来自离线评价,其在真实工作流中的安全性、可用性及对医生负担的影响仍不明确。研究者因此开发MedAgentBrief:系统在符合HIPAA要求的院内环境中调用Gemini 2.5 Pro,仅基于病史和每日病程记录等自由文本,依次完成初稿生成、迭代更新及幻觉核查,并为关键表述添加来源引用。医生可自行决定编辑、采用或弃用。
该研究为单中心、单臂前瞻性质量改进试点,纳入斯坦福某普通内科病区11名主治医师。10周内,系统针对331名患者的384次出院生成1274份每日摘要,其中219次出院的最终记录采用了AI内容,使用率为57.0%。主要结局为医生依据美国医疗保健研究与质量局通用伤害分级,评估未经编辑摘要可能造成的最大伤害;同时评价遗漏、不准确、幻觉、引用错误、感知质量、主客观省时、职业倦怠和认知负荷。 医生共对100份摘要提供详细反馈,其中88%被认为无潜在伤害;1份被初步认为可能造成中度伤害,但独立复核认为相关建议本身适当;未发现可能导致严重伤害或死亡的摘要。最常见问题是遗漏,占25%;其次是不准确,占20%;幻觉仅占2%,且未报告错误引用。遗漏多涉及稳定慢性病、诊断不确定性及需进一步强调的细节,提示系统的主要风险不是凭空编造,而是未能识别哪些信息对临床决策最重要。职业倦怠评分由1.75降至1.20,差异有统计学意义,并降至既定倦怠阈值1.33以下;总体认知负荷下降但未达统计学显著性。7名具有匹配日志数据的医生中,5人的文书时间缩短,但最大仅约2.9分钟;然而67%的反馈认为AI节省了时间,32%估计每份摘要节省超过15分钟,65%认为AI摘要质量与常规文书相当或更好。
研究表明,代理式大语言模型可在医生审阅和自主采用的前提下嵌入真实住院流程,并以较低的医生感知安全风险提供可用初稿。其主要价值可能并非显著缩短工作时长,而是通过结构化起点实现“认知卸载”,减少从零组织信息的精神负担,从而改善职业耗竭。不过,本研究仅来自单个病区,缺乏同期对照,医生数量较少,且只有部分摘要获得安全反馈,尚不能证明因果效应或广泛适用性。未来应接入实验室、药物等结构化电子病历数据,优化生成时点,并通过持续监测和医生反馈减少重要信息遗漏。
摘译自:Grolleau F, Liang AS, Keyes T, et al. Physician-reported safety outcomes of AI-generated hospital course summaries[J]. JAMA Netw Open, 2026 . DOI:10.1001/jamanetworkopen.2026.16556.[Epub ahead of print]
(吉林大学第一医院肝胆胰内科 李凡 高沿航 报道)




