
综述:心脏外科与外科训练中的人工智能:机会、风险及保护专业知识的保障措施
人工智能(AI)正通过预测建模、多模态成像、围手术期监测、工作流程自动化以及新兴的计算机视觉应用进入心脏外科领域。最成熟的证据涉及手术前后的风险预测。然而,即使在这一领域,系统综述表明,AI相较于传统统计模型的改进通常不大,且常规临床实施仍有限。在外科教育中,
人工智能(AI)正通过预测建模、多模态成像、围手术期监测、工作流程自动化以及新兴的计算机视觉应用进入心脏外科领域。最成熟的证据涉及手术前后的风险预测。然而,即使在这一领域,系统综述表明,AI相较于传统统计模型的改进通常不大,且常规临床实施仍有限。在外科教育中,模拟、自动化视频分析和客观绩效指标可能为刻意练习提供更多机会,并提供较少依赖个别观察者的反馈。大多数证据来自普通外科、腹腔镜手术、泌尿外科和机器人手术,而非心脏特异性训练,其可迁移性不应被假定。同样的技术也带来了风险。自动化偏见、认知卸载、减少对失败处理的暴露以及导师-受训者互动的位移,可能削弱安全心脏外科所依赖的独立判断。不透明模型、数据集偏移、不公平表现和不确定的责任归属进一步增加了临床和伦理关切。本叙述性综述考察了AI在心脏外科全程及心胸外科训练中当前和新兴的角色,同时区分了已证实的应用与合理但未经验证的用途。研究人员提出了一种基于外部验证、本地性能测试、透明预期用途、保留手动和危机管理能力、技术故障模拟、教师监督、基于能力的资质认证以及持续审计的人机共管框架。AI不应仅凭技术新颖性来评判,而应看其是否在改善护理的同时,保留了外科医生和团队在技术不可用或错误时安全操作的能力。
人工智能(AI)已从实验性领域迅速转变为当代医学的实用组成部分。机器学习(ML)是AI的子集,模型从数据中学习关联而非依赖预设规则。深度学习(DL)通过多层神经网络扩展了这一方法,可处理图像、生理信号、文本和手术视频等复杂输入。心脏外科特别适合这些方法,因其在手术前后产生大量结构化和非结构化数据,包括人口统计学和实验室变量、心电图、超声心动图和CT图像、灌注和麻醉记录、手术视频、重症监护时间序列及长期结局。这些数据可支持更个性化的风险估计、更早识别恶化、改进工作流程以及更客观地评估技术表现。然而,心脏外科是一个不容出错的环境,决策依赖时间、解剖变异、并发症的突然演变以及默会知识、团队协调和即兴应变能力。核心问题不是AI是否进入心脏外科,而是如何整合。热情可能掩盖技术可行性与临床价值之间的重要区别。模型在回顾性数据集中可能实现出色区分度,但对已有风险评分几乎没有增加,或在转移到另一机构后失败,或提供信息过晚而无法改变管理。同样,自动评估系统可能在模拟器中分类专家和新手动作,但未证明其反馈能改善手术表现或患者结局。教育后果同样需要审视:AI可能增强实践和反馈的机会,但过度依赖算法指导可能削弱独立解决问题、手动灵活性和形成外科判断的师徒关系。本综述考察AI在心脏外科全程中的角色,特别强调外科教育和专业知识的保护,有意区分已确立的证据、新兴应用和仍属推测的主张。
本文是叙述性综述而非系统综述。文献检索针对PubMed/MEDLINE、Scopus和Google Scholar,截至2026年8月8日。搜索概念结合了“人工智能”、“机器学习”、“深度学习”、“计算机视觉”和“大型语言模型”与“心脏外科”、“心胸外科”、“围手术期护理”、“外科训练”和“外科教育”;还针对心血管成像、模拟、治理、监管、数据保护和网络安全进行了定向搜索。文章综合了同行评审文献,优先考虑系统综述、荟萃分析、临床相关研究以及监管或专业来源。由于心脏特异性证据在AI支持的教育和术中计算机视觉方面仍有限,纳入了来自普通外科、腹腔镜、泌尿外科和机器人手术中选择性证据,前提是基础的教育或技术原则可迁移。这些边界被明确说明,以使其他专科的发现不被呈现为已确立的心脏外科证据。未进行PRISMA流程或正式荟萃分析。本综述考虑的主要临床、教育和治理领域总结于图1(概念图,显示AI在术前评估、术中辅助、术后管理、外科训练、治理与伦理以及预期结局中的应用,数据与决策支持跨领域运作,治理和伦理贯穿始终,观察到的结局反馈至验证和监测)。
风险预测是机器学习在心脏外科中最成熟的应用。模型已用于估计死亡率、急性肾损伤、延长通气、出血、重症监护住院时间、再入院等不良结局。系统综述描述了快速增长的文献,但指出了重复性局限:单中心数据集、回顾性设计、结局定义不一致、报告不完整、外部验证不足以及关注统计性能而非临床效用。在心脏外科术后死亡率预测的荟萃分析中,机器学习模型在C指数区分度方面未显示优于逻辑回归的统计学显著优势。最有望的增益可能来自将传统临床变量与难以纳入传统评分的高维数据相结合。DL系统可从心电图和影像研究中提取潜在特征,AI辅助心电图已在大型数据集中识别窦性心律期间的房颤特征并以高精度分类心律紊乱。在医学影像中,DL在分割、分类和特征提取方面表现强劲。对于心脏外科,这些方法可支持解剖映射、主动脉钙化评估、心室和瓣膜特征描述、导管规划或手术复杂性预测。临床贡献取决于它们是否能在专家解读和既定影像工作流程之外改善决策。一个临床有用的模型必须预测准确,且应解决明确定义的决策、使用相关时间点可用的数据、保持跨机构和患者群体校准,并提供可改变管理的信息。外部验证至关重要,但本地验证同样重要,因为转诊模式、手术策略、围手术期路径和数据质量在心脏外科项目间差异显著。校准漂移应被预期而非视为例外事件。心血管影像也是心脏外科医生、心脏病学家和影像专家之间的自然接口。AI衍生的生物标志物来自冠状动脉CT血管造影可表征斑块和冠状动脉周围脂肪组织炎症,而自动化超声心动图和心血管磁共振分析可支持量化、表型分型及影像与临床数据的整合。在手术路径中,CT-based分割和重建可改善解剖映射和手术规划。这些输出应由多学科心脏团队解读,因为影像生物标志物或自动化轮廓只有在改变患者选择、时机或手术策略时才有临床意义。
机器人心脏外科常与AI一起讨论,但两者并非同义。当前机器人平台主要提供远程操控、运动缩放、震颤减少、增强可视化和人机工程学优势;这些功能本身不构成自主智能。然而,机器人心脏外科的演变创建了一个技术平台,可在其上发展AI驱动的感知、工作流程识别和决策支持。保持这一区分很重要,因为将机器人系统的既定益处归因于AI会夸大当前证据。术中AI研究主要集中在计算机视觉上。手术视频可被分析以识别器械、解剖结构、手术阶段以及偏离预期工作流程的情况。外科数据科学旨在将视频、设备数据、生理信号和上下文信息整合到支持更安全、更可重复干预的系统中。例如,在腹腔镜胆囊切除术中,已开发语义分割模型识别解剖结构并可能支持术中指导。这些研究证明了技术可行性,但并非等效系统已准备好用于心脏外科的证据。心脏手术提出额外挑战:血液和烟雾可能遮挡视野;组织持续变形;体外循环改变生理;操作因解剖和外科医生策略而异;罕见但灾难性事件可能训练样本很少。一个有用的术中系统必须低延迟运行,识别图像质量或上下文超出其能力范围,并安全故障。当不确定性高时,不应生成看似权威的建议。目前,AI“副驾驶”的概念作为研究方向是可信的,但心脏外科中的实时自主指导仍处于研究阶段。
术后护理产生密集的时间序列数据,可能适合动态风险建模。连续的实验室、血流动力学、通气和护理数据可用于随着患者病情演变更新并发症概率。这可能比单一术前估计更有临床价值,特别是对于早期检测出血、低心输出量综合征、肾损伤、呼吸衰竭、感染或延长重症监护需求。然而,预测本身不足。警报时机、阈值选择、工作流程整合以及临床医生的预期响应必须前瞻性指定。频繁产生非可操作警报的模型可能增加认知负担而非改善护理。自然语言处理(NLP)和环境记录工具可通过起草记录、总结病历或提取结构化数据来减少文书工作。早期协同设计研究已探索AI记录助手的需求,而文书负担与职业倦怠之间的关联已得到充分证实。这些工具应被视为起草系统,而非医疗记录的独立作者。手术细节、诊断、药物变更和出院指示需要临床医生验证,因为流畅的语言可能掩盖事实错误或遗漏。AI还可协助排班、手术室利用率、重症监护床位规划和供应管理。这些是潜在高价值应用,因为它们影响整个服务的可靠性。然而,操作模型可能基于资源分配模式而非临床需求训练,从而复制历史不公平。因此,其优化目标必须明确xc官方网站:减少延迟不等于最大化患者获益,效率不应通过系统性地使复杂或脆弱患者处于不利地位来实现(表1总结了主要AI应用在心脏外科中的证据成熟度,包括风险预测、影像支持、术中指导、术后工具和训练应用,其中心脏特异性证据在风险预测中最成熟,其他多为新兴或研究性)。
模拟长期以来提供了一种练习技术任务而不使患者暴露于学习曲线早期阶段的方法。AI时代之前的随机证据表明,虚拟现实训练可改善手术室表现,基于熟练度的模拟器训练已转化为更好的腹腔镜缝合表现。AI可通过调整任务难度、检测重复错误、与专家基准比较性能以及生成针对性反馈来扩展这一教育模式。教育价值不在于模拟本身,而在于刻意练习:重复执行定义任务、即时反馈、纠正和重新评估。对于心脏外科,模拟可能特别适用于插管、冠状动脉吻合、瓣膜修复步骤、内镜器械操作、机器人控制台技能、体外循环紧急情况和转为开放手术。罕见事件尤其重要。受训者可能在完成正式训练过程中未遇到某些灾难性并发症,无法形成可靠反应。模拟可使此类暴露有意而非偶然。局限性在于后果的保真度。模拟器可再现解剖或器械运动,但无法完全再现情感压力、团队动态、组织变异或对患者操作时的伦理责任。因此,AI引导的模拟应补充分级手术责任和结构化汇报,而非取代它们。
外科技能评估传统上依赖专家观察和结构化评分量表。客观结构化技术技能评估(OSATS)建立了更可靠评估的框架,但仍资源密集且受观察者变异影响。计算机视觉和运动分析可量化器械轨迹、运动经济性、手势序列、手术时间和错误模式。DL模型已分类手术动作并从视频估计性能水平,系统综述显示自动化和AI-based评估工具数量庞大且快速增长。其吸引力显而易见:自动化系统可提供频繁的形成性反馈,识别需要改进的特定任务组件,并支持纵向追踪。它们还可能减少机构间评估变异。然而,许多系统在小型数据集、标准化模拟器任务或有限数量外科医生的记录上进行评估。实验室中的高分类精度并不能确立用于资质认证的有效性。在自动化评分用于晋升或认证之前,需要证据表明该评分反映临床有意义的胜任力、跨手术和机构稳健,且不受设备、摄像头角度、体型或偏好手术风格的影响。心胸特异性证据正在出现。2026年一项可行性研究使用AI-based手部追踪进行缝合和打结任务,发现运动衍生变量结合手术时间和传统评估可改善经验预测。这是一个有用的概念验证,但不应被解释为已验证的认证系统。适当的近期角色是形成性的:增强教师反馈并帮助受训者理解其运动模式如何随练习变化。
大型语言模型(LLM)可生成解释、临床问题、病例变体、检查表和结构化反馈。它们可能帮助受训者演练鉴别诊断、手术规划、知情同意讨论和术后沟通。其可及性是一个真正的教育优势。然而,外科教育综述显示,实施证据仍有限,且大多数AI干预集中在模拟中的技术技能评估而非患者层面结局。LLM也产生可变结果,并可能以令人信服的方式陈述错误信息。最安全的教育用途是监督和来源扎根。受训者应被教导如何对照指南和原始文献验证主张,识别不确定性,并在AI系统实质性影响教育产品时记录。模型可帮助生成病例或解释;它无法确定受训者是否理解了病理生理学、意识到证据局限性,或在病例偏离预期模式时做出安全决策。
自动化偏见发生在用户尽管有矛盾信息仍倾向于系统推荐,或因系统未发出警报而不采取行动。在手术中,这一风险因时间压力和数字输出的表面精度而被放大。显示两位小数的概率可能看起来比底层数据证明的更确定。随着时间的推移,反复接受自动化推荐可能将外科医生的角色从主动推理转变为被动确认。担忧并非每个AI使用都导致技能退化。决策支持可减少遗漏并帮助临床医生处理否则无法获取的信息。风险出现在系统取代而非支撑推理时。如果受训者持续接收逐步提示,手术可能成功完成,但缺乏持久的解剖、排序和失败管理心理模型。关键的教育测试是当指导被移除时表现是否持续。
心脏外科医生必须在影像不完整、机器人通路丢失、设备故障、出血遮挡视野或需要中转时保持胜任力。这些情况无法通过更准确地遵循正常工作流程来管理;它们需要偏离流程。主要针对常规手术训练的AI系统可能在专家判断最关键的恰恰情况下表现最差。AI诱导的手动技能侵蚀在心脏外科中尚未确立,该主张不应呈现为已证实结果。然而,这是一个合理的训练危害,受到更广泛关于认知卸载和临床机器学习意外后果的担忧支持。因此,项目应明确测量无辅助胜任力。模拟应包括导航丢失、数据损坏、错误提示、设备故障、紧急中转以及算法与手术发现之间的不一致。
外科师徒关系传递的不仅是一系列操作动作。通过观察、讨论和共享责任,受训者学习经验丰富的外科医生如何框定不确定性、从错误中恢复、与团队沟通以及决定何时不手术。这些形式的默会知识难以编码。自动化导师可能提供即时和一致的反馈,但它不承担对患者的责任,也不理解决策的机构和人际背景。因此,AI应减少低价值的教育工作量,同时保护高价值的人类互动。自动化指标可识别需要审查的时刻;教师应陪受训者解读这些时刻。视频分析系统可能标记过度的器械行程或异常序列,但导师仍负责确定该模式是否反映不佳技术、解剖约束或适当适应。
复杂模型可能为单个预测提供有限解释。即使解释方法可用,它可能描述模型行为而非因果临床推理。这在心脏外科中很重要,因为模型输入可能编码机构实践、转诊路径或治疗决策而非底层疾病。当患者群体、影像协议、设备、文档系统或临床路径变化时,性能可能下降。医学AI研究反复表明,有限的外部验证和数据集弱点可产生夸大的性能估计。广泛部署的专有脓毒症模型在外部评估中表现远差于开发时报告。算法偏见也可能当医疗支出或获取作为临床需求代理时出现,从而复制种族和社会经济不平等。负责任的部署需要代表性数据、亚组分析、前瞻性监测以及性能恶化时暂停使用的机制。
AI推荐不将专业责任转移给临床团队。部署前,机构应定义谁审查模型性能、谁响应警报、分歧如何记录以及涉及系统的不良事件如何调查。供应商应提供关于预期用途、训练数据、更新和已知限制的足够信息,以进行安全的本地治理。成本同样值得关注。新技术可通过采购、维护、集成、培训和病例选择变化增加支出,即使单个手术变得更高效。依赖专有平台也可能降低机构韧性。心脏外科项目应能在停机期间维持安全护理,并避免使基本专业知识与单个商业系统不可分离。
适当的治理模型是人机共管(human-in-command)而非仅人机循环(human-in-the-loop)。被要求点击“接受”但缺乏时间、信息或权威挑战系统的临床医生并未行使有意义的监督。人机共管意味着临床团队保留理解、质疑、覆盖并在必要时安全在没有技术的情况下继续操作的能力和操作能力(表2总结了AI整合的实用保障措施,包括外部验证、本地性能测试、透明预期用途、保留手动和危机管理能力、技术故障模拟、教师监督、基于能力的资质认证和持续审计)。首先,每个AI系统应有临床有意义的预期用途和验证计划。统计性能应与校准、临床效用、亚组性能及与现有实践的比较一同报告。其次,项目应保留无辅助胜任力。仅病例日志不足;定期评估应包括手动技术、开放中转、危机管理以及无算法支持的决策。第三,故障模式训练应常规化。受训者必须在模拟中体验错误输出和系统不可用,以便怀疑和恢复被练习而非假设。第四,自动化评估最初应为形成性。高风险使用需要跨机构有效、可靠、公平和后果的证据。第五,师徒关系应被重新设计而非减少。AI可识别学习机会并减少重复评分,使教师能专注于判断、策略和专业发展。第六,治理应包括外科医生、麻醉师、灌注师、护士、教育者、数据科学家、信息安全专家、患者和机构领导。美国食品药品监督管理局(FDA)已强调基于AI/ML的医疗软件的生命周期监督,美国外科医师学会(ACS)已开发针对AI的临床、性能和伦理方面的教育资源。欧洲部署还必须在互补框架内考虑,包括欧盟人工智能法案(EU AI Act)的逐步实施和医疗器械法规(MDR)。作为医疗器械或安全组件的AI软件可能属于高风险框架,要求风险管理、数据xc官方网站治理、技术文档、人工监督和上市后监测。手术视频、影像和受训者表现数据需要根据通用数据保护条例(GDPR)定义合法基础、数据最小化、基于角色的访问、保留限制和二次使用保障。网络安全治理应包括安全接口、访问日志、更新控制、事件响应以及针对模型或数据泄露的韧性。机构政策和同意流程应处理患者和员工或受训者数据,包括是否录制可用于评估或模型开发。最后,机构应监测AI是否以意外方式改变行为。相关结局不仅包括发病率、死亡率和效率,还包括警报负担、覆盖模式、未遂事件、受训者独立性、手动技能保留、病例分布和患者群体间差异。改善中间指标但削弱团队韧性的系统不应被视为成功。
转化为常规护理将同样依赖于实施和模型性能。监管批准是必要但不充分的:系统必须与电子健康记录、影像存档、手术室设备和监测平台互操作,而不增加重复数据录入或警报负担。临床医生接受将取决于透明预期用途、工作流程协同设计、培训、快速获取人工审查以及利益在本地实践中持续的证据。成本效益研究应包括采购、集成、网络安全、更新、员工时间、停机时间以及被取代工作流程的机会成本,而不仅仅是单次手术的技术效率。未来十年,多模态基础模型可能结合临床病史、影像、波形、实验室数据、手术视频和文本,以支持纵向预测和上下文感知决策支持。视觉-语言模型已在超声心动图中展示广泛任务迁移,但改善心脏手术决策和结局的能力仍未证实。患者特异性数字孪生可能将解剖模型与生理和计算模拟连接起来,在手术前测试手术场景;目前,这些系统是研究平台而非心脏团队判断的替代品。自主图像解读和集成决策支持平台最终可能连接术前影像、术中事件和术后轨迹。适当的终点不是无条件自主,而是校准的辅助,声明不确定性、识别分布外输入、保留可审计记录并升级到人类专业知识。前瞻性、多中心研究应在这些系统大规模采用前评估患者结局、公平性、团队行为、技能保留、互操作性和成本效益。
AI在心脏外科中有可信且潜在重要的角色,特别是在风险预测、数据整合、工作流程支持和技术表现的客观分析方面。证据最强的是预测和技术可行性;对于前瞻性临床获益、常规术中指导和心脏特异性教育结局,证据较弱。因此,主张应与数据相称。主要的教育机会不是没有教师的教学,而是更好地利用教师和实践。AI可使反馈更频繁、识别难以观察的模式并创建结构化机会来演练罕见事件。如果这些优势是通过减少手术责任、师徒关系或独立行动能力来获得的,那么其价值将丧失。心脏外科应采用与任何高风险技术相同的纪律来采用AI:明确的适应症、获益证据、透明限制、胜任用户、故障计划和持续监测。目标不是产生仅在算法支持时表现良好的外科医生,而是培养其判断和技术技能因AI而增强,并对其使用负责、在其失败时可靠的外科医生。