*仅供医学专业人士阅读参考
![]()
心衰筛查的新工具来了?AI-ECG的潜力与局限
整理:易艾蓝
超过50%的心衰患者首次确诊时已处于急性失代偿住院阶段,这意味着大量本可在无症状或症状轻微阶段进行的早期干预被错失。现有筛查手段各有局限:利钠肽检测需抽血,超声心动图依赖专业设备和操作人员,二者均难以在社区大规模无症状人群中普及。相比之下,心电图廉价、无创、可及性高,是基层医疗和健康体检中广泛应用的常规检查项目。心衰患者的心脏结构和功能改变常伴随电活动异常,但这些异常在常规心电图上可能表现细微或非特异,人眼难以识别。那么,擅长从大规模数据中学习微弱模式的AI,能否从心电图中识别出心衰的早期信号?
2026年欧洲心脏病学会(ESC)年会发布的两项人工智能增强型心电图(AI-ECG)研究从不同角度回应了这一问题。一项研究汇集了瑞士巴塞尔大学医院五项前瞻性研究数据,在7,124例受试者中外部验证了两个已发表的AI-ECG模型(DeepECG和ECG2HF),评估其检测心衰及HFrEF的判别能力。;另一项研究则聚焦于心衰的更早期阶段——无症状性左室舒张功能障碍(LVDD),基于单中心回顾性数据探索AI-ECG用于大规模筛查的潜在可行性。
外部验证:7,124例欧洲人群中的审慎结论
AI-ECG模型近年来不断涌现,但能够在大规模、多场景外部队列中得到系统验证者仍属少数。一项来自瑞士巴塞尔大学医院的研究整合了五项前瞻性队列数据,涵盖门诊诊断人群、心血管外科围术期高危患者、心脏康复人群及经导管主动脉瓣植入术(TAVI)患者等五个临床场景,共纳入7,124例具有明确心衰状态的受试者(中位年龄70岁,32%为女性),其中3,153例(44%)为确诊心衰患者,包括射血分数保留的心衰(HFpEF)21%、射血分数中间值的心衰(HFmrEF)7%、射血分数降低的心衰(HFrEF)16%(三类亚型占确诊心衰患者的比例之和为44%)。
![]()
图1:讲者报告图
研究对两个已发表的深度学习模型进行了外部验证:DeepECG为加拿大模型,其训练目标为LVEF<40%(即HFrEF的替代终点);ECG2HF为美国模型,训练目标为基于纵向电子健康记录数据预测未来心衰事件。主要终点为模型对心衰的横断面检测能力,次要终点为HFrEF的检测能力。
结果显示(图2):在总体心衰检测方面,DeepECG与ECG2HF的受试者工作特征曲线下面积(AUC)分别为0.72(95% CI: 0.71-0.73)和0.73(95% CI: 0.71-0.74),二者性能相当,总体判别能力为中等水平。在HFrEF检测方面,DeepECG的AUC显著优于ECG2HF,分别为0.90(95% CI: 0.89-0.91)和0.85(95% CI: 0.84-0.87),精度-召回曲线下面积(AUPRC)分别为0.52与0.35。将两个模型的输出进行组合后,各终点指标均有一致性提升:心衰检测AUC提升至0.74,AUPRC提升至0.71;HFrEF检测AUC提升至0.91,AUPRC提升至0.54。这一现象提示,两个模型均可能捕捉到心衰不同维度的ECG特征。DeepECG更侧重于与收缩功能障碍相关的电学改变,ECG2HF则可能识别出更为广泛的结构或功能异常信号,二者具有互补性。而二者联合使用时性能的提升,提示单一模型可能仅捕捉到心衰的某一侧面,反映出基于替代终点训练的模型在推广至全谱心衰检测时可能存在信息损耗。
![]()
图2:DeepECG与ECG2HF模型检测心衰(HF)及HFrEF的受试者工作特征(ROC)曲线与精确率-召回率(PR)曲线
向更早期延伸:LVDD检测的探索性研究
如果说第一项研究回答的是“已有AI-ECG模型在真实世界中的表现如何”,那么第二项研究则提出了一个更具前瞻性的问题:AI-ECG能否识别心衰的更早期阶段——尚无临床症状的LVDD?
![]()
图3:讲者报告图
一项来自韩国的回顾性研究分析了2020至2023年间单中心21,385例患者的46,564对心电图-超声心动图数据(匹配时间窗±14天)。研究者依据2016年ASE/EACVI指南推荐的四个参数(平均E/e'比>14、间隔e'速度<0.07 m/s或侧壁e'速度<0.10 m/s、三尖瓣反流速度>2.8 m/s、左房容积指数>34 mL/m²)定义LVDD,超过半数参数异常者判定为LVDD。按患者层面以7:1:2的比例随机划分为训练集、验证集和测试集,测试集中LVDD患病率为15.3%。模型采用Vision Transformer架构,经预训练后针对LVDD分类任务进行微调。
结果显示,模型在验证集和测试集中的AUROC分别达到0.908(95% CI: 0.893-0.922)和0.913(95% CI: 0.903-0.924)。以验证集上敏感度与特异度相等时的概率值为阈值,模型在测试集中实现敏感度0.838、特异度0.825、准确度0.827。阳性预测值为0.463,阴性预测值为0.966,后者提示模型阴性结果具有较高的可信度,支持其作为大规模社区筛查中“排除工具”的潜在用途。
![]()
图4:人工智能模型检测LVDD的受试者工作特征(ROC)曲线及模型性能指标
需注意,该研究的局限性需审慎考量:数据来源于单中心回顾性队列,模型的泛化能力尚待外部验证;LVDD的参考标准虽依据国际指南,但超声参数的测量本身存在一定的操作者依赖性;在LVDD患病率更低的社区人群中,模型的阳性预测值可能进一步下降,需在实际筛查场景中进一步评估。
结语
从现有证据来看,当前AI-ECG模型在全谱心衰的外部验证中判别能力为中等水平(AUC约0.72-0.74),尚不足以作为独立的筛查工具。但在HFrEF亚组中,DeepECG的AUC达0.90,提示收缩功能显著下降的患者其心电信号中可能蕴含更强的可识别特征;模型联合策略亦被证实可进一步提升性能。将检测窗口前移至LVDD阶段,AI-ECG展现出更高的筛查潜力,韩国研究模型AUROC超过0.90,且NPV高达0.966,意味着心电图正常者极大概率不存在显著的舒张功能异常,而阳性结果仍需超声确认,其定位更适合作为“排除工具”而非“确诊工具”。
上述发现为AI-ECG的未来研究指明了若干方向。首先,训练目标应直接锚定金标准心衰诊断(而非替代终点),以减少信息传递过程中的损耗。其次,当前验证主要基于回顾性数据,尚需在真实社区人群中开展前瞻性研究,以验证AI-ECG筛查能否真正改变心衰确诊时机并改善患者长期预后。此外,模型在不同地区、不同患病率人群中的外部验证亦是推动其临床转化的关键环节。
医学界心血管领域交流群正式开放!
加入我们吧!
![]()
责任编辑:银子
*“医学界”力求所发表内容专业、可靠,但不对内容的准确性做出承诺;请相关各方在采用或以此作为决策依据时另行核查。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.