点击蓝字
关注我们
AI TIME 欢迎每一位 AI 爱好者的加入!
本文作者|黄泊菘
论文整理|蒲诗瑶
ICML 2026
论文题目:Learning Cardiac Latent Representations in Vectorcardiogram Space
第一作者:黄泊菘
论文链接:
https://arxiv.org/abs/2605.31249
论文项目链接
https://github.com/BosonHwang/LVCG
项目主页:
https://bosonhwang.github.io/LVCG-page/
12 导联心电图(ECG)是心脏医学的核心工具,但从数学角度审视,其信号冗余度极高。事实上,12 个导联中有 4 个可通过另外两个经线性运算精确推导得出:
III = II − I
aVR = −(I + II) / 2
aVL =(I − III) / 2 (= I − II/2)
aVF =(II + III) / 2 (= II − I/2)
上述关系并非近似,而是精确恒等式。然而,当前心电深度学习的主流方法仍是将 12 个导联作为独立输入通道馈入网络,导致模型浪费大量算力去重新学习这些固定的线性关系,而非捕捉真正的心脏结构特征。更严重的是,这种做法可能导致预测结果违反导联几何约束,产生生理上不可能的波形。
二、“可观测空间”的局限性
究其本质,12 导联 ECG 是什么?在经典 Frank 模型下,心脏任意时刻的电活动可概括为一个三维向量 v(t),即向量心电图(Vectorcardiogram, VCG)。每个导联仅是该向量在特定方向 uₗ上的投影:
eₗ(t) = uₗᵀ v(t)
每个导联实为三维偶极子环的平面切片。在 ECG 空间中,P/QRS/T 波群挤在一条线上;而在 VCG 空间中,它们则呈现为清晰的环状结构。这意味着,12 导联 ECG 并非 12 个独立信号,而是同一三维物体的 12 个线性视角。这种特性带来了两个阻碍泛化能力的问题:
-
冗余性(Redundancy):各视角本质上是彼此的线性组合,在导联空间学习相当于将与生理无关的相关性强行编码进表征中。 -
与采集几何的纠缠(Entanglement):观测数据本质是“心脏信号⊗采集几何”。电极位置微调、个体体导电率差异、设备增益与滤波设置等均会重塑波形。因此,基于导联训练的模型往往同时学习了病人特征与特定“录制设备”特征,一旦跨医院、跨设备或跨人群应用,性能便显著下降。
真正的关键信息存在于上游源头。
三、核心思路:回归隐式 VCG 空间学习
LVCG(Latent VCG)是首个直接在隐式 VCG 空间而非可观测导联空间进行表征学习的通用自监督框架。其预训练任务简洁且完全无需标签:多导联重建。具体流程如下:
抬升(Lift,ECG → VCG):利用导联几何矩阵的 Tikhonov 正则最小二乘逆,将可见导联映射回三维向量。此步骤纯物理驱动,无可学习参数,杜绝了几何层面的“作弊”可能。
编码(Encode):共享编码器将每个心拍的 VCG 片段压缩为紧凑 token(保留形态、剔除冗余),并通过循环模块自回归建模心拍间动态,同时将 R–R 间期编码为节律嵌入。
投影(Project,VCG → ECG):将预测的 VCG 片段通过固定几何投影回目标导联,以重建被遮蔽部分。
LVCG 预训练流程:从可见导联抬升至隐式 VCG 空间,在源空间编码心拍形态与时序动态,再投影回 ECG 空间重建缺失导联。
由于几何固定且表征具备视角不变性,LVCG 不再耗费资源重学导联间的平凡代数关系,而是专注于提取具有诊断价值的心脏电活动轨迹紧凑表征。
四、关键实验结果
LVCG 的优势在临床真实场景——标签稀缺、跨机构迁移及算力受限条件下尤为显著。
1. 标签越少,优势越大
冻结主干 + 线性头,6 个下游数据集平均表现。实线表示均值,短杠代表各基准测试。
在 1% 和 10% 标签量下,LVCG(绿线)稳定领先 HeartLang(橙线)和 ST-MEM(紫线);即便在 100% 标签量时 HeartLang 略占优,LVCG 仍具强竞争力。平均 AUC@1% 数据显示:LVCG 为 67.3,HeartLang 为 63.8,ST-MEM 为 56.4。这正是“学习源头”在数据稀缺场景下的典型表现。
2. 跨域距离越远,增益越高
横轴为与 MIMIC-IV-ECG 预训练域的 Fréchet 距离(对数坐标),纵轴为 LVCG 相对 HeartLang 在 1% 标签下的 AUC 增益。Pearson 相关系数 r = 0.78。
所谓“换医院就掉点”,本质是在投影空间过度学习了采集几何特征。离预训练域越远(如 CPSC2018),LVCG 的领先幅度越大(CPSC @1% 提升 +10.6 AUC)。
t-SNE 可视化显示:相比 ST-MEM 和 HeartLang,LVCG 的诊断类别聚类更清晰,证明 VCG 空间表征在分布偏移的目标域上更具稳定性。
3. 高效轻量,性能卓越
LVCG 以 8.3M 参数量实现 1% 标签下 67.3 AUC,推理速度约 1.2 ms/样本,在同量级模型中占据 Pareto 前沿。相较之下,HeartLang 需 39M 参数且推理耗时约 16.5 ms。LVCG 在保持轻量、可部署的同时,未牺牲稀缺标签下的性能表现。
补充结果概要
|
|
|
|
|
|
|
|---|---|---|---|---|---|
|
|
|
|
|
|
|
| LVCG | 0.49 | 0.47 | 69.04 | 63.51 | 71.68 |
多导联重建(3→12)与跨领域迁移表现同样领先。消融实验显示,移除物理先验后,Super-class AUC@1% 从 75.33 骤降至 51.26。
左图:Nef-Net(MSE 0.69);右图:LVCG(MSE 0.34)。绿色为输入的 3 个可见导联,红色为需重建的 9 个导联;灰线代表真值,彩线为预测结果。
五、未来展望
LVCG 成功验证了“先在源空间学习、再投影回导联”的技术路径,但仍有多维拓展空间:
更少导联、更强重建:从 3 导联进一步推演至 1–2 导联的可穿戴应用场景。
跨设备、跨人群零样本迁移:利用固定几何层天然解耦采集差异的优势。
心电大模型预训练底座:探索 VCG 空间表征是否可成为下一代 ECG Foundation Model 的默认起点。
拓展至非心脏疾病:肾病、糖尿病、脓毒症等初步结果表明,物理约束表征有望拓宽生理 AI 的应用边界。
作者简介
黄泊菘,本文第一作者,格里菲斯大学博士生,研究方向为生理信号表征学习与医疗多模态大模型。
金明,格里菲斯大学副教授、本文通讯作者,研究方向为时间序列智能与时空数据挖掘,相关工作发表于 NeurIPS、ICML、KDD 等顶级会议。Google Scholar 被引近 8000 次,入选 IEEE Computer Society 2025 全球 AI 杰出青年学者(30 Under 30)。
潘世瑞,格里菲斯大学信息与通信技术学院教授、本文通讯作者,主要从事人工智能、数据挖掘与机器学习研究,在图学习与大模型基础等方向带领团队开展长期系统性工作。
关于 AI TIME
AI TIME 源起于 2019 年,旨在发扬科学思辨精神,邀请各界人士对人工智能理论、算法和场景应用的本质问题进行探索,加强思想碰撞,链接全球 AI 学者、行业专家和爱好者,希望以辩论的形式,探讨人工智能和人类未来之间的矛盾,探索人工智能领域的未来。
迄今为止,AI TIME 已经邀请了 2000 多位海内外讲者,举办了逾 800 场活动,超 1000 万人次观看。

