首页
看点啥
插画图片
首页 看点啥 基于超1万肿瘤样本训练:哈佛医学院等提出泛癌症基础模型COMPASS:平均性能优于22种现有方法

基于超1万肿瘤样本训练:哈佛医学院等提出泛癌症基础模型COMPASS:平均性能优于22种现有方法

2026-07-21 0

来自哈佛医学院、罗氏制药及浙江大学的研究团队提出一种泛癌症基础模型 COMPASS。该模型基于来自 33 种癌症类型的 10,184 个肿瘤样本进行训练,并在 7 种癌症、6 种免疫检查点抑制剂覆盖的 16 个临床队列中进行评估。结果显示,COMPASS 的平均性能优于 22 种现有方法,在不同队列中平均将预测准确率提升了 8.5%。

过去十余年,免疫检查点抑制剂(immune checkpoint inhibitors, ICIs)已经改变了癌症治疗格局,但其并非对所有患者有效,即使接受同一种免疫检查点抑制剂治疗,不同患者之间仍然存在明显疗效差异。一部分患者能够获得长期缓解,而另一部分患者则几乎无法产生治疗响应。因此,提高免疫检查点抑制剂响应预测能力,并识别影响治疗响应与耐药的关键机制,对于指导个体化治疗和改善患者预后至关重要。

目前,临床研究已经探索了多种预测免疫治疗疗效的生物标志物,其中,肿瘤突变负荷(TMB)、程序性死亡配体 1(PD-L1)免疫组织化学检测(IHC)等指标已经被用于部分临床决策,然而这些指标仍存在明显局限。随着高通量测序技术的发展,RNA 测序(RNA-seq)提供了一种观察肿瘤免疫状态的新方式,但如何从数万个基因表达数据中提取真正与治疗响应相关的生物学规律,仍然是一项巨大挑战。

在此背景下,来自哈佛医学院、罗氏制药及浙江大学的研究团队提出一种泛癌症基础模型(pan-cancer foundation model)COMPASS。该模型基于来自 33 种癌症类型的 10,184 个肿瘤样本进行训练,并在 7 种癌症、6 种免疫检查点抑制剂覆盖的 16 个临床队列中进行评估。结果显示,COMPASS 的平均性能优于 22 种现有方法,在不同队列中平均将预测准确率提升了 8.5%,将精确率-召回率曲线下面积(area under the precision-recall curve, AUPRC)提升了 15.7%。此外,COMPASS 能够泛化至在微调阶段未涉及的癌症类型和治疗方案,有望用于辅助治疗适应症选择和患者分层。

相关研究成果以「Generalizable AI predicts immunotherapy outcomes across cancers and treatments」为题,已刊登 Nature Medicine。

研究亮点

COMPASS 利用概念瓶颈 Transformer(concept bottleneck transformer),基于整体肿瘤转录组数据预测免疫治疗响应情况

COMPASS 通过 44 个具有生物学基础的免疫概念对基因表达进行编码,这些概念涵盖免疫细胞状态、肿瘤—微环境相互作用以及信号通路等关键生物过程

COMPASS 不仅能够预测免疫治疗响应,还能够提供用于临床试验设计和转化医学研究的机制假设线索。

论文地址:https://www.nature.com/articles/s41591-026-04502-7

覆盖多癌种、多治疗方案的大规模数据集

为了建立具有泛化能力的模型,研究团队并未局限于单一癌种或单一临床试验数据,而是整合了多个公开数据库中的转录组数据和免疫治疗队列。

在模型预训练阶段,研究团队利用了癌症基因组图谱(The Cancer Genome Atlas,TCGA)数据库中的泛癌种 RNA 测序数据。初始数据包括 11,274 个样本和 60,660 个基因,经过去除正常组织样本、去除既往接受治疗的样本、去除非福尔马林固定石蜡包埋(non-FFPE)样本筛选,并根据「bcr patient barcode」患者编号进行患者级别聚合,最终选择 15,672 个蛋白编码基因作为模型输入。

随后,为了训练模型预测免疫治疗响应能力,研究团队进一步收集了 16 个临床队列中 1,133 名患者的治疗前整体 RNA 测序数据(bulk RNA-seq)以及临床治疗结果(如下图)。

临床队列概览(该数据集涵盖了不同规模的临床队列、患者癌症类型、药物治疗方案以及治疗响应结果)

这些队列覆盖 7 种癌症类型,包括膀胱癌、肾透明细胞癌、黑色素瘤、肺腺癌、肺鳞癌、胃癌以及胶质母细胞瘤等;在治疗方案方面,数据涵盖多种免疫检查点抑制剂治疗方案,包括抗 PD-1/PD-L1 治疗、抗 CTLA-4 治疗以及联合治疗方案。

不同队列规模从 16 名患者到 298 名患者不等,根据治疗结果,患者被分为:

响应者(responders):346 人,占 30.5%,包括完全缓解(complete remission)或部分缓解(partial remission)患者;

非响应者(non-responders):787 人,占 69.5 %,包括疾病进展(progressive disease)或疾病稳定(stable disease)患者。

该数据集覆盖了不同癌症适应症、治疗方案、测序平台以及研究设计所带来的高度异质性。

COMPASS一种能够跨癌种应用的基础模型

COMPASS 是一种能够跨癌种应用的基础模型(pan-cancer foundation model),该模型能够从转录组数据中学习具有可解释性的肿瘤—免疫概念(tumor-immune concepts)。COMPASS 采用概念瓶颈架构,将患者的转录组数据通过一系列人类可理解的生物学概念进行映射。例如,在视网膜影像分析领域,此类模型可以首先预测组织和病灶图谱,再利用这些中间预测结果辅助诊断分流。

COMPASS 模型由三个主要部分组成,整体架构如下图所示:

基因语言模型(gene language model, GLM):作为模型的编码器(encoder),用于生成单个基因的上下文表征;

分层投影器(hierarchical projector):将基因层面的嵌入表示转换为高层次生物学概念,包括免疫细胞类型、信号通路等。;

分类器(classifier):基于概念表示完成免疫治疗响应预测。

COMPASS 模型架构

①基于 Transformer 的基因语言模型(Gene Language Model)

研究团队借鉴自然语言处理领域 Transformer 架构,将每一个基因视为一个“token”,通过模型学习不同基因之间的上下文关系。不同于语言中的词语具有固定顺序,基因表达数据本质上是无序的。因此,COMPASS 引入了可学习的基因位置偏置,使模型能够根据训练数据自动学习不同基因之间潜在关联。

②基于概念的分层投影器(Concept-based hierarchical projector)

COMPASS 遵循概念瓶颈(concept bottleneck)范式。在该范式中,输入数据并不是直接从潜在特征映射到预测结果,而是首先经过一层人类可理解的概念层。COMPASS 首次将这一架构引入癌症转录组分析领域,通过利用免疫相关基因集,并建立:基因(gene)→ 基因集(gene set)→ 概念(concept)的层级映射关系,用于表征每位患者的肿瘤免疫微环境。

③预测模块(Prediction module)

COMPASS 利用这些免疫概念特征,对患者接受免疫治疗后的响应概率进行预测。同时,模型支持多种适配方式,包括无需重新训练的零样本预测(NFT)、仅调整分类层的轻量微调(LFT)、部分参数微调(PFT)以及全模型微调(FFT)。

此外,研究团队还提出了多阶段微调策略(Multi-stage Fine-tuning,MSFT)。该方法首先利用泛癌免疫治疗数据学习通用免疫响应规律,再针对具体药物或癌症类型进行进一步优化,从而提升模型在新治疗场景中的预测能力。

COMPASS 在跨癌种、跨药物预测中展现优势

多项研究结果显示,COMPASS 在多个测试场景中均表现出了较强的预测能力。

1.COMPASS 在 16 个免疫治疗队列中实现领先预测性能

面对 16 个临床队列,研究人员将 COMPASS 与 22 种广泛应用于 ICI 响应预测的方法进行了比较。这些方法包括:单基因预测模型、免疫特征评分方法,以及基于网络和机器学习的预测模型,并采用准确率、精确率-召回率曲线下面积(AUPRC)、ROC曲线下面积(AUROC)和 Matthews 相关系数(MCC)指标评估模型性能:

*准确率(accuracy, %)结果和精确率-召回率曲线下面积(AUPRC)结果*

如上图所示,COMPASS 在所有队列规模和评价指标中均显著优于现有 ICI 响应预测方法。其中,部分微调模式(COMPASS-PFT)和线性探测模式(COMPASS-LFT) consistently取得最高的整体预测性能。

与排名第二的方法相比:

COMPASS-PFT 和 COMPASS-LFT 平均提升了 8.5% 的准确率;

平均提升了 15.7% 的 AUPRC;

平均提升了 12.3% 的 MCC 指标。

这些结果证明,COMPASS在免疫治疗响应预测方面具有更强的预测能力。无论面对大型、中型还是小型临床队列,模型性能均保持稳定,其中 COMPASS-PFT 和 COMPASS-LFT 在不同应用场景下均展现出持续优异的表现。

2.COMPASS 在免疫治疗队列内部及跨队列中均具备泛化能力

研究人员进一步评估了在训练数据仅来自单一队列的情况下,COMPASS 预测免疫治疗响应的准确性。研究采用两种基准评估策略:队列内部留一患者验证(intra-cohort leave-one-patient-out validation)和跨研究队列迁移预测(cohort-to-cohort transfer across studies)。

在队列内部验证中,COMPASS 在所有队列中均取得了最佳平均性能(部分结果如下图)。不过,模型表现会因具体应用场景而有所差异,在部分队列和精确率-召回率(precision-recall)比较中,已有方法仍然优于 COMPASS。其中,COMPASS-PFT、COMPASS-LFT 和 COMPASS-FFT 在中型和大型队列中取得了最高准确率;对于小型队列(患者数量少于30人),无需微调版本(COMPASS-NFT)表现最佳。

COMPASS 患者表征学习策略基准评估

在跨队列迁移分析中,研究人员使用基于一个队列训练的模型,预测另一个不同队列中的治疗响应情况,共完成:240 次两两队列迁移评估。结果显示:COMPASS-LFT 表现最佳,在 240 次迁移任务中成功完成 163 次模型迁移;其次为 COMPASS-PFT,成功完成 155 次模型迁移。这一表现明显优于此前发表的最佳方法,包括:PGM:130/240次成功迁移;Teff:118/240次成功迁移;NetBio:117/240次成功迁移,整体预测准确率和AUPRC结果如下图所示:

*240 次独立跨队列迁移任务中的平均准确率以及平均 AUPRC 表现*

3.COMPASS 在跨治疗方案预测中展现出较强能力

在跨适应症预测(cross-indication prediction)任务中(如下图),COMPASS-PFT 能够识别训练数据中未包含癌症类型中的治疗响应患者。例如:当训练数据中排除肺腺癌(LUAD)后,COMPASS-PFT 仍然能够在独立测试队列中达到 76.5% 的预测准确率。这一结果表明,COMPASS 能够识别抗肿瘤免疫过程中具有普适性的关键特征,而不是仅捕获某一种癌症类型特异性的转录变化。

*模型在不同生物学场景下的泛化能力评估(跨疾病类型泛化)*

在跨治疗方案和跨免疫检查点靶点评估中(如下图),COMPASS-PFT 同样表现出良好的泛化能力。例如:当模型仅利用抗 PD-1/PD-L1 治疗队列进行训练时,COMPASS-PFT 仍能够预测抗 CTLA-4 治疗患者的响应情况,并达到70.8% 的准确率。这一结果提示,不同免疫检查点治疗之间可能存在共享的免疫作用机制,而 COMPASS 能够捕获这些共性特征。

*模型在不同生物学场景下的泛化能力评估(跨治疗方案泛化和跨靶点泛化)*

研究还进一步测试了模型在不同技术因素下的泛化能力,结果显示:COMPASS-PFT 保持稳定性能,而基于基因特征签名的方法容易受到测序平台和样本来源差异的影响。这表明,COMPASS 不仅能够适应复杂的临床异质性,同时具备更强的跨技术条件泛化能力。

结语

如今,免疫治疗的发展正在进入更加精准化的新阶段。过去,临床研究更多依赖单一指标判断患者是否可能获益,例如 PD-L1 表达水平或 TMB,但肿瘤免疫系统本身是一个高度复杂的动态网络,仅靠单一指标难以完整描述患者真实免疫状态。COMPASS 提供了一种新的思路:通过人工智能从大规模转录组数据中学习复杂免疫模式,并将这些模式转化为可解释的生物学概念。

当然,研究团队也指出,COMPASS 目前仍属于探索性工具。由于模型依赖 bulk RNA-seq 数据,其空间分辨能力有限,部分低丰度免疫细胞信号可能被掩盖。同时,该模型仍需要更多前瞻性临床试验验证,才能真正进入临床决策体系。但从技术发展趋势来看,COMPASS 代表了一种重要方向——未来的医疗 AI 不应只是提高预测准确率,更需要帮助医生理解疾病机制,并为个体化治疗提供更加透明、可靠的依据。

参考文献:https://www.nature.com/articles/s41591-026-04502-7

喜欢(0)

上一篇

关于面壁智能:聊聊我的一些新思考

关于面壁智能:聊聊我的一些新思考

下一篇

WAIC之夜:Token堆不出AI原生组织

WAIC之夜:Token堆不出AI原生组织
猜你喜欢