2026-09-20||Source

DiVo Gen²AI 完成 ProtT5-XL 深度微调:让蛋白质语言模型读懂 TCR 与抗原的"识别密码"

发布日期: 2026-09-20 作者: DiVo Gen²AI 研发团队


一句话概要

DiVo Gen²AI 团队基于 ProtT5-XL 蛋白质语言模型完成了 TCR-抗原肽段结合预测引擎(DiVoPostTCR)的微调训练,在验证集上达到 AUC 0.9814。该引擎将蛋白质语言模型的语义理解能力引入 TCR 识别预测——这是传统 CNN/LSTM 架构的 TCR 预测工具不具备的能力,为肿瘤新生抗原疫苗的表位筛选补上了"能不能激活 T 细胞"这关键一步。


为什么新抗原疫苗需要"TCR 结合预测"?

肿瘤新生抗原疫苗的核心挑战:不是所有能结合 HLA 的突变肽段都能被 T 细胞识别。

学术研究显示(论文数据):

  • 约 10% 的体细胞突变产生高 MHC 结合力肽段
  • 但其中仅约 1% 真正被 TCR 识别为有效新表位

传统计算管线在 MHC 结合预测之后就停了——无法回答"这个肽段真的能激活 T 细胞吗?"。这一步的缺失意味着疫苗设计者可能在 99% 的无效候选上浪费资源。

DiVoPostTCR 补上的就是这 1% 的筛选能力:给定一个 TCR 序列和一个肽段序列,预测它们能不能结合。


DiVo Gen²AI 的微调策略:蛋白质语言模型 + 任务适配

我们没有从零训练一个 TCR 预测模型,而是站在蛋白质语言模型的肩膀上:

为什么选 ProtT5-XL?

项目详情
预训练数据2.5 亿条 UniRef 蛋白质序列
预训练任务去噪自编码(masked language modeling)
学到的能力蛋白质序列的进化语义——氨基酸上下文规律、序列模式背后的结构约束
参数规模12.3 亿

传统 TCR 预测工具(CNN/LSTM 架构)只能从 TCR-肽段配对数据中学习配对规律,训练数据有限(VDJdb 约 8.5 万对)。而 ProtT5-XL 预训练时"见过"2.5 亿条蛋白质序列,对氨基酸序列的语义理解远超从零训练的小模型。

微调架构

组件说明
底座ProtT5-XL 编码器(24 层 Transformer)
冻结策略冻结前 12 层,只训练后 12 层(可训练参数 6.26 亿,50.9%)
任务头BiLSTM + 双仿射注意力(Dual Affine Attention)
输入肽段序列 + TCR CDR3β 序列
输出结合概率(0-1)
架构参考ProTCR(Xu et al., Briefings in Bioinformatics 2026)

训练成果

指标值
验证集 AUC0.9814
验证集准确率93.8%
训练时间2 小时 10 分钟(单卡 RTX 4090D)
训练数据VDJdb 2026-05-16:84,948 对阳性 + 84,948 对阴性

诚实评估:我们不回避局限

以下是我们已确认的问题和改进方向,如实呈现:

数据偏倚

VDJdb 以病毒肽段为主——CMV/EBV/Influenza 的前 3 种肽段占训练数据的 65%。模型对病毒肽段的语义理解很好,但对肿瘤新抗原肽段(突变产生的全新序列)的泛化能力需进一步验证。

参考 ProTCR 论文的标准测试→未知肽段退化比(0.77-0.84),DiVoPostTCR 在真实场景(未知肽段)的 AUC 估计为 0.70-0.83。

验证不充分

当前为随机划分验证(同一肽段可能同时出现在训练集和验证集,存在肽段泄漏)。尚未做未知肽段 hold-out 测试。

改进路线

优先级改进项预期收益
P0未知肽段 hold-out 测试量化真实场景 AUC
P1获取未激活 TCR 阴性数据阴性样本策略对齐论文,AUC 更可信
P2补充 IEDB 数据扩充训练集多样性,减少病毒肽段占比
P3肽段级训练/验证划分消除肽段泄漏

与同类工具的差异化

维度DeepTCRNetTCR 2.0ERGO-IIDiVoPostTCR
架构VAE + CNNCNNLSTM + AutoEncoderProtT5 + BiLSTM + Attention
蛋白质语言模型❌❌❌✅
看肽段❌(repertoire 分析)✅✅✅
学术验证Nat Commun + 2025 基准MIRA 验证VDJdb/McPAS 双验证自研(待验证)

DiVoPostTCR 的独特价值是蛋白质语言模型语义理解——它通过 ProtT5 预训练获得了对氨基酸序列的深层语义表征,这是纯 CNN/LSTM 架构不具备的。一旦数据偏倚问题解决,它有望成为该领域最强的单一预测器。


团队

DiVo Gen²AI 干计算研发团队。专注前沿计算生物学与核酸药物研发。


致谢

  • ProTCR(Xu M et al., Briefings in Bioinformatics 2026, 27(1):bbaf716)提供了架构参考
  • VDJdb(Shugay M et al., Nucleic Acids Research 2017)提供了训练数据
  • ProtT5-XL(Rostlab, HuggingFace)提供了预训练权重