DiVo Gen²AI 完成 ProtT5-XL 深度微调:让蛋白质语言模型读懂 TCR 与抗原的"识别密码"
发布日期: 2026-09-20 作者: DiVo Gen²AI 研发团队
一句话概要
DiVo Gen²AI 团队基于 ProtT5-XL 蛋白质语言模型完成了 TCR-抗原肽段结合预测引擎(DiVoPostTCR)的微调训练,在验证集上达到 AUC 0.9814。该引擎将蛋白质语言模型的语义理解能力引入 TCR 识别预测——这是传统 CNN/LSTM 架构的 TCR 预测工具不具备的能力,为肿瘤新生抗原疫苗的表位筛选补上了"能不能激活 T 细胞"这关键一步。
为什么新抗原疫苗需要"TCR 结合预测"?
肿瘤新生抗原疫苗的核心挑战:不是所有能结合 HLA 的突变肽段都能被 T 细胞识别。
学术研究显示(论文数据):
- 约 10% 的体细胞突变产生高 MHC 结合力肽段
- 但其中仅约 1% 真正被 TCR 识别为有效新表位
传统计算管线在 MHC 结合预测之后就停了——无法回答"这个肽段真的能激活 T 细胞吗?"。这一步的缺失意味着疫苗设计者可能在 99% 的无效候选上浪费资源。
DiVoPostTCR 补上的就是这 1% 的筛选能力:给定一个 TCR 序列和一个肽段序列,预测它们能不能结合。
DiVo Gen²AI 的微调策略:蛋白质语言模型 + 任务适配
我们没有从零训练一个 TCR 预测模型,而是站在蛋白质语言模型的肩膀上:
为什么选 ProtT5-XL?
| 项目 | 详情 |
|---|---|
| 预训练数据 | 2.5 亿条 UniRef 蛋白质序列 |
| 预训练任务 | 去噪自编码(masked language modeling) |
| 学到的能力 | 蛋白质序列的进化语义——氨基酸上下文规律、序列模式背后的结构约束 |
| 参数规模 | 12.3 亿 |
传统 TCR 预测工具(CNN/LSTM 架构)只能从 TCR-肽段配对数据中学习配对规律,训练数据有限(VDJdb 约 8.5 万对)。而 ProtT5-XL 预训练时"见过"2.5 亿条蛋白质序列,对氨基酸序列的语义理解远超从零训练的小模型。
微调架构
| 组件 | 说明 |
|---|---|
| 底座 | ProtT5-XL 编码器(24 层 Transformer) |
| 冻结策略 | 冻结前 12 层,只训练后 12 层(可训练参数 6.26 亿,50.9%) |
| 任务头 | BiLSTM + 双仿射注意力(Dual Affine Attention) |
| 输入 | 肽段序列 + TCR CDR3β 序列 |
| 输出 | 结合概率(0-1) |
| 架构参考 | ProTCR(Xu et al., Briefings in Bioinformatics 2026) |
训练成果
| 指标 | 值 |
|---|---|
| 验证集 AUC | 0.9814 |
| 验证集准确率 | 93.8% |
| 训练时间 | 2 小时 10 分钟(单卡 RTX 4090D) |
| 训练数据 | VDJdb 2026-05-16:84,948 对阳性 + 84,948 对阴性 |
诚实评估:我们不回避局限
以下是我们已确认的问题和改进方向,如实呈现:
数据偏倚
VDJdb 以病毒肽段为主——CMV/EBV/Influenza 的前 3 种肽段占训练数据的 65%。模型对病毒肽段的语义理解很好,但对肿瘤新抗原肽段(突变产生的全新序列)的泛化能力需进一步验证。
参考 ProTCR 论文的标准测试→未知肽段退化比(0.77-0.84),DiVoPostTCR 在真实场景(未知肽段)的 AUC 估计为 0.70-0.83。
验证不充分
当前为随机划分验证(同一肽段可能同时出现在训练集和验证集,存在肽段泄漏)。尚未做未知肽段 hold-out 测试。
改进路线
| 优先级 | 改进项 | 预期收益 |
|---|---|---|
| P0 | 未知肽段 hold-out 测试 | 量化真实场景 AUC |
| P1 | 获取未激活 TCR 阴性数据 | 阴性样本策略对齐论文,AUC 更可信 |
| P2 | 补充 IEDB 数据 | 扩充训练集多样性,减少病毒肽段占比 |
| P3 | 肽段级训练/验证划分 | 消除肽段泄漏 |
与同类工具的差异化
| 维度 | DeepTCR | NetTCR 2.0 | ERGO-II | DiVoPostTCR |
|---|---|---|---|---|
| 架构 | VAE + CNN | CNN | LSTM + AutoEncoder | ProtT5 + BiLSTM + Attention |
| 蛋白质语言模型 | ❌ | ❌ | ❌ | ✅ |
| 看肽段 | ❌(repertoire 分析) | ✅ | ✅ | ✅ |
| 学术验证 | Nat Commun + 2025 基准 | MIRA 验证 | VDJdb/McPAS 双验证 | 自研(待验证) |
DiVoPostTCR 的独特价值是蛋白质语言模型语义理解——它通过 ProtT5 预训练获得了对氨基酸序列的深层语义表征,这是纯 CNN/LSTM 架构不具备的。一旦数据偏倚问题解决,它有望成为该领域最强的单一预测器。
团队
DiVo Gen²AI 干计算研发团队。专注前沿计算生物学与核酸药物研发。
致谢
- ProTCR(Xu M et al., Briefings in Bioinformatics 2026, 27(1):bbaf716)提供了架构参考
- VDJdb(Shugay M et al., Nucleic Acids Research 2017)提供了训练数据
- ProtT5-XL(Rostlab, HuggingFace)提供了预训练权重