稀疏数据驱动的 AI 蛋白进化:209 个标签把基因编辑器推向 97%

几百个带标签的突变,而不是几百万个,就足够让 AI 引导的进化把一个「平庸」的紧凑型基因编辑器推到 97% 的编辑效率、并在 19 个内源基因组位点上做到平均约 33%。这篇发表于《自然·生物技术》(Wan, Gold, Vure et al., 2026)的研究,把同源蛋白发现、ωRNA 支架工程和一套稀疏数据驱动的自适应框架 EvoMax 结合起来,优化了真核紧凑型 RNA 引导核酸酶 Fanzor2(Fz2)。从单个蛋白学到的适应度规律还能跨支架迁移,把多个天然失活的同源蛋白「唤醒」。转折在于小鼠体内实验:活性最强的版本反而出现了急性毒性——这个结果正在改写 AI 蛋白工程该优化什么。

为什么盯上 Fanzor2:越小越容易进体内

Fz2 的价值在于「小」:通常不足 500 个氨基酸,远小于经典 CRISPR 核酸酶,有可能把完整编辑系统装进单个 AAV 载体实现体内递送。但天然 Fz2 在哺乳动物细胞里活性有限,而且几乎没有现成的突变实验数据——这是典型的「冷启动」蛋白家族,多数 AI 方法连起步都难。

团队先从天然多样性入手:从超过 1600 条 Fz2 样序列中筛出 332 个真核同源蛋白做系统发育分析与功能筛选,最终锁定来自多噬棘阿米巴Naegleria lovaniensis)的 NaloFz2。序列比对给出一个关键结构发现:催化 RuvC 区和 DNA 结合区相对保守,而约 100 个氨基酸的 N 端结构域(NTD)差异巨大——只删掉 N 端 20–30 个氨基酸,编辑活性就完全消失,说明完整 NTD 是蛋白结构与核糖核蛋白复合物组装的基础,不只是核定位信号。

随后是 ωRNA 工程。结构预测显示天然 120 nt 的 ωRNA 含三个主要茎环;针对 SL3 区域做工程化——用 GAAA 四环替换远端环、截短并强化碱基配对——得到仅 92 nt 的 enωRNA v2(约为天然长度的四分之三),活性明显更高:使相关核酸酶 M7 活性提升 8.7 倍,并在移植 NaloFz2 NTD 后恢复了失活的 M9,说明优化后的 RNA 支架同样可跨同源蛋白迁移。再把人类 La 蛋白(hLa)融合到 Fz2 C 端,形成「核酸酶优化 + ωRNA 工程 + La 融合」的多层设计框架。

EvoMax:209 个标签驱动的三模型闭环

方法上的核心贡献是应对数据稀缺:没有用 209 个带活性标签的单点突变去训练一个复杂深度网络,而是把三类互补信息组合起来:

  • GPR(BLOSUM62 编码的高斯过程回归)从 209 个实测突变中学习局部适应度规律——单一学习器里表现最好,R² 达 0.693;
  • ESM-2(650M 参数)提供从海量天然蛋白序列中习得的进化先验;
  • ESM-IF(逆折叠模型)用 AlphaFold 预测结构做兼容性打分,拦住会破坏折叠的突变。

三类信息的权重不是固定的:早期更信任实验数据做局部优化,后期逐步加大进化先验与结构信息的比重,向更远的序列空间探索。每轮只实验验证 10–20 个候选,用最优变体开启下一轮——这是「实验—模型—实验」的紧闭环,而不是一次性预测整个序列空间。

命中率相当惊人:第一轮里 EvoMax 推荐的突变有 84% 是功能性变体,同一背景下 EVOLVEpro 只有 20%、AiCE 只有 35%。三轮迭代产出 FanzMAX v1→v3,v3 与 enωRNA v2 组合后报告系统活性比天然 NaloFz2+天然 ωRNA 提高 13 倍以上。在真实位点 CXCR4 上,编辑率从天然的约 12% 升到 FanzMAX v3 的 66%,加上 hLa 融合后达到约 97%。扩展到 19 个内源位点,FanzMAX v3-hLa 平均约 33%——相比天然系统(约 3.4%)提升约 10 倍,相比已有工程化紧凑编辑器(enNlovFz2 约 11%、enCnCas12f1 约 12.5%)提升约 2.7 倍。靶向范围也变宽了:兼容更多 5′-ANNG 序列(ACAG、ACTG、AATG);在 CXCR4 上达到约 97% 在靶编辑时,多数候选脱靶位点低于 1%。

复用而非重启:让失活的同源蛋白「复活」

团队随后提出了更难的题目:从 NaloFz2 学到的规律能不能迁移到其他 Fz2,甚至复活天然失活的成员?他们把完整 NTD 移植进 NTD 截短或高度分化的失活同源蛋白,配合 enωRNA v2,再让 EvoMax 挑选高潜力突变——每个蛋白只引入 2–5 个突变。

结果多个同源蛋白恢复了可检测的编辑活性,M2、M5、M8 效果最明显;M2、M3 经过第二轮优化(G298A、I368L)又获得约 1.9 倍与 2.5 倍提升;整个过程中 55%–70% 的模型推荐变体优于对应亲本。方法学含义很清楚:适应度约束至少有一部分是「家族级」的,一小批高质量数据不仅能优化一个蛋白,还能成为整个蛋白家族的工程起点。

体内警告:活性更强 ≠ 更安全

Fz2 的紧凑尺寸让单 AAV 系统成为现实。HuH-7 细胞中,逐代开发的 AAV 1.0→2.0→3.0 达到约 50%–68% 的编辑效率;小鼠体内,3.7 kb 的 AAV 1.0 在肝脏产生约 25% 的编辑、使循环 PCSK9 降低约 34%,且未观察到明显毒性。但效率更高的 AAV 2.0 和 3.0 在系统给药后 7–14 天内引发急性发病,并伴随更多大型基因组缺失——过强的核酸酶活性与 DNA 损伤本身就是肝细胞毒性来源。

这直接改写了治疗性编辑器优化的目标:适应度函数不应是「最大化编辑效率」,而要在活性、靶向范围、修复产物与安全性之间寻找窗口。对瞄准单 AAV 体内基因编辑的新一代紧凑编辑器来说,这是论文结果与药物之间的分水岭。

产业含义:蛋白工程进入「少样本时代」

撇开头条数字,三个结构性信号值得单独拎出来。第一,少样本自举开始可行:几百个标签 + 语言模型先验 + 结构过滤器就能在巨大序列空间里导航,无需大规模深度突变扫描,这改变了新发现蛋白家族的工程经济学。第二,跨支架迁移把一份数据变成平台:唤醒失活 Fz2 的同一套打法,理论上可以平移到整族酶和编辑器。第三,目标函数本身在重写:AI 生成的编辑器走向临床时,「活性」不再是唯一指标,体内毒性必须进入模型迭代回路。这些趋势与 AI for Science 的整体演进一脉相承——从生物学的世界模型,到用真实发现而非考试来评价 AI 科学家,能力与评价正在同步成熟。

可以抄的作业

对正在做 AI 引导蛋白/编辑器工程的团队,这项研究几乎就是一份模板:

  • 不要等大数据集。几百个高质量实测突变就能撑起一个可用闭环(本篇 209 个标签,GPR 组件 R²=0.693)。
  • 融合三类信号:经验回归(GPR)+ 蛋白语言模型先验(ESM-2)+ 结构兼容性过滤(ESM-IF),不要指望单一模型扛起整个回路。
  • 迭代中动态调权——早期信实验数据,后期用进化与结构信息拓宽探索;每轮只做 10–20 个实验验证。
  • 工程对象不止蛋白:RNA 支架与融合结构域(enωRNA v2、hLa)的贡献不亚于序列突变——优化整个复合物,而不是只改残基。
  • 治疗性编辑器重新定义目标:把在靶/脱靶比例、修复产物与体内毒性终点纳入度量,把「活性最强」当作待筛选的假设,而不是要冲刺的指标。

FAQ

只有几百个数据点,AI 凭什么能把蛋白进化得更好?

EvoMax 融合了三类互补信号:209 个实测单点突变上的 GPR(R²=0.693)、来自海量天然序列的 ESM-2 进化先验、以及 ESM-IF 结构兼容性检查;每轮只验证 10–20 个候选,首轮命中率 84%(EVOLVEpro 20%、AiCE 35%)。三轮后 FanzMAX v3 在 CXCR4 上达到约 97% 编辑效率,19 个内源位点平均约 33%。

最活跃的基因编辑器,一定是更适合治疗的那个吗?

不是——论文的小鼠数据正好相反。单 AAV 的 AAV 1.0 实现约 25% 肝脏编辑、循环 PCSK9 降低约 34% 且无明显毒性;活性更强的 AAV 2.0/3.0 却在 7–14 天内引发急性发病,并伴随更多大型基因组缺失。治疗性编辑器必须在活性、特异性、修复产物与安全性之间权衡。

Fanzor2 是什么?和 CRISPR 相比它为什么重要?

Fanzor2 是真核 RNA 引导核酸酶,通常不足 500 个氨基酸——小到可以把整套编辑系统装进单个 AAV 载体。工程化后的 FanzMAX v3-hLa 把 TAM 兼容性扩展到 5′-ANNG 序列(如 ACAG、ACTG、AATG),在 CXCR4 达到约 97% 在靶编辑时,多数候选脱靶位点低于 1%。

发表评论

滚动至顶部