DiscERN:面向定向扩增的进化相关天然产物基因组挖掘工具

📅 2026/8/5 12:13:15
DiscERN:面向定向扩增的进化相关天然产物基因组挖掘工具
摘要定向基因组挖掘targeted genome mining以已知天然产物家族为种子扩充结构多样性是发现活性化合物的重要策略但长期缺乏专用的、用户友好的计算工具。作者提出DiscERNDiscoverer of Evolutionarily Related Natural products一个面向用户自定义 BGCbiosynthetic gene cluster生物合成基因簇家族定向扩增的自动化工具。DiscERN 采用多模态集成方法融合四种互补算法分别从 Pfam 结构域组成、序列同源性、预测产物结构三个维度刻画 BGC 间的进化关联允许研究者根据研究目标在发现灵敏度与预测精度之间灵活权衡。作者将 DiscERN 应用于 3561 个放线菌基因组的大规模数据集并通过异源表达与调控基因过表达从Streptomyces kanamyceticusATCC12853 的一个沉默 BGC 中成功分离到discomycin A——一种新型钙依赖脂肽抗生素验证了工具的预测—实验闭环能力。DiscERN 为从基因组数据到高置信候选 BGC 优先级列表提供了一条稳健可及的路径有效衔接了in silico预测与活性天然产物发现。关键词定向基因组挖掘BGC 家族扩增DiscERN多模态集成钙依赖脂肽discomycin A文献信息Owen, J. G., Woolly, E. F., Lai, H.-E., Woolner, V. H., Little, R. F. (2026). DiscERN: an automated genome mining tool for the discovery of evolutionarily related natural products.Nature Communications, in press. https://doi.org/10.1038/s41467-026-75491-x期刊Nature CommunicationsIF 18.1在线发表2026 年 7 月 14 日代码https://github.com/MaxMeta/DiscERN研究总结DiscERN定向BGC家族扩增工具研究背景抗菌耐药危机与天然产物再挖掘沉默BGC储量巨大但缺乏定向扩增工具BiG-SCAPE与GATOR-GC主打无监督聚类工具设计四算法集成pfam向量结构域指纹blast向量与blast秩序列同源结构k-mer交集NRPS与PKS产物置信度k等于1到4可调性能评估3561个放线菌基因组六大家族手动校准k大于等于2时F1等于0.89k大于等于3时precision等于0.98实验验证S_kanamyceticus沉默CDA家族BGCSARP过表达激活加异源表达discomycin A 新型钙依赖脂肽对标与意义打BiG-SCAPE与GATOR-GC CDA任务占优F1等于0.72对比0.55与0.49衔接预测与活性分子发现背景介绍抗菌耐药AMR已成为全球公共卫生危机而细菌天然产物历来是抗生素最丰富的来源。高通量基因组测序揭示微生物基因组中BGC 数量远超已从同一菌株分离的已知化合物数大量沉默或隐秘 BGC 构成未被开发的化学多样性储备。antiSMASH 及其生态圈已实现 BGC 的系统注释但以已知天然产物家族为种子、定向挖掘其进化亲属这一假设驱动工作流长期缺乏专用工具。主流平台如 BiG-SCAPE、BiG-SLiCE、GATOR-GC 均面向无监督聚类与全局多样性概览设计虽然可通过单参考同源搜索或改造聚类工具实现多参考查询但需大量下游手工筛选效率、可扩展性、可重复性均受限。针对上述空白作者开发了 DiscERN核心思路是进化关联性可通过互补的特征空间捕捉——Pfam 结构域整体组成架构指纹、蛋白序列直接相似性、预测小分子产物结构功能化学视角。四种算法集成后用户可在穷举筛查不漏掉任何候选与高精度优先最小化后续实验浪费之间按置信度阈值调节。重要结果结果1四种互补分类算法的开发与评测作者以 MIBiG 数据库手动整理的六个抗生素家族为基准钙依赖脂肽 CDA、糖肽、大环内酯、氨基糖苷、rifamycin 类聚酮、多烯抗真菌分别构建四种分类器pfam-vec沿用 BiG-SLiCE 的 BGC 向量化思路将 antiSMASH 输出转为 Pfam 结构域presence/abundance/序列的数值向量以家族 centroid 的余弦距离阈值分类。糖肽 recall1.0rifamycin/多烯/氨基糖苷 0.83–0.92大环内酯 0.69CDA 仅 0.18提示 Pfam 架构对某些高多样化家族判别力有限。blast-vec以查询 BGC 对每一条 MIBiG 参考的累计 BLAST 分为维度构建向量centroid 法分类。灵敏度提升但特异性下降。blast-rank秩基度量——定义家族为所有已知成员在 top-k 结果中至少有 n 条 in-family hit查询若 top-1 为 in-family 且 top-k 中 in-family ≥ n 即判为命中。对碎片化和串联 BGC 伪影鲁棒性最优特异性略低于 pfam-vec。structural k-mer intersection仅 NRPS/PKS解析 antiSMASH JSON 中 ORF 的线性化单体序列转为 k-mer 特征集按最优阈值重叠度分类。五种 NRPS/PKS 家族 leave-one-out recall 0.82–0.96特异性高150 个放线菌基因组 2613 个 BGC 中仅 1 个假阳性但碎片化 BGC 因缺失完整巨合成酶模块而表现骤降。Figure 2 图示说明六家族 × 八评测维度的热力图矩阵列分别为 BRblast-rank、BVblast-vec、PVpfam-vec、KMk-mer行分别为 10–50 kb 碎片灵敏度、1–4 个串联 BGC 灵敏度、LOO 灵敏度、150 基因组集 FP 数。CDA 家族在所有方法中 PV 表现最弱KM 对 NRPS/PKS 家族整体最强。结果2集成策略置信度分级与 3561 放线菌基因组实战四算法变量表现各异作者将其集成为 DiscERNPython 命令行工具输入为用户定义的参考 BGC 家族MIBiG 编号或自备 antiSMASH gb/json与待扫描的 antiSMASH 输出目录输出按支持算法数 k1–4分级的命中 GenBank 集合可选经家族共有 Pfam 过滤。k 越高表示越多独立算法同时支持置信度越高。在 3561 个公开放线菌代表/参考基因组antiSMASH 7.0 注释得 59,236 个 BGC上以 CDA、糖肽、rifamycin 类聚酮、16 元大环内酯四家族为参考DiscERN 返回 688 个候选。手动校准各层级显示精度随 k 上升显著提升图 3。以 LOO 估计召回 实测精度估算 F1k ≥ 2召回 0.95精度 0.84F1 0.89精度—召回的最优数学平衡点k ≥ 3召回 0.80精度 0.98F1 0.85近零假阳性适合优先最小化下游实验浪费的场景即便把无法判定N/D因碎片化全部计为假阳性的最严情景k≥3 与 k≥2 的 F1 仍分别达 0.83 与 0.84。CDA 家族本身因跨属分布、序列离散度高、缺乏家族独有保守标记表现偏弱反映工具边界。Figure 3 图示说明左起四热图LOO recall、实测 precision、F1、严判 F1N/D 全计 FP行对应四家族CDA/糖肽/rifamycin/大环内酯列对应 k1–4。k≥3 时糖肽与 rifamycin 精度接近 1.0。结果3对 RiPP 家族thiostrepton-like的泛化验证为测试 DiscERN 对 NRPS/PKS 之外家族的适用性作者以 MIBiG 中 5 条 thiostrepton-like 硫肽抗生素 BGC 为参考保守肽核心便于真假判定。在 3561 放线菌基因组中返回 11 条命中9 条 k≥3。手动检查10/11 含可识别前体肽基因提取 10 条前体核心序列与已知比对8 条完全匹配已知化合物核心剩余 2 条分别在 1 位和 2 位与最近邻有差异提示潜在新成员。验证了工具对非 PKS/NRPS 家族的拓展能力。结果4BGC 亲缘可视化与候选新颖性预判DiscERN 输出整合序列相似度、Pfam 组成、产物结构三类距离的平均成对矩阵可构建树状图直观展示命中 BGC 与参考 BGC 的亲缘远近并输出 Newick 供 iTOL 可视化。在糖肽家族中DiscERN 联合树清晰划分五个已描述化合物类群与基于 A 域特异性密码子串联的系统树最接近。对四家族 688 个命中点检29 个 BGC 的预测 NRPS/PKS 域组成与底物特异性明显异于最近已知亲属提示编码新化合物85 个与最近亲属完全一致此数为保守估计未计入 rifamycin/糖肽家族常见的 scaffold 后修饰差异。Figure 4 图示说明a 脂肽、b 糖肽两家族命中聚类树平均三类距离叶端彩条为 k-mer 算法给出的聚合物相似度黑点为已表征参考 BGC右侧展示预测底物特异性异于最近亲属的候选红色高亮差异位点。糖肽 a 中示例预测与已知在 Asp3/Asn9 等处差异。结果5discomycin A 的发现、激活与结构解析从 CDA 家族命中列表中作者选取S. kanamyceticusATCC12853 中一个无既往 CDA 活性报道、含 SARP 调控基因的沉默 BGC命名为dsc跟进。dsc BGC 与S. coelicolorcda 类似11 模块 NRPS 分三连基因含 Hpg 生物合成dscAJKL与 Glu 3-甲基化dscV但 A 域特异性提示与 CDA 在 3、9、11 位残基不同含 II 型 FAS 脂质尾系统但缺失 CDA 的 2,3-环氧己酰所需 desaturase/epoxidase而带一个 FAALdscE暗示FAS 合成 → FAAL 腺苷酸化释放 → 转接 NRPS的混合脂质化机制区别于经典 CDA 与 daptomycin 路径。激活策略将 SARP 基因 dscF 以强组成型启动子整合入原生菌株染色体S. kanamyceticus::dscF。RT-qPCR 显示首条 NRPS 转录相对空载约120 倍诱导图 5DWelch t p0.0002LC-MS 可见 [MH]⁺ m/z 1415.6023 新峰。为确证归属用 CRISPR-Cas12a CAPTURE 克隆全 dsc BGC 入基因组精简宿主S. albusDel14粗提物出现钙依赖抑菌圈再在异宿主中引入 dscF 过表达Del14::dsc-dscF产量高于原生过表达株用于放大发酵。结构解析从 Del14::dsc-dscF 的 TSBHP-20 发酵液中经钙介导沉淀 反相 HPLC 纯化。HRESIMS m/z 1415.5865 [MH]⁺ 对应分子式 C₆₂H₈₇N₁₂O₂₆Δ1.13 ppm。1D/2D NMRCOSY/HSQC/HMBC定出 11 肽 N 端 2-羟基辛酰尾31 元大环由 Thr2 羟基与 Ile11 C 端羧基成内酯。肽序Ser¹-Thr²-3OHPhe³-Asp⁴-Asp⁵-Hpg⁶-Asp⁷-Gly⁸-Asn⁹-3MeGlu¹⁰-Ile¹¹与 antiSMASH 预测完全吻合。C3 Marfey’s 分析确认 D-Phe³、D-Hpg⁶、D-Asn⁹。作者将其命名为discomycin A。Figure 5 图示说明A dsc BGC 图谱对比 cdaB Del14::dsc 粗提物钙依赖抑菌圈C 原生/异宿过表达株 LC-MS 比对dscF 过表达均出新峰D NRPS qPCR-dscF 相对空载诱导约 120 倍E discomycin A 平面结构。结果6discomycin A 活性谱与机制肉汤微量稀释 MIC 显示 discomycin A 对革兰阳性病原菌S. aureusATCC25923、MRSA USA300、B. subtilis呈强 Ca²⁺ 依赖抑菌活性低微摩尔级 MIC革兰阴性A. baumanniiAb5075、E. coliΔtolC至最高测试浓度均无活性对 HCT-116 人结肠癌细胞无显著细胞毒细菌 vs 哺乳动物选择性良好。亚抑制浓度处理S. aureus后 N-乙酰胞壁酸五肽累积提示抑制细胞壁合成。Figure 6 图示说明AS. aureus在不同 [Ca²⁺] 下的平均 MICBB. subtilis同款CS. aureus裂解液 HPLC-HRMS监测 UDP-MurNAc-五肽 [M-2H]²⁻ m/z 573.6685阴性模式discomycin A 处理组累积DMSO 阴性对照不累积万古霉素阳性对照累积——佐证细胞壁靶点。结果7与 BiG-SCAPE、GATOR-GC 的基准对比CDA 家族扩增任务在 573 个Streptomyces基因组19,521 个 antiSMASH BGC、11 条 MIBiG CDA 参考的相同任务上横向比较BiG-SCAPE v2.02cutoff 0.4 时 precision 高但 recall 有限即便最宽松 cutoff 也未检出 dsc BGC且所有命中均为 DiscERN 命中的子集。GATOR-GC原始输出为大量 focal-window 比对无法直接给优先级列表经作者后处理脚本至少匹配 1 条 CDA 参考、取最佳参考得分得可比列表存在最优分数阈值但放宽阈值后假阳性激增。DiscERNF1 0.72BiG-SCAPE 最高 0.55、GATOR-GC 最高 0.49DiscERN 返回的命中中推定新肽骨架比例也高于两对照且 GATOR-GC 虽也检出 dsc BGC 但额外命中度不及 DiscERN。方法学参考用户定义BGC家族MIBiG编号或自备gb与json待扫描基因组antiSMASH 7.0注释输出pfam-vecPfam结构域向量化加centroid余弦blast-vec累计BLAST分向量加centroidblast-ranktop-k秩基in-family计数k-mer交集NRPS与PKS线性单体k-mer仅NRPS与PKS家族集成加置信度k等于1到4分级可选Pfam过滤基于家族共有Pfam输出按k分组的genbank平均成对距离矩阵Newick树候选优先级与异源表达或化合物分离关键可复用要点四算法互补定位Pfam-vec 抓架构但 CDA 类高多样性家族弱blast-rank 对碎片/串联伪影鲁棒k-mer 对完整 NRPS/PKS 精准但怕碎片——集成后短板互补。置信度可调k≥2 兼顾F1 0.89k≥3 近零假阳precision 0.98用户按是否舍得丢真阳性自选。实验闭环模板沉默 BGC → SARP 过表达激活原生→ CRISPR-Cas12a CAPTURE 全簇克隆 → 基因组精简异宿主S. albusDel14→ 异宿再叠 SARP 过表达提产这套流程可作为 DiscERN 命中后的标准验证管线。安装与调用Linux/MacOSXhttps://github.com/MaxMeta/DiscERN输入仅为 antiSMASH 标准输出门槛低。总结DiscERN 填补了以用户自定义 BGC 家族为种子做定向扩增这一假设驱动基因组挖掘场景的工具空白通过 Pfam 架构 序列同源 产物结构三维度的四算法集成在 3561 放线菌基因组的实战中达到 k≥2 时 F10.89、k≥3 时 precision0.98 的性能并在 CDA 家族扩增任务上优于 BiG-SCAPE 与 GATOR-GC。作者以S. kanamyceticus中一个沉默 CDA 类 BGC 为案例通过 SARP 调控过表达激活 S. albusDel14 异源表达分离鉴定了新型钙依赖脂肽discomycin A11 肽 2-羟基辛酰尾Ca²⁺ 依赖杀革兰阳性、细胞壁靶标、对人细胞无毒性完成了in silico预测 → 候选优先级 → 实验验证 → 新结构解析的完整闭环示范了计算工具与合成生物学衔接的工作流。工具的若干边界需在应用中留意1CDA 这类跨属高多样化、缺乏家族独有保守标记的家族召回偏弱2k-mer 模块依赖完整 NRPS/PKS 模块对碎片化 BGC 无效3整体性能受上游 antiSMASH 注释质量与参考家族定义完备度制约——参考集太小或偏向单一亚支时LOO recall 会高估。未来方向可包括引入结构预测如 Pfam 之外的域检测、扩展到更多 RiPP 子类、与 AI 产物结构预测e.g. Pfam 之外的新域耦合以提升对远端亲属的召回。对天然产物发现社区而言DiscERN 提供了一个低门槛、可调精度的前置过滤器能把3561 个基因组 6 万 BGC量级的数据压缩到几十个高置信候选显著降低后端异源表达与化合物分离的实验浪费。参考文献Owen, J. G., Woolly, E. F., Lai, H.-E., Woolner, V. H., Little, R. F. DiscERN: an automated genome mining tool for the discovery of evolutionarily related natural products.Nat Commun(2026). https://doi.org/10.1038/s41467-026-75491-xBlin, K. et al. antiSMASH 7.0: new and improved predictions for detection, regulation, chemical structures and visualisation.Nucleic Acids Res51, W46–W50 (2023).Navarro-Muñoz, J. C. et al. A computational framework to explore large-scale biosynthetic diversity.Nat Chem Biol16, 60–68 (2020).BiG-SCAPECedillo-Becerra, J. D. D. et al. Targeted genome mining with GATOR-GC maps the evolutionary landscape of biosynthetic diversity.Nucleic Acids Res53 (2025).GATOR-GCKautsar, S. A. et al. BiG-SLiCE: a highly scalable tool maps the diversity of 1.2 million biosynthetic gene clusters.Gigascience10 (2021).Zdouc, M. M. et al. MIBiG 4.0: advancing biosynthetic gene cluster curation through global collaboration.Nucleic Acids Res53, D678–D690 (2025).Lai, H.-E. et al. Calcium-Dependent Lipopeptide Antibiotics against Drug-Resistant Pathogens Discovered via Host-Dependent Heterologous Expression of a Cloned Biosynthetic Gene Cluster.Angew Chem Int Ede202410286 (2024).CDA 家族背景DiscERN 源码与安装https://github.com/MaxMeta/DiscERNDOI: 10.5281/zenodo.19689229