CD-HIT:让百万条生物序列一次跑完的聚类去重工具

📅 2026/8/22 21:04:56
CD-HIT:让百万条生物序列一次跑完的聚类去重工具
CD-HIT让百万条生物序列一次跑完的聚类去重工具【免费下载链接】cdhitAutomatically exported from code.google.com/p/cdhit项目地址: https://gitcode.com/gh_mirrors/cd/cdhitCD-HIT 是一款高速的生物序列聚类工具把一堆蛋白质或核酸序列丢给它它自动把相似的归成一堆、每堆留一个代表给你一份非冗余数据库。做蛋白库构建、转录本分析或微生物 OTU 分析的人不用再忍受两两比对BLAST 那种的龟速。C 写的开源免费几分钟编译完就能用。先说清楚它替你解决什么问题手里有 500 万条序列想找哪些是重复的。传统做法是两两比对计算量按 N 的平方涨根本跑不动。CD-HIT 的思路是分两步先按相似性阈值把序列粗分成小组组内再做精确比对。这样整体耗时从指数级降到接近线性百万级数据几小时出结果而且内存占用也小。原理就这一句话够用。它是启发式算法靠经验规则换取速度结果和两两比对基本一致社区用了十几年可信度不用担心。5 分钟跑通第一次聚类三步拉代码、编译、跑一条最小命令。git clone https://gitcode.com/gh_mirrors/cd/cdhit cd cdhit makemake完会得到一小组可执行文件cd-hit蛋白质、cd-hit-est核酸、cd-hit-2d两个库互比、cd-hit-454长读长等。系统缺 zlib 就加参数make zlibno或先装 zlib-devel。随便找个 fasta 文件usecases/Miseq-16S/目录里有可参考的示例数据执行./cd-hit -i test.fasta -o test_out -c 0.9 -n 5 -T 4几秒钟后得到两个文件test_out是非冗余序列test_out.clstr是聚类归属表记录了每条序列进的是哪个簇、谁是代表。翻一眼 .clstr 就知道结果长什么样了。5 个参数记住就够参数作用建议值-i / -o输入文件 / 输出前缀必填-c相似度阈值两条序列相似度超过它就算同类蛋白 0.9核酸 0.95-n快速筛选用的小词k-mer长度越长越严蛋白 5核酸 10-T并行线程数机器核心数-M内存上限MB0 为自动调16000 或 0-c 是同人判定线调参基本只动它0.9 松、簇大0.95 严、簇细。去冗余的常见取法是蛋白 0.9~0.95核酸 0.95~0.98。其他参数保持默认跑通了再研究。三个能落地的用法蛋白库去重。一条命令把 UniProt 这类大库瘦身后续同源性搜索、功能标注都基于减完的库做./cd-hit -i uniprot.fasta -o uniprot_nr -c 0.9 -n 5 -T 8 -M 16000两个库互比。cd-hit-2d回答新序列里哪些和已知库里的序列相似适合把新测的序列拿去做注释。用法和 cd-hit 相同多给一个参数指向第二个库即可。16S rRNA 做 OTU。微生物组方向的人看 usecases/Miseq-16S/ 目录里面有一套现成脚本能直接对 MiSeq 双端数据聚类、挑嵌合体序列还能借参考库顺手把 OTU 注释了。该目录的 README 写清了从拼接到出表的每一步照着抄就行。跑慢了、爆内存、簇数不对太慢。先查两件事-T 有没有吃满核数-M 是不是压得太低让程序反复换页百万级数据建议先过滤短序列和低复杂度序列实在不行分块跑。内存溢出被杀。降低 -M 到实际可用值或设 -M 0 让程序自动调节词表大小再不行就把文件切成几块分批聚类最后合并。簇太多或太少。几乎总是阈值的事簇碎成一片就降 -c簇稀稀拉拉就升 -c。结果合不合理可以用根目录的clstr_size_stat.pl跑一下簇大小分布一眼就能看出来。跑完之后怎么办.clstr 是核心产出根目录有一整套 Perl 小脚本伺候它clstr_rep.pl提取每个簇的代表序列clstr_size_stat.pl出大小分布clstr2tree.pl生成树文件。cd-hit-auxtools/里还有第二套工具进去 make 一次就能用。想深入细节翻 doc/ 目录的用户手册cdhit-user-guide。用到 CD-HIT 发文章时引用这一行即可Li W, Godzik A. CD-HIT: a fast program for clustering and comparing large sets of protein or nucleotide sequences. Bioinformatics, 2006.【免费下载链接】cdhitAutomatically exported from code.google.com/p/cdhit项目地址: https://gitcode.com/gh_mirrors/cd/cdhit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考