如何搭建自己的HuggingFace镜像站:aliendao model_mirror.py爬虫+aria2c 16并发下载完整指南

📅 2026/8/22 13:51:41
如何搭建自己的HuggingFace镜像站:aliendao model_mirror.py爬虫+aria2c 16并发下载完整指南
如何搭建自己的HuggingFace镜像站aliendao model_mirror.py爬虫aria2c 16并发下载完整指南【免费下载链接】aliendaohuggingface mirror download项目地址: https://gitcode.com/gh_mirrors/al/aliendao想搭建自己的 HuggingFace 镜像站吗开源项目aliendaoHuggingFace 镜像下载工具正是为你准备的方案。它内置model_mirror.py爬虫能自动抓取任意镜像源的文件列表再调用 aria2c 以 16 并发断点续传批量下载大模型文件轻松解决直连 HuggingFace 速度慢、频繁断线、反复重试的痛点。本教程面向新手带你从零完成环境安装、爬虫镜像与批量下载全流程。 为什么需要 HuggingFace 模型镜像下载大模型动辄几十 GB 的权重文件时直连官方源常见三大问题速度慢带宽受限一个 7B 模型要等几个小时频繁断线下载中断后从零开始反复重试手动盯着任务耗费大量时间aliendao 的核心思路是爬虫抓取文件清单 aria2c 多并发下载 断点续传把人工盯下载变成一键无人值守。 一键安装步骤3 步完成环境准备第 1 步安装 Python 虚拟环境推荐用 Anaconda 管理环境Linux 可从官方渠道下载安装脚本。第 2 步获取 aliendao 项目git clone https://gitcode.com/gh_mirrors/al/aliendao cd aliendao第 3 步创建虚拟环境并安装依赖conda create -n aliendao python3.10 -y conda activate aliendao pip install -r requirements.txt -i https://pypi.mirrors.ustc.edu.cn/simple --trusted-hostpypi.mirrors.ustc.edu.cn依赖非常轻量requirements.txt 中只有huggingface_hub镜像爬虫还需要beautifulsoup4pip install beautifulsoup4 原理解读model_mirror.py 爬虫如何工作这是搭建镜像站的核心整个流程分三步代码位于 model_mirror.py步骤函数作用1️⃣ 爬取文件清单get_links()用 requests BeautifulSoup 递归解析镜像源的目录页收集所有文件链接2️⃣ 生成下载列表write_listfiles()把链接和保存路径写入files.txtaria2c 输入文件3️⃣ 并发下载download_files()调用 aria2c 执行 16 并发、断点续传下载关键命令就藏在这一行model_mirror.pyaria2c -x 16 -c -d 下载目录 --input-filefiles.txt-x 16每个文件使用16 个连接并发下载速度提升明显-c开启断点续传中断后重跑接着下--input-file批量读取爬虫生成的files.txt此外下载过程中会自动在目标目录写入~incomplete.txt提示文件model_mirror.py下载完成后删除——你可以靠这个文件判断镜像是否完整。 快速上手镜像下载一个模型镜像下载模型假设你的镜像源或任意支持目录浏览的下载站是https://xxx.com# 镜像下载模型 python model_mirror.py --root https://xxx.com --repo_id Open-Orca/LlongOrca-7B-16k # 镜像下载数据集 python model_mirror.py --root https://xxx.com --repo_id tatsu-lab/alpaca --repo_type dataset文件会统一保存到dataroot/models/模型ID或dataroot/datasets/数据集ID目录model_mirror.py目录结构清晰方便后续加载。直接下载非镜像模式如果不想搭建镜像也可以直接用官方源下载内置自动重试机制失败后每 60 秒重试一次最多重试一天见 download_model_retry()python model_download.py --repo_id baichuan-inc/Baichuan-7B python model_download.py --repo_id tatsu-lab/alpaca --repo_type dataset完整命令行参数说明见 model_download.py。 批量镜像batch_download.py 无人值守要一次镜像多个模型用 batch_download.py 即可实现无人值守批量下载创建model_list.txt每行写一个模型 ID已完成的行以*开头标记执行python batch_download.py --listfile model_list.txt --mirror_root https://xxx.com它会逐个处理清单中的模型完成后自动打上*标记writeFlagToList()下次运行自动跳过非常适合放在服务器上长期挂机运行。 下载完成后如何加载模型模型下载完毕后把AutoModel.from_pretrained的路径指向本地文件夹即可示例见 dataroot/README.mdmodel_path ./dataroot/models/你的模型ID # 指向本地文件夹 tokenizer AutoTokenizer.from_pretrained(model_path, trust_remote_codeTrue) model AutoModel.from_pretrained(model_path, trust_remote_codeTrue)❓ 常见问题搭建 HuggingFace 镜像站避坑指南Q1提示aria2c不是内部命令先安装 aria2sudo apt install aria2Debian/Ubuntu或yum install aria2CentOS再确认aria2c在 PATH 中。Q2目标目录里有~incomplete.txt文件说明该模型还在同步/下载中镜像暂不可用等文件消失即可。Q3下载中断了怎么办直接重新运行同一条命令即可aria2c 的-c参数会基于.aria2控制文件自动续传无需从头开始。Q4数据集和模型的参数区别默认下载模型--repo_type model下载数据集时追加--repo_type dataset两者存放目录分别为dataroot/models/和dataroot/datasets/。Q5爬虫抓不到文件get_links()要求--root地址以/结尾且支持目录浏览model_mirror.py请检查 URL 格式。 项目文件速查表文件说明model_mirror.py核心爬虫抓取镜像文件清单 aria2c 16 并发下载model_download.py官方源/镜像下载器支持断点续传与自动重试batch_download.py批量任务下载支持清单标记与断点跳过requirements.txtPython 依赖清单dataroot/README.md模型下载与加载使用说明dataroot/ollama/install.shOllama 快速安装脚本e/403.html镜像站访问错误的页面模板示例✅ 总结只需 3 步就能拥有自己的 HuggingFace 镜像下载能力安装环境 → 运行model_mirror.py爬虫 → aria2c 16 并发断点续传。配合batch_download.py批量清单即可在服务器上搭建一个无人值守的模型镜像站彻底告别慢速下载与反复重试。【免费下载链接】aliendaohuggingface mirror download项目地址: https://gitcode.com/gh_mirrors/al/aliendao创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考