XTREME 数据集下载全攻略:一条命令获取 9 大任务全部数据

📅 2026/8/21 15:59:16
XTREME 数据集下载全攻略:一条命令获取 9 大任务全部数据
XTREME 数据集下载全攻略一条命令获取 9 大任务全部数据【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtremeXTREME 是评测跨语言模型泛化能力的权威多语言基准benchmark由 Google 与 DeepMind 联合发布覆盖 40 种类型多样的语言横跨 12 个语系和 9 大核心 NLP 任务是 mBERT、XLM、XLM-R 等预训练多语言模型评测的首选标准。对于想研究跨语言迁移的开发者来说XTREME 数据集下载是迈出实验第一步的关键。本文将带来一份保姆级攻略教你用一条命令快速获取 XNLI、PAWS-X、XQuAD、TyDiQA 等全部任务数据并避开下载过程中的常见坑。✍️XTREME benchmark 是什么9 大任务一次看懂XTREME 全称 Cross-lingual TRansfer Evaluation of Multilingual Encoders其核心思想是英语训练、多语言零样本测试模型先在英语标注数据上微调再直接应用到其余语言上检验跨语言泛化能力。9 大任务涵盖了 NLP 的主流范式具体如下任务类型覆盖语言一句话说明XNLI句子分类15 种跨语言自然语言推断PAWS-X句子分类7 种跨语言释义同义句识别UDPOS结构化预测29 种通用依赖词性标注PANXWikiann结构化预测40 种命名实体识别NERXQuAD问答11 种跨语言抽取式问答MLQA问答7 种多语言抽取式问答TyDiQA-GoldP问答9 种信息检索式问答BUCC 2018句子检索4 组平行语对平行句对挖掘Tatoeba句子检索30 种句子嵌入相似度检索这些任务在官方评测中会汇总为一个 Combined Score综合得分上图中的层级结构一目了然。XTREME 数据集下载前准备环境与仓库克隆动手下载前先确认环境满足两个硬性要求已安装 anaconda 且 Python 版本在 3.7 以上。随后按以下三步准备克隆仓库将项目代码拉取到本地git clone https://gitcode.com/gh_mirrors/xt/xtreme一键安装依赖项目提供了自动化的环境配置脚本运行install_tools.sh会自动创建名为 xtreme 的 conda 环境并安装 transformers、seqeval、jieba、kytea、pythainlp、sacremoses 等全部依赖环境清单见根目录conda-env.txt。bash install_tools.sh创建数据目录在项目根目录下新建download文件夹所有数据集都会下载到这里。最快下载方法一条命令搞定全部数据准备工作完成后XTREME 数据集下载就只剩两步。首先有一个唯一需要手动下载的例外PANXWikiann NER数据集需要你从 Amazon Cloud Drive 下载AmazonPhotos.zip并把它放进download目录——因为该数据集有访问限制脚本无法自动获取这一步千万别跳过否则脚本会提示缺少文件。接着运行核心下载脚本剩余 8 大数据集全部自动搞定bash scripts/download_data.sh这个脚本scripts/download_data.sh内部封装了每个数据集的下载与预处理逻辑XNLI 从 Facebook 官方地址拉取、PAWS-X 从 Google 存储桶获取、XQuAD/MLQA 自动切分语言文件、TyDiQA 自动按语言拆分为训练集……下载完成后还会自动调用utils_preprocess.py完成统一格式转换真正实现一条命令、即拿即用。9 大任务数据下载结果速查执行完成后download目录下会自动生成各任务的子目录结构如下子目录对应任务典型文件download/xnli/XNLItrain-en.tsv、test-ar.tsv 等download/pawsx/PAWS-Xtrain-en.tsv、test-zh.tsv 等download/udpos/UDPOStrain-en.tsv、test-zh.tsv 等download/panx/PANX NERtrain-en.tsv、test-ar.tsv 等download/xquad/XQuADxquad.ar.json 等download/mlqa/MLQA按语言拆分的 JSONdownload/tydiqa/TyDiQA按语言拆分的 train/dev JSONdownload/bucc2018/BUCCzh-en、ru-en 等平行语料download/tatoeba/Tatoeba各语言与英语的句子对另外脚本还会额外下载download/squad/问答任务的英语训练数据、download/xcopa/、download/siqa/、download/mewslix/、download/lareqa/等扩展任务数据供后续进阶实验使用。整个过程的下载日志会记录在download/download.log中。XTREME 数据下载常见问题与避坑指南新手在下载过程中最容易踩到这几个坑提前了解能省下不少时间PANX 数据缺失最常见的问题。AmazonPhotos.zip必须手动下载并放到download目录脚本检测不到该文件时会直接提示手动下载不会报错中断。网络中断导致下载失败脚本中的 wget 已启用-c断点续传参数网络不稳时重新运行脚本即可接着下载不必从头再来。Mewsli-X 下载较慢该任务需要 svn 导出且依赖 conda 环境脚本提示需要 5-10 分钟耐心等待即可不影响其他任务。为什么测试集没有标签这是刻意设计为防止实验时意外作弊数据泄露预处理阶段会移除测试集标签并打乱句子检索任务中测试句子的顺序这正是utils_preprocess.py的核心工作之一。下载后如何验证 XTREME 数据完整性数据下载完成后建议按以下两步验证查看下载日志检查download/download.log每个任务成功完成后都会写入Successfully downloaded data at ...记录逐条核对即可确认 9 大任务是否齐全。跑通评测流程项目在mock_test_data/中提供了完整的模拟数据labels存放标注答案、predictions存放预测结果示例可以先在模拟数据上验证评测脚本是否正常python evaluate.py --prediction_folder mock_test_data/predictions --label_folder mock_test_data/labels若输出各任务的 F1 / 准确率 / F1-EM 等指标说明数据与评测环境均已就绪可以放心开始训练基线模型了训练脚本见scripts/train.sh。进阶玩法XTREME-R 扩展数据集如果觉得 9 大任务还不够过瘾项目还支持 XTREME-R 扩展版本在原有 40 种语言基础上新增立陶宛语lt、波兰语pl、乌克兰语uk、沃洛夫语wo、罗马尼亚语ro5 种语言通过download_treebank逻辑自动下载对应版本的 UD 语料库。配合 XCOPA、S-IQA、Mewsli-X、LaReQA 等扩展任务可以进一步测试模型在更多语系上的表现。现在你已经掌握了 XTREME 数据集下载的完整流程准备环境 → 克隆仓库 → 手动补齐 PANX → 一条命令自动下载 → 日志验证。赶快动手让多语言模型在你的机器上跑起来吧【免费下载链接】xtremeXTREME is a benchmark for the evaluation of the cross-lingual generalization ability of pre-trained multilingual models that covers 40 typologically diverse languages and includes nine tasks.项目地址: https://gitcode.com/gh_mirrors/xt/xtreme创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考