人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载roberta-large-ner-english 是一个基于 RoBERTa-large 在 CoNLL-2003 数据集上微调得到的英文命名实体识别NER模型该模型在邮件与聊天文本等非正式场景数据上表现突出。本文以 download_en.md 为核心完整讲解其模型文件清单、两种下载方式手动直链下载与 paddlenlp CLI 一键下载并结合仓库内 info.yaml 与 introduction_en.ipynb 给出加载与推理的实操示例帮助读者快速在 PaddleNLP 生态中拿到并运行该模型。模型概述根据 info.yaml 记录的信息该模型的元数据如下元数据字段值模型名称Jean-Baptiste/roberta-large-ner-english模型说明roberta-large-ner-english: model fine-tuned from roberta-large for NER task原始来源Hugging Face 上 Jean-Baptiste/roberta-large-ner-english已转换为飞桨PaddlePaddle模型格式任务类型自然语言处理 / Token 分类Token Classification微调数据集conll2003语言English开源协议mit从 introduction_en.ipynb 可以进一步确认模型特性该模型是英文 NER 模型从roberta-large在conll2003数据集上微调而来模型曾在邮件/聊天数据上进行过验证在这类非正式文本数据上表现优于其他模型尤其对不以大写字母开头的实体识别效果更好例如小写书写的人名、地名等。这些特性使其非常适合邮件签名提取、聊天记录中的实体抽取、客服工单文本分析等非正式英文文本场景。模型文件清单与说明download_en.md 给出了模型文件的完整清单模型总大小约为 1.32G。下载内容由 6 个文件组成文件名说明model_state.pdparams模型权重文件飞桨格式1.32G 的主体部分model_config.json模型结构配置文件如 hidden size、层数、注意力头数等vocab.jsonBPE 词汇表token 与 id 的映射merges.txtBPE merge 规则文件用于子词切分tokenizer_config.json分词器配置vocab.txt文本形式词表便于直接查看与调试其中vocab.json、merges.txt、vocab.txt、tokenizer_config.json四个文件共同构成 RoBERTa 风格的 BPE 分词器所需的完整组件model_config.json定义模型架构model_state.pdparams为可加载的飞桨权重。用户也可以查看同目录下的 download_cn.md 获取中文版说明。方式一手动下载模型文件download_en.md 提供了每个文件的直链可逐个下载也可以把链接拼接成一条wget命令批量拉取wget https://bj.bcebos.com/paddlenlp/models/community/Jean-Baptiste/roberta-large-ner-english/merges.txt wget https://bj.bcebos.com/paddlenlp/models/community/Jean-Baptiste/roberta-large-ner-english/model_config.json wget https://bj.bcebos.com/paddlenlp/models/community/Jean-Baptiste/roberta-large-ner-english/model_state.pdparams wget https://bj.bcebos.com/paddlenlp/models/community/Jean-Baptiste/roberta-large-ner-english/tokenizer_config.json wget https://bj.bcebos.com/paddlenlp/models/community/Jean-Baptiste/roberta-large-ner-english/vocab.json wget https://bj.bcebos.com/paddlenlp/models/community/Jean-Baptiste/roberta-large-ner-english/vocab.txt下载后请将 6 个文件保存在同一个目录中建议按模型名建目录后续加载模型时需要同时读取这些文件。方式二使用 paddlenlp CLI 一键下载推荐download_en.md 还提供了更简洁的官方 CLI 下载方式共两步第一步安装 / 升级 paddlenlppip install --upgrade paddlenlp第二步使用 paddlenlp download 命令下载模型paddlenlp download --cache-dir ./pretrained_models Jean-Baptiste/roberta-large-ner-english命令参数说明--cache-dir ./pretrained_models指定模型文件缓存到当前目录下的pretrained_models文件夹可按需改为其他路径Jean-Baptiste/roberta-large-ner-english模型的完整名称与 info.yaml 中name字段一致。执行完成后./pretrained_models/Jean-Baptiste/roberta-large-ner-english/目录下即包含上述 6 个模型文件可以直接供后续代码加载使用。加载与使用示例模型下载完成后可参考 introduction_en.ipynb 中的示例代码进行加载。该 Notebook 展示了两种加载路径一是先通过 CLI 下载到本地缓存目录后按本地路径加载二是直接使用AutoModel.from_pretrained让 PaddleNLP 自动完成模型的拉取与缓存。import paddle from paddlenlp.transformers import AutoModel # 方式 A加载已通过 paddlenlp download 下载到本地缓存目录的模型 model AutoModel.from_pretrained(Jean-Baptiste/roberta-large-ner-english) # 方式 B也可以直接加载本地目录例如上一步 --cache-dir 指定的路径 # model AutoModel.from_pretrained(./pretrained_models/Jean-Baptiste/roberta-large-ner-english) # 构造一段随机 token 输入示例演示前向计算 input_ids paddle.randint(100, 200, shape[1, 20]) print(model(input_ids))实际使用提示上述示例通过paddle.randint生成的是随机输入仅用于验证模型可正常加载和完成前向计算真实 NER 推理时需要使用AutoTokenizer加载vocab.json、merges.txt等分词器文件对文本进行切分并将 token id 送入模型再对最后一层输出做 Token 分类映射到实体标签由于该模型在邮件/聊天类非正式文本上表现较好可优先用于邮件签名检测、对话实体抽取等任务模型作者曾基于该模型的输出训练 LSTM 模型用于邮件签名检测见 Notebook 末尾说明。相关资源模型下载说明download_en.md / download_cn.md模型元信息info.yaml模型介绍与使用示例introduction_en.ipynb / introduction_cn.ipynb飞桨模型库整体指南guide_cn.md其中“模型下载”一节说明了本仓库模型文件下载模块的组织方式下载或使用过程中如遇到问题可前往 PaddleNLP 仓库提交 Issue 寻求支持详见 download_en.md 文末说明。赞分享人工智能深度学习计算机视觉NLP语音【免费下载链接】modelsOfficially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.项目地址https://gitcode.com/gh_mirrors/mo/models点击查看免费下载相关推荐PaddleNLP 模型中心下载与加载实战Jean-Baptiste/roberta-large-ner-english 英文命名实体识别模型PaddleNLP 模型中心下载与加载实战Jean Baptiste/roberta large ner english 英文命名实体识别模型 本指南以飞桨人工智能深度学习计算机视觉NLP语音Caddy 中间证书过期导致 HTTPS 报错完整排查与根治指南Caddy 中间证书过期导致 HTTPS 报错完整排查与根治指南 生产环境的 Caddy 在一次例行升级后突然挂了浏览器打开站点直接提示 NET::ER后端API网关网络命名实体识别实战Flair NER模型训练与应用命名实体识别实战Flair NER模型训练与应用 本文全面介绍了使用Flair框架进行命名实体识别 NER 的完整流程从序列标注基础、BIOES格式详解到NLP深度学习机器学习上一篇5步玩转SQL美化插件vscode-sql-beautify安装、格式化与避坑指南下一篇从 11 欧元到免费NoFences 桌面分区整理指南10 分钟告别凌乱桌面创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考