FinBERT2:320亿Token金融语料炼成的中文金融NLP预训练模型,快速上手指南

📅 2026/8/23 17:39:18
FinBERT2:320亿Token金融语料炼成的中文金融NLP预训练模型,快速上手指南
FinBERT2320亿Token金融语料炼成的中文金融NLP预训练模型快速上手指南【免费下载链接】FinBERT项目地址: https://gitcode.com/gh_mirrors/finb/FinBERT如果你要做中文金融文本的分类、情绪判断或文档检索这篇文章用 FinBERT2 的官方实测数据讲清它解决什么问题、凭什么做得好、如何用两条命令跑起来。通用模型处理金融文本你大概率会踩这 3 个坑用通用大模型给金融新闻做分类时你会发现净息差业绩预告这类词只是字面模型抓不住业务含义做情绪分析时谨慎乐观和强烈看多的强度差异分不开结果还得人工校对。建文档检索系统时满篇行业术语的研报常常检索不准通用大模型的推理成本又高生产环境里大批量、低延迟地调用很难撑住。项目定位一个 320 亿 Token 金融语料预训练的中文金融编码器FinBERT2 是熵简科技 AI Lab 发布的、面向中文金融领域的 BERT 架构预训练语言模型。核心做法有三点320亿Token级中文金融语料覆盖金融分析师研报、上市公司官方公告与可靠财经新闻预训练规模是第一代的 10 倍两阶段预训练先字词级金融整词掩码下一句预测再任务级研报行业分类、金融实体识别用监督任务让模型学金融先验知识下游任务套件自带 Fin-Labeler 分类、Fin-Retriever 检索、Fin-Topicmodel 主题建模三个工具配套 5 个分类数据集与 FIR-Bench 检索评测集。核心能力拆解分类、检索、继续预训练金融文本分类用 Fin-Labeler 微调情绪与行业分类能做什么在你自己的标注数据上微调 base 预训练模型完成情绪分类、行业分类等任务项目自带情感数据集 SC_2train/test 两份 CSV可直接跑通示例。好在哪官方评测中FinBERT 情绪分类 F1 达 0.895、行业分类 0.951比 BERT、BERT-wwm、RoBERTa-wwm-ext 三个通用模型高 2~5.7 个百分点。金融向量检索Fin-Retriever 充当 RAG 检索层能做什么对比学习微调的嵌入模型作为 RAG检索增强生成系统的检索组件FIR-Bench 提供单文档、多文档、研报、公告、指标 5 类金融检索评测集。好在哪五个金融检索任务上比 BGE-base-zh 平均 6.8%比 OpenAI 的 text-embedding-3-large 平均 4.2%能把难负例压到正例之后。继续预训练把自己的金融语料喂给模型能做什么FinBERT2/pretrain/目录带增量预训练脚本run_mlm.sh可在自有金融语料上继续做 MLM掩码语言模型即预测被遮住的词训练。好在哪相当于给模型进修你行业里的专有术语和表达习惯被吸收进先验知识下游任务直接受益。效果对比数据四类金融任务的 F1-score 实测任务BERTBERT-wwmRoBERTa-wwm-extFinBERT金融短讯类型分类0.8670.8670.8770.895金融短讯行业分类0.9390.9320.9380.951金融情绪分类0.8620.8500.8670.895公司名称实体识别0.8650.8790.8940.922人物名称实体识别0.8870.8870.8910.917语料换成金融领域后平均领先通用模型 2~5.7 个百分点第二代模型在金融分类任务上还平均领先 GPT-4-turbo、Claude 3.5 Sonnet、Qwen2 等主流大语言模型 9.7%~12.3%。快速上手两条命令跑通金融情感分类git clone https://gitcode.com/gh_mirrors/finb/FinBERTcd Fin-labeler bash runclassify.sh第一条拉源码第二条基于 FinBERT2-base 预训练模型微调情感分类训完在同目录运行python sequence_inference.py即可推理。做检索去Fin-retriever/做研报标题主题建模去Fin-Topicmodel/。应用场景谁在什么环节用舆情监控与新闻打标内容与舆情团队对财经短讯做行业与类型分类自动打上 29 个中信一级行业标签替代人工审读。研报/公告智能搜索投研机构用检索模型在文档库上建 RAG 层加息对科技股的影响这类查询能精准命中相关研报。市场情绪监控量化与投研团队微调情绪分类输出情绪极性与强度直接进选股和风控流水线。选择建议什么场景值得引入✅任务是中文金融情绪、行业分类、实体识别、研报检索四类任务都有官方评测数据背书✅生产部署成本敏感BERT 架构双向编码器推理开销小适合大批量、低延迟场景✅RAG 系统需要懂金融检索模型在五类检索任务上平均 6.8%✅手里有自己的金融语料可继续预训练进一步拉小领域差距完整代码、数据集与预训练模型都在项目仓库git clone 地址https://gitcode.com/gh_mirrors/finb/FinBERT【免费下载链接】FinBERT项目地址: https://gitcode.com/gh_mirrors/finb/FinBERT创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考