【免费下载链接】DataArc-SynData-ToolkitSynthetic Data Generation Platform By DataArcTech项目地址https://gitcode.com/gh_mirrors/da/DataArc-SynData-Toolkit点击查看免费下载如果你正在寻找一个可扩展的合成数据生成平台DataArc SynData Toolkit 值得一看。它把从文档/网络/教师模型到训练数据的完整流程拆成了清晰的模块开发者只需要继承两个基类、注册两个工厂就能把自己的数据生成与重写策略无缝接入管线——这就是本文要讲的2步扩展法。一、先看懂架构合成数据生成管线长什么样整个管线由一个 YAML 配置文件驱动参考 configs/sdg.yaml核心执行逻辑在 pipeline.py 中运行流程如下阶段做什么对应模块① 任务执行从本地语料 / HuggingFace / 教师模型蒸馏中获取初始数据sdgsystem/tasks/② 初始评估用基础模型判断样本已解决 / 未解决sdgsystem/evaluation/③ 数据重写按难度对样本进行变易/变难改写sdgsystem/generation/rewriter.py④ 评分分流passn 打分后分为 solved / learnable / unsolved 三份数据dataset.py⑤ 翻译导出支持低资源语言如阿拉伯语翻译后落盘sdgsystem/translation/关键设计是工厂 抽象基类TaskExecutor根据配置中的local/web/distill键选择执行器见 task_executor.py而 BaseTaskExecutor 和 BaseSynthesisTaskExecutor 把生成过程固定为解析配置 → 准备语料 → 构造约束 → 获取数据 → 结构化五个步骤扩展时只需填空。二、第 1 步扩展你的数据生成任务想新增一种数据源比如从内部知识库生成按下面三个动作即可定义配置类在 configs/config.py 中继承 BaseTaskConfig声明你的任务需要的字段语料路径、采样参数等并实现from_dict完成 YAML 解析实现执行器继承 BaseSynthesisTaskExecutor实现 5 个抽象方法——task_parsing、prepare、construct_constraints、data_acquisition、structure_process。方法签名里都写明了输入输出契约照着实现即可注册到工厂在 TaskExecutor.get_executor 中加一个分支让 YAML 里新增的text.xxx配置键能路由到你的执行器。以本地文档合成为例PDF 先经 MinerU 解析切块再用 BM25 检索出与任务域相关的段落最后由 LLM 基于段落生成问答解析逻辑见 documents/parse.py检索见 documents/retrieve.py。官方给出的数学、金融、医学三个完整用例可对照阅读docs/USE_CASES.md、examples/mathematics/math.yaml、examples/finance/finance.yaml。数学域的合成演示中源文档就是一本普通习题集 PDF三、第 2 步自定义数据重写策略合成数据最大的价值在于可控难度默认策略 DifficultyAdjustRewriter 会根据基础模型的评估结果把模型解不出来的样本改难、解得出来的改易从而逼近可学习区间。想换一种重写思路比如按领域风格改写、增加多轮对话同样三步继承 BaseRewriteConfig声明新策略的参数继承 BaseRewriter实现_rewrite_batch文本与_rewrite_batch_with_images图像模态等批次方法在工厂方法 BaseRewriter.get_specific_rewriter 中按config.method返回你的实现——YAML 里rewrite:段写上新方法名即可生效。四、不改代码也能扩展配置驱动的软扩展在写任何代码之前先看看 YAML 里已预留的扩展点很多需求改配置就够了解析方法task.text.local.parsing.method默认 mineru检索方法task.text.local.retrieval.method与top_k默认 bm25答案比较evaluation.answer_comparison支持exact_match/semantic/llm_judge三选一解析逻辑见 config.py质量后处理postprocess.majority_voting支持多数投票的exact_match/semantic_clustering/llm_judge判票策略majority_voting.py并行加速全局n_workers控制 ParallelExecutor 的工作进程数断点续跑中间结果自动落盘到 buffer失败后从上一成功阶段恢复省去 token 开销buffer.py例如只换判题方式把exact_match换成llm_judge即可一行配置、零代码改动。五、下一步合成数据直通 SFT / GRPO 训练合成只是闭环的前半程。导出的 solved / learnable / unsolved 三份 JSONL 可直接喂给内置的 verl 后训练模块sdgsystem/trainer/支持 SFT 与 GRPO配置示例 configs/sft.yaml、configs/grpo.yaml再配合 DeepEval 评估模块sdgsystem/deepeval/验证训练收益完成合成 → 训练 → 评估的完整闭环。结语一条小步快跑的扩展路线回顾一下本文的 2 步扩展法继承 注册BaseTaskConfig/BaseTaskExecutor扩展数据生成BaseRewriteConfig/BaseRewriter扩展数据重写先配置、后代码优先利用 YAML 中预留的 method 开关确有不满足时再下沉到模块级继承。管线的模块化设计见 pipeline.py 中对各模块的组装方式保证了你的扩展不会牵一发动全身——这正是 DataArc SynData Toolkit 作为开发者平台的核心价值。更多细节可查阅 README.md 与依赖说明 docs/DEPENDENCIES.md。赞分享【免费下载链接】DataArc-SynData-ToolkitSynthetic Data Generation Platform By DataArcTech项目地址https://gitcode.com/gh_mirrors/da/DataArc-SynData-Toolkit点击查看免费下载相关推荐大模型合成数据终极指南一文读懂一站式数据生成平台DataArc SynData Toolkit大模型合成数据终极指南一文读懂一站式数据生成平台DataArc SynData Toolkit DataArc SynData Toolkit 是由 Data如何用DataArc SynData Toolkit生成小语种数据集多语言合成数据完整教程阿拉伯语实战如何用DataArc SynData Toolkit生成小语种数据集多语言合成数据完整教程阿拉伯语实战 DataArc SynData Toolkit 是DataArc SynData Toolkit 配置文件 sdg.yaml 全字段详解新手10分钟看懂数据合成每一步DataArc SynData Toolkit 配置文件 sdg.yaml 全字段详解新手10分钟看懂数据合成每一步 DataArc SynData Tool创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考