第一篇:预训练模型——站在巨人的肩膀上

📅 2026/7/29 3:02:13
第一篇:预训练模型——站在巨人的肩膀上
第一篇预训练模型——站在巨人的肩膀上开篇在正式开始学习 Transformer 之前我们首先要回答一个根本问题我们说的模型到底是什么如果你曾经听说过BERT“GPT”T5这些名字你可能会困惑——它们之间有什么区别为什么有的能做分类有的能写文章有的还能翻译而这一切的起点都指向同一个概念预训练模型Pre-trained Model。什么是预训练模型传统的机器学习做法是针对每个新任务收集大量标注数据从零开始训练一个模型。这就像每次做菜都要从种菜开始——耗时耗力而且小数据集很难训练出好模型。预训练模型改变了这一切。它的思路是先在大规模通用数据上自学一遍掌握语言的基础知识然后再针对特定任务做微调Fine-tuning。传统做法 收集数据 → 从零训练 → 得到模型 预训练做法 加载预训练模型 → 少量数据微调 → 得到模型前者需要海量数据和大量算力后者只需要在预训练模型的基础上做最后一公里的调整。这就好比你已经读完了万卷书预训练现在只需要看几页资料就能回答特定问题微调。常见的预训练模型家族BERT 系列编码器 - bert-base-chinese中文场景的首选按字切分 - bert-base-uncased英文场景不区分大小写 - 擅长分类、命名实体识别、问答 GPT 系列解码器 - gpt2文本生成的开创者 - 擅长续写、对话、创作 T5 系列编码器-解码器 - t5-small统一框架所有任务都转成文本到文本 - 擅长翻译、摘要、分类一切皆生成为什么需要理解内部原理你可能会想“我用AutoModel.from_pretrained()一行代码就能加载模型为什么还要学内部原理”答案在于你不会开车也能开车但出了故障你只能拖去修理厂。理解原理的人能调参、能改进、能诊断问题。具体来说理解 Transformer 的内部机制能帮你诊断问题模型为什么在这个任务上表现差是分词问题位置编码问题还是注意力机制没学到关键模式选择模型BERT 适合分类GPT 适合生成T5 适合序列到序列任务——知道原理才能选对工具。调试代码当last_hidden_state的形状和你预期不符时你知道问题出在哪个环节。深入进阶LoRA、Prompt Tuning、Chain-of-Thought 等高级技术都建立在对 Transformer 基础机制的理解之上。预训练 微调的工作流程一个典型的预训练模型使用流程包含三步fromtransformersimportAutoTokenizer,AutoModel# 第一步加载分词器把文字变成数字tokenizerAutoTokenizer.from_pretrained(bert-base-chinese)# 第二步加载预训练模型加载已经学好的知识modelAutoModel.from_pretrained(bert-base-chinese)# 第三步推理让知识流动起来text我喜欢人工智能inputstokenizer(text,return_tensorspt)outputsmodel(**inputs)这三行代码背后发生了极其复杂的计算。接下来的 9 篇文章将逐层拆解这三行代码背后的每一个步骤。本篇小结预训练模型是在大规模数据上预先训练好的模型可以开箱即用或微调后用主流模型分为 BERT编码器、GPT解码器、T5编码器-解码器三大类理解 Transformer 内部原理是进阶大模型技术的必经之路使用流程异常简洁加载分词器 → 加载模型 → 推理下篇预告你输入的文字是如何变成模型能理解的数字的下一篇我们将打开分词器的黑盒看看我喜欢人工智能是如何变成一串数字的。