【机器学习】(36)—— 语言模型小结

📅 2026/8/10 11:05:28
【机器学习】(36)—— 语言模型小结
文章目录1. 前面几篇的主要内容2. 从「单个 ID」到「整段序列」3. 上下文能力对照4. 三条适配路径的记忆要点5. 提交前检查6. 汽车场景下的路径选择7. 和前面篇章的关系8. 常见误区9. 术语与延伸阅读10. 小结与下一主题摘要第 3335 篇分别讲了下一词建模、更长上下文下的 Transformer以及微调、蒸馏与提示三条业务适配路径。本文不引入新的核心公式把语言模型单元串成可对照的备忘什么时候上序列模型、上下文能力差在哪里、三条路径怎么选并预告下一主题——生产环境中的机器学习系统。1. 前面几篇的主要内容Embedding 处理的是单个离散 ID。车评、故障描述、工单备注则是有顺序的符号串。语言模型相关几篇补的就是「已知上文估计下一词或某一位置的词」以及怎样把大模型接到业务上。篇次大概讲了什么33token、上下文、N-gram 与 RNN下一词概率的直觉与局限34Transformer、自注意力、掩码预训练与生成更长上下文35提示工程、微调、蒸馏与离线缓存把基础模型接到应用贯穿示例仍是汽车短句填空、车评摘要、工单分类或固定字段抽取。换了序列模型或大模型之后划分、防泄漏、验证集选参与输出校验的要求没有换。若刚读完 3335本文可当复习若手头正好有文本任务也可先对照第 5 节的核对项再决定走表格基线、提示还是微调 / 蒸馏。2. 从「单个 ID」到「整段序列」第 2932 篇解决的是高基数类别怎么进模型。语言模型解决的是另一类输入token 序列。两者可以同时出现在一个系统里——品牌仍走 Embedding车评文本再走序列编码器或 LLM。常见推进顺序可以概括为明确任务与验收指标 → 能用表格 / Embedding 就先做基线 → 需要语言理解或生成时再上序列模型 / LLM → 先用提示试口径与格式 → 仍不稳再微调上线太贵 / 太慢再蒸馏或离线缓存与第 28、32 篇串讲相同的部分先切分再拟合测试集少碰生成内容要有规则或人工闸门。语言模型多出来的部分要决定上下文长度、采样或解码方式以及提示 / 微调 / 蒸馏哪一条路径更划算。纯数值油耗回归没有必要先上语言模型。自由文本多、格式要求高、或需要摘要与对话时再进入本单元的工具箱。也要注意边界Embedding 解决的是「离散 ID 怎么变成短向量」语言模型解决的是「这些 token 按顺序组合后下一个或某一位置更可能是什么」。前者可以没有语言生成后者几乎总要处理变长序列。把车评整段塞进词袋再接逻辑回归有时也能做基线但丢掉了顺序信息——是否够用仍然用验证集判断。3. 上下文能力对照第 33、34 篇的核心可以压成一张对照路线上下文怎么用常见瓶颈N-gram固定短窗口计数窗口一长组合爆炸未见 n-gram 稀疏RNN逐步更新隐状态长程依赖难保留并行训练不友好Transformer注意力一次汇聚多位置算力与上下文长度成本上升业务适配35提示 / 微调 / 蒸馏不解决「会不会胡编」本身需要校验可以把注意力看成「按相关性给上文各位置加权」而不是简单截取最近几个词。参数更大、上下文更长通常提高的是模式覆盖与长程组合能力并不自动等于事实正确。幻觉、偏见与格式漂移仍然要靠评估集与业务闸门约束。下一词目标在形式上仍是词表上的多类分布。记当前上文为c cc下一 token 为w ww语言模型优化的是P ( w ∣ c ) S o f t m a x ( f θ ( c ) ) P(w \mid c) \mathrm{Softmax}\big(f_\theta(c)\big)P(w∣c)Softmax(fθ​(c))符号含义c cc上下文前文 token或掩码任务中的可见部分w ww待预测的 tokenf θ f_\thetafθ​网络N-gram 特征、RNN 或 Transformer打出的词表 logitsθ \thetaθ模型参数N-gram 用计数近似同一目标RNN 与 Transformer 用可学习的f θ f_\thetafθ​逼近。训练目标一致差别主要在c cc能看多远、以及f θ f_\thetafθ​的表达能力。生成时常见的温度、top-k / top-p 等采样选择影响的是多样性与稳定性的权衡温度过高摘要口径容易飘压得过低又可能反复输出同一套套话。选型仍以验证集上的业务指标为准而不是以「读起来更像人」为唯一标准。4. 三条适配路径的记忆要点第 35 篇把基础大模型接到业务上归纳为三条路径。串讲时只保留决策要点路径是否改参数更适合提示工程否快速试口径、少样本约束格式微调是可参数高效领域黑话、固定字段仍不稳蒸馏训练更小的学生在线延迟 / 成本吃紧建议顺序可以按项目裁剪表格或 Embedding 基线 → 提示 输出校验 → 微调 → 蒸馏或离线缓存。离线推理适合可以预先计算的批量打标在线对话则更在意延迟与缓存命中率。微调通常保持同级参数量想变小靠的是蒸馏而不是「再微调一轮就会自动变小」。提示写得再长也不会更新权重它解决的是输入约束不是训练。教师模型更新后学生与缓存往往需要重训或刷新计划。否则线上仍在用过期口径验证集上的好看分数会慢慢失真。若把三条路径写成一句话提示负责「先对齐产品说法」微调负责「把说法写进参数」蒸馏与缓存负责「在可接受的延迟与成本下重复使用」。汽车售后里同一套口径可能同时出现在客服话术、工单标签与报表字段上——口径一变三条路径都要同步检查而不是只改其中一处。5. 提交前检查[ ] 任务是否必须用序列 / LLM表格或 Embedding 基线是否已做过 [ ] 上下文长度与输出格式要求是否写清楚 [ ] 是否先用提示跑通仍不稳再考虑微调 [ ] 微调有验证集监控过拟合与格式指标 [ ] 延迟 / 成本紧张时是否评估蒸馏或离线缓存 [ ] 生成内容有规则 / 人工闸门防止幻觉直接入业务 [ ] 评估集覆盖不同车型、不同表述避免只在单一话术上好看 [ ] 教师或提示模板更新后学生与缓存有刷新计划若提示已经能稳定抽出「品牌 / 故障件 / 严重度」等字段不必为了「用上微调」而微调。路径是手段验收指标才是目的。概念示意工单严重度先规则校验再决定是否调用模型ALLOWED{低,中,高}defparse_severity(text:str)-str|None:从模型输出里抽出严重度不在词表则视为失败。forlabelinALLOWED:iflabelintext:returnlabelreturnNonedefroute(ticket:str,llm_call):# 极短、已含明确等级时可以先走规则hitparse_severity(ticket)ifhit:returnhit,rulerawllm_call(ticket)labelparse_severity(raw)iflabelisNone:returnNone,need_humanreturnlabel,model这段代码不替代微调或蒸馏只提醒语言模型单元收尾时业务闸门与解析校验往往比再换一个更大的基座更靠近上线。6. 汽车场景下的路径选择需求优先尝试品牌、车型等表格字段Embedding 监督模型见第 32 篇试摘要口径、输出格式提示工程零样本 / 少样本固定字段、领域黑话仍然不稳微调可以先做参数高效微调要低延迟分类 / 打分上线教师打标 蒸馏学生可以预先计算的批量标签离线推理 缓存短句下一词直觉、教学演示N-gram / 小 RNN第 33 篇长上下文摘要、对话骨架Transformer / LLM第 34 篇表示与词表纪律见 【机器学习】32—— Embedding 串讲。序列侧骨架见 【机器学习】34—— 更大的语言模型适配细节见 【机器学习】35—— 微调、蒸馏与提示。同一工单流水线里也可以组合检索或规则先收窄候选提示或小模型做分类必要时再调用更大的生成模型写摘要。组合的目的是把贵的调用留在真正需要生成的步骤上。7. 和前面篇章的关系主题相关篇与语言模型单元的关系Embedding 与词表2932token 仍先映成稠密向量再进注意力或 RNN划分、泄漏、验证18、19、22、28提示模板、微调数据与词表纪律同样不能泄漏Softmax 与多类头27下一词就是词表上的多类分布过拟合与早停21、26、28微调数据少时更容易过拟合格式与话术神经网络前向 / 反向2325Transformer 仍是可微模块的堆叠与训练可以把语言模型看成「在序列上做多类预测」把第 35 篇看成「预测能力如何接到产品约束」。旧纪律仍然约束新模块没有验证集的微调、没有校验的生成、没有基线的大模型上线都会把问题从「准不准」变成「为什么说不清」。实践里也常见「先逻辑回归 / 浅层网络 文本特征基线再换 LLM」的对比。基线能说明任务难度与标注质量若基线已经很好上大模型的必要性会下降。8. 常见误区情况说明表格任务直接上 LLM往往更贵、更慢且未必更准以为上下文越长就一定更好成本上升噪声上下文也可能干扰以为微调会自动得到更小模型变小靠蒸馏以为多写提示等于在训练提示不改参数只看通顺不看事实与格式幻觉与字段缺失仍可能发生蒸馏只用硬标签软分数往往信息量更大忽略数据偏见预训练、微调与教师数据都会带偏见有了 LLM 就忽略 Embedding 基线结构化 ID 仍常更合适适用前提任务确实需要语言理解或生成并且团队可以维护校验、评估与刷新流程。把本单元当成「唯一正确架构」反而容易在油耗回归或纯 ID 特征上绕远路。9. 术语与延伸阅读术语含义语言模型估计序列中 token 概率的模型上下文预测某一位置时所依赖的上文或双向上下文N-gram用固定长度局部统计估计下一词Transformer以自注意力为核心、便于并行的序列架构基础 / 预训练 LLM大规模通识预训练得到的通用模型提示工程通过输入说明与例子约束输出微调用任务数据继续训练以适配应用蒸馏大教师教小学生对齐预测离线推理预先批量预测并缓存资源说明【机器学习】35—— 微调、蒸馏与提示三条适配路径【机器学习】34—— 更大的语言模型Transformer 与生成【机器学习】33—— 语言模型下一词与上下文【机器学习】32—— Embedding 串讲表格高基数表示【机器学习】28—— 神经网络小结验证与过拟合【机器学习】27—— 神经网络多分类Softmax 多类头10. 小结与下一主题语言模型这几篇可以概括为序列任务的核心是下一词或掩码位置的条件分布N-gram 与 RNN 给出短上下文台阶也暴露稀疏与长程瓶颈。Transformer 用注意力一次利用更长上下文更大的模型提高覆盖面不等于自动事实正确。接到业务时按「提示 → 微调 → 蒸馏 / 缓存」递进结构化字段继续尊重 Embedding 与表格基线。本单元到此先告一段落。后面讨论生产系统时会默认已经熟悉token 与上下文、注意力与生成风险以及提示 / 微调 / 蒸馏的分工。若这些内容还有些模糊可以把第 3335 篇按「下一词 → 更长上下文 → 业务适配」再过一遍。下一主题会进入生产环境中的机器学习系统模型代码往往只是整条链路的一小部分还要考虑静态 / 动态训练与推理、测试、缺陷模式与监控。汽车例子也会从「单个模型准不准」扩展到「数据怎么进、预测怎么出、坏了怎么被发现」。例如油耗模型是定期重训还是在线更新、工单分类是请求时推理还是批量预打标、摘要服务的延迟与缓存命中如何监控——这些问题不再只属于「选 N-gram 还是 Transformer」而属于整条生产链路的设计。语言模型单元给出的能力边界幻觉、成本、刷新会在生产系统篇里变成可检查的组件与告警项。系列导航上一篇【机器学习】35—— 微调、蒸馏与提示下一篇预告生产环境中的机器学习系统如果本篇对你有帮助欢迎点赞、收藏、关注博主机器学习专栏持续更新中下次更新不迷路。