大规模语言模型(LLM)涌现能力(Emergent Abilities)通常指什么?在什么规模下出现?

📅 2026/8/9 17:21:26
大规模语言模型(LLM)涌现能力(Emergent Abilities)通常指什么?在什么规模下出现?
大规模语言模型的涌现能力一句话定义涌现能力是指模型在规模较小时不存在但当规模增长到某个临界点后突然出现的能力。即量变引起质变——小模型完全做不到大模型突然就会了。一、什么是涌现能力核心特征模型规模 → ╱ 性能骤升 ╱──────── ────────── ────────── 随机水平 ──────────────────────────────────────────→ 临界点 (10^22 FLOPs附近)特征说明非连续性性能不是随规模平滑提升而是在某个临界点骤然跃升不可预测性仅观察小模型趋势无法预测大模型会出现什么能力规模依赖只有参数量/计算量/数据量达到足够大时才出现与普通能力可预测能力的对比涌现能力 (Emergent): 3B模型: 接近随机猜测 (0%) 10B模型: 接近随机猜测 (0%) 60B模型: 接近随机猜测 (5%) 175B模型: 突然达到 60% ← 骤变 可预测能力 (Predictable): 3B模型: 20% 10B模型: 35% 60B模型: 55% 175B模型: 70% ← 平滑增长二、涌现能力的典型表现1. 少样本/零样本学习小模型: 需要大量标注数据微调才能做新任务 大模型: 只需在 prompt 中给几个例子就能做新任务 示例 (3-shot): 输入: 英→法: good → bon / bad → mauvais / big → grand / cat → ? GPT-3 175B: chat ✅ 突然会了 GPT-3 1.3B: ??? ❌ 不会2. 思维链推理Prompt: 一个商店有15个苹果卖了8个又进了6个还剩多少请一步步想。 6.7B模型: 13错误直接猜答案 175B模型: 15 - 8 7, 7 6 13, 还剩13个 ✅ 逐步推理 → 思维链能力在 ~60B 参数附近涌现3. 指令遵循Prompt: 把下面句子翻译成英文只输出翻译结果不要解释。 小模型: 可能输出翻译解释多余内容 大模型: 严格遵循指令只输出翻译结果 → 指令遵循能力在 ~10B-50B 参数附近涌现4. 其他涌现能力能力描述大致涌现规模多步算术推理3位数加减法、多步运算~60B逻辑推理因果推断、条件推理~60B代码生成编写可运行的程序~10B长文本理解跨段落信息整合~30B元认知知道自己知道什么/不知道什么~60B间接推理通过中间步骤推导答案~100B符号操作模式识别、形式语言处理~60B三、在什么规模下出现三个维度的规模涌现能力与三个规模因素相关① 参数量 ② 训练计算量 ③ 训练数据量经验性临界点规模维度临界范围来源参数量10B ~ 100B多数涌现能力在此区间出现训练计算量10^22 ~ 10^23 FLOPsWei et al. (2022) 的系统研究训练数据数百B tokens与参数量配合具体能力的涌现规模能力 涌现规模(参数量) ───────────────────────────────────────────── 少样本翻译 ~6.7B 多步算术 (3-digit) ~60B 思维链推理 ~60B 逻辑推理 (LogiQA) ~60B 符号操作 (翻转/重复) ~60B 间接推理 ~100B 复杂指令遵循 ~10B-50B 代码理解与生成 ~10BWei et al. (2022) 的关键发现Google 的系统研究“Emergent Abilities of Large Language Models”测试了 8 类任务所有涌现能力的共同特征: - 在计算量 10^22 FLOPs 时性能 ≈ 随机水平 - 在计算量 10^22 FLOPs 时性能突然跃升 10^22 FLOPs 大致对应: 参数量 ~ 60BChinchilla 缩放定律下 或 GPT-3 级别的训练规模四、为什么会出现涌现能力目前的主流解释假说核心观点支持证据任务度量假说不是能力突然出现而是评估指标不连续如精确匹配换成连续指标后曲线变平滑部分实验支持组合复杂度假说复杂任务需要多步组合推理每步都有成功率小模型每步成功率低→组合后趋近于零大模型每步提升→组合后骤升数学模型可解释骤变子任务解锁假说大模型学会了任务所需的子能力如符号操作、多步记忆这些子能力有各自的涌现点消融实验部分支持相变假说类比物理学相变模型规模达到临界点后信息处理方式发生质变理论性推测组合复杂度假说的直觉一个需要4步推理的任务每步准确率 p: 小模型: p 0.55 → 4步全对概率 0.55^4 9.2% ≈ 随机 大模型: p 0.85 → 4步全对概率 0.85^4 52.2% 突然可用 每步只提升30%但组合后效果骤变 → 看起来像涌现五、涌现能力的争议涌现是幻觉的观点2023 年 Stanford 研究Schaeffer et al.提出论点: 涌现能力可能是评估指标的假象 - 使用精确匹配(exact match)等非线性指标 → 性能看起来是骤变 - 换成连续指标(如 token 级 BLEU、Brier score) → 曲线变平滑 - 小模型其实也在学只是没达到精确匹配的阈值 反例: 思维链推理等能力即使换连续指标仍有非连续性当前共识涌现能力可能不是突然从零到有但: ① 大规模模型确实展现出小模型不具备的复杂推理能力 ② 规模增长带来的性能提升在某些任务上确实是非线性的 ③ 涌现作为一个描述性概念仍然有用但不应神秘化六、实践意义1. 模型选型简单任务 (分类、抽取): 1B-7B 足够 中等任务 (摘要、翻译): 7B-30B 复杂推理 (多步推理、代码): 60B 或 100B2. 小模型能否获得涌现能力当前研究方向的尝试: ① 蒸馏: 用大模型的输出训练小模型 → 部分能力可迁移 ② 高质量数据: 精选训练数据提升小模型表现 ③ 推理时计算: 让小模型多生成/多搜索(如 self-consistency) → 补偿参数不足 ④ 思维链微调: 专门用 CoT 数据训练 → 小模型也能逐步推理3. 缩放定律的指导Chinchilla 缩放定律: 最优训练 参数量与数据量按比例增长 60B 参数模型应配 ~1.2T tokens 数据 → 涌现不只看参数量数据质量和数量同样关键 → 一个数据充足的 60B 模型可能优于数据不足的 175B 模型总结涌现能力 模型规模超过临界点后突然出现的复杂能力 什么能力: 少样本学习、思维链推理、指令遵循、多步算术、代码生成等 什么规模: 参数量 ~10B-100B计算量 ~10^22 FLOPs 附近 为什么: 组合复杂度、子任务解锁、评估指标非线性等因素共同作用 争议: 部分可能是评估指标的假象但复杂推理能力的跃升是真实的 一句话: 涌现能力说明规模本身就是一种质变—— 不是所有能力都能通过小模型技巧获得有些能力确实需要足够的规模。