LLM的层数和参数分布 📅 2026/7/24 15:22:00 当前2025–2026主流 LLM 已高度收敛到Decoder-only Transformer但在超大参数区间普遍改用MoE混合专家 来把“总参数”和“激活参数”解耦。下面按「层数构成 → 参数分布规律 → 代表模型实测」三层说清楚。一、网络层数的典型构成Dense 与 MoE 通用骨架一个标准 Decoder-only Block以 LLaMA / Qwen / DeepSeek 系为例顺序是Input → Token Embedding → [ RMSNorm → Self-Attn(GQA/RoPE) → Res → RMSNorm → FFN/SwiGLU → Res ] × N → Final RMSNorm → LM Head通常与 Embedding 共享权重层数 L7B 级约 28–36 层70B 级约 80 层超大规模 60–126 层。Attention现代全系RoPE GQAKV head 数远小于 Q head 数DeepSeek 系用MLA低秩压缩 KV。FFNLLaMA-2 时代是 ReLU-FFNLLaMA-3/Qwen3/DeepSeek 全是SwiGLUgate/up/down 三个矩阵。MoE 变体把部分层的 SwiGLU 换成“多个专家 FFN Router”Attention 仍共享DeepSeek-V3 前 3 层是 Dense FFN后 58 层是 MoE256 路由 1 共享激活 81。经验区间hidden_dim d 与层数 L 大致满足参数≈12·L·d²Dense 近似所以 7B≈32×4096² 量级70B≈80×8192² 量级。二、参数分布“FFN 占 2/3” 是 Dense 模型的铁律对 Dense 模型LLaMA-3 / Qwen3-Dense / GPT-3 类以 LLaMA-7Bd4096, L32, I11008为例拆开看组件公式参数量占比Token EmbeddingV×d (32000×4096)128M~2%Attention32层L×4d²2.05B~30%FFN/SwiGLU32层L×3·d·I4.22B~63%RMSNorm 偏置可忽略0.5%1%LM Head与 Embedding 共享00%通用比例1B–400B Dense 都成立Embedding/LM Head1–3%大词表如 Qwen 151K 会略高Attention含 Q/K/V/O25–30%FFN/SwiGLU60–68%Norm 等1%之所以 FFN 占大头是因为经典 FFN 中间维I≈4dSwiGLU 下I≈8d/3单层 FFN 参数量3·d·I ≈ 8d²而 Attention 只有4d²比例稳定 2:1。三、MoE 模型总参数 vs 激活参数的分布彻底分化MoE 不改变“单层结构”只是把 FFN 复制成 E 个专家因此静态总参数里 FFN 占比飙到 85–95%但单 token 激活参数分布仍接近 Dense 比例。以DeepSeek-V3671B 总 / 37B 激活61 层d7168为例激活参数 37B 的内部切分Attention61 层共享~11.4B →31%路由专家58 层 × 激活 8 个~20.4B →56%共享专家58 层 × 1~2.5B → 7%Dense FFN前 3 层~1.2B → 3%LM Head~0.9B → 2.5%总参数 671B 里256×58 个路由专家权重几乎全是“躺着的 FFN”FFN 类权重占比90%Attention 只占 ~5%Embedding/LM Head ~1.5%。其他代表模型2025–2026 在役模型架构层数总/激活专家设置LLaMA-3 8BDense328B / 8B–LLaMA-3 70BDense8070B / 70BGQA-8LLaMA-3.1 405BDense126405B / 405BGQA-8, d16384Qwen3-32BDense6432B / 32BGQA-8Qwen3-235B-A22BMoE94235B / 22B128 专家, top-8DeepSeek-V3MoEMLA61671B / 37B2561 共享, top-8Mixtral 8×22BMoE56141B / 39B8 专家, top-2四、一句话抓重点层数小模型 28–36中模型 64–80超大 Dense 126超大 MoE 60 上下但每层更宽。构成RoPE GQA/MQA/MLA SwiGLU FFN RMSNormLM Head 与 Embedding 通常共享。Dense 参数分布FFN ≈ 2/3Attention ≈ 1/3Embedding 忽略不计。MoE 参数分布总参数里 FFN 专家占 90%但每 token 激活的 37B/22B 里FFN 仍约 60–65%和 Dense 推理时的计算分布一致。下面把上文里出现的英文单词、缩写、公式符号全部摊开成中文解释按出现顺序归类方便对照回看。五、模型与架构名LLMLarge Language Model大语言模型。Decoder-only Transformer只用“解码器”部分的 Transformer 架构GPT 系、Llama 系都是这种不像原始 Transformer 那样有编码器解码器。Dense稠密模型。每一层的所有参数对每个 token 都参与计算。MoEMixture of Experts混合专家。把 FFN 换成多个“专家”一个路由器每次只激活其中几个总参数大但激活参数小。LLaMA / LlamaMeta 出的开源模型系列Llama-3 等。Qwen阿里通义千问的模型系列Qwen3 等。DeepSeek深度求索公司的模型系列V3、R1 等。GPT-3OpenAI 早期稠密大模型。MixtralMistral AI 出的 MoE 模型8×22B 指 8 个专家每次用 2 个。六、层结构与算子缩写BlockTransformer 的一个重复单元一层。RMSNormRoot Mean Square Normalization均方根归一化比 LayerNorm 简单Llama/Qwen/DeepSeek 都用它。Self-AttnSelf-Attention自注意力。GQAGrouped Query Attention分组查询注意力。把 Q 分成几组共享同一份 K/V省显存如 GQA-8 8 组。MQAMulti-Query Attention多查询注意力极端版 GQA所有 Q 共享 1 份 K/V。MLAMulti-head Latent Attention多头潜在注意力DeepSeek 用把 K/V 压缩到低维潜空间再展开省内存。RoPERotary Position Embedding旋转位置编码用旋转矩阵把位置信息融进 Q/K。ResResidual残差连接输出 子层(x) x。FFNFeed-Forward Network前馈神经网络Transformer 里每个 Block 后半段那个“升维再降维”的网。SwiGLU一种 FFN 激活组合Swish GLU比老式 ReLU FFN 效果好内部有 gate/up/down 三个矩阵。ReLU-FFN用 ReLU 做激活的老式前馈网络Llama-2 之前常见。LM Head语言模型输出头把最后隐藏向量映射到词表概率权重常和 Embedding 共享。Embedding词嵌入矩阵把 token id 变成向量。RouterMoE 里的路由函数决定当前 token 送进哪几个专家。Expert专家MoE 中替代原 FFN 的其中一个前馈子网络。Shared Expert共享专家MoE 里所有 token 都会过的那个专家DeepSeek 用。Top-k路由器每次选 k 个专家top-8 选 8 个。七、公式与维度符号L层数number of layers。d / hidden_dim隐藏维度每个 token 向量的长度如 4096、8192。I / 中间维FFN 中间层维度经典 Transformer 里 I ≈ 4dSwiGLU 里 I ≈ 8d/3。V词表大小vocab size如 32000、151000。Q/K/V/OQuery / Key / Value / Output 四个注意力矩阵。KV headK 和 V 的头数GQA 下比 Q head 少。参数≈12·L·d²Dense 模型粗略估算式——Attn 占 4Ld²FFN(SwiGLU) 占 8Ld²合起来 12Ld²忽略 embedding 等。总参数 / 激活参数MoE 里“总参数”是所有专家权重加起来“激活参数”是单 token 实际经过的参数量决定推理算力。八、具体数字里的写法8×22BMixtral8 个专家每个专家约等于 22B 级别 FFN总 141B激活 39B。235B-A22BQwen3 MoE总 235B激活 22B。671B / 37BDeepSeek-V3总 671B激活 37B。2561 共享, top-8256 个路由专家 1 个共享专家每次路由选 8 个路由专家 必过共享专家。前 3 层 Dense后 58 层 MoEDeepSeek-V3 共 61 层浅层不用 MoE深层才切专家。